{"id":"mb-20260902-d843eb","account":"mubei","brand":"","title":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚","summary":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚","body":"给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚。\n最新的实验砸出了一个完全相反的窟窿。\n拿到标准答案之后，AI 裁判不仅没有变敏锐，反而瞬间瞎了一半。\n为什么给了一张完美的答案纸，AI 反而抓不出推导里的致命硬伤？\n这套被寄予厚望的「思维链监控」，到底在监控什么？\n2026 年 9 月，杜伦大学 Will Yeadon 团队在 arXiv 发表了一项研究（arXiv:2609.00264）。\n他们拿《人类最后的考试》（Humanity's Last Exam）里的 79 道前沿物理难题做实验。\n三个顶尖模型生成了 237 份分步解答。\n物理学家标注、模型辩论加匿名裁决，从中筛出了 24 份极其特殊的样本：\n最终答案完全正确，但推导过程里藏着真实的物理硬伤。\n这就是检验监督能力的试金石：\n当结论碰巧对了，裁判能不能看出推导在胡扯？\n8 个大模型被拉来充当安全裁判。\n在看不到答案的盲审状态下，裁判揪出推导错误的概率是 52.1%。\n可一旦把经过验证的标准答案递给裁判，这个抓出率不仅没涨，反而跌到了 43.8%。\n8 个 AI 裁判，在所有测试里表现出完全一致的迟钝。\n如果选手的最终答案算错了，裁判拿到标准答案后，报错率会从 65.3% 飙升到 95.1%。\n在裁判盲审放行之后，再把标准答案递过去：\n答案算错的样本，93.8% 会被裁判重新判定为错误。\n而答案蒙对、推导全错的样本，能被重新抓出来的只有 18.0%。\n这台机器暴露出来的核心机制，叫「结果一致性比对」。\n所谓的思维链监控，根本没有在独立核验逻辑。\n裁判看到正确答案的瞬间，算力就自动滑向了逆向倒推：\n只要最后的数字对得上，前面哪怕写了一段荒谬的推导，它也会自动脑补出合理的解释一路放行。\n只有在最终数字对不上的时候，它才会回过头去挑刺。\n它没有在审查推导过程。\n它只是在核对收据。\n在安全领域，这被称为一种温和的奖励作弊：\n一个看似合理的产出，根本无法证明生产它的逻辑是可靠的。\n现在的 AI 安全评估，大量依赖已知答案来测试裁判的监控能力。\n这种测试给出了一个危险的合规幻觉。\n当所有人都以为裁判在替人类盯紧 AI 的思考过程。\n裁判其实只是站在终点线，看了一眼记分牌。\n如果连已知答案的物理题，都能靠一个碰巧正确的数字把裁判骗过去。\n未来面对那些人类自己都不知道答案的前沿推理，这套监控还能防住什么？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-09-02 12:19:59","created_at":"2026-09-02 12:19:59"}