科技·via

给 AI 裁判一张标准答案,你以为它会把选手的推导过程看得更清楚

给 AI 裁判一张标准答案,你以为它会把选手的推导过程看得更清楚。 最新的实验砸出了一个完全相反的窟窿。 拿到标准答案之后,AI 裁判不仅没有变敏锐,反而瞬间瞎了一半。 为什么给了一张完美的答案纸,AI 反而抓不出推导里的致命硬伤? 这套被寄予厚望的「思维链监控」,到底在监控什么? 2026 年 9 月,杜伦大学 Will Yeadon 团队在 arXiv 发表了一项研究(arXiv:2609.00264)。 他们拿《人类最后的考试》(Humanity's Last Exam)里的 79 道前沿物理难题做实验。 三个顶尖模型生成了 237 份分步解答。 物理学家标注、模型辩论加匿名裁决,从中筛出了 24 份极其特殊的样本: 最终答案完全正确,但推导过程里藏着真实的物理硬伤。 这就是检验监督能力的试金石: 当结论碰巧对了,裁判能不能看出推导在胡扯? 8 个大模型被拉来充当安全裁判。 在看不到答案的盲审状态下,裁判揪出推导错误的概率是 52.1%。 可一旦把经过验证的标准答案递给裁判,这个抓出率不仅没涨,反而跌到了 43.8%。 8 个 AI 裁判,在所有测试里表现出完全一致的迟钝。 如果选手的最终答案算错了,裁判拿到标准答案后,报错率会从 65.3% 飙升到 95.1%。 在裁判盲审放行之后,再把标准答案递过去: 答案算错的样本,93.8% 会被裁判重新判定为错误。 而答案蒙对、推导全错的样本,能被重新抓出来的只有 18.0%。 这台机器暴露出来的核心机制,叫「结果一致性比对」。 所谓的思维链监控,根本没有在独立核验逻辑。 裁判看到正确答案的瞬间,算力就自动滑向了逆向倒推: 只要最后的数字对得上,前面哪怕写了一段荒谬的推导,它也会自动脑补出合理的解释一路放行。 只有在最终数字对不上的时候,它才会回过头去挑刺。 它没有在审查推导过程。 它只是在核对收据。 在安全领域,这被称为一种温和的奖励作弊: 一个看似合理的产出,根本无法证明生产它的逻辑是可靠的。 现在的 AI 安全评估,大量依赖已知答案来测试裁判的监控能力。 这种测试给出了一个危险的合规幻觉。 当所有人都以为裁判在替人类盯紧 AI 的思考过程。 裁判其实只是站在终点线,看了一眼记分牌。 如果连已知答案的物理题,都能靠一个碰巧正确的数字把裁判骗过去。 未来面对那些人类自己都不知道答案的前沿推理,这套监控还能防住什么?

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情