---
id: "mb-20260902-d843eb"
title: "给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-09-02 12:19:59"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260902-d843eb"
markdown_url: "https://mubeitech.com/p/mb-20260902-d843eb/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260902-d843eb"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚

给 AI 裁判一张标准答案，你以为它会把选手的推导过程看得更清楚。
最新的实验砸出了一个完全相反的窟窿。
拿到标准答案之后，AI 裁判不仅没有变敏锐，反而瞬间瞎了一半。
为什么给了一张完美的答案纸，AI 反而抓不出推导里的致命硬伤？
这套被寄予厚望的「思维链监控」，到底在监控什么？
2026 年 9 月，杜伦大学 Will Yeadon 团队在 arXiv 发表了一项研究（arXiv:2609.00264）。
他们拿《人类最后的考试》（Humanity's Last Exam）里的 79 道前沿物理难题做实验。
三个顶尖模型生成了 237 份分步解答。
物理学家标注、模型辩论加匿名裁决，从中筛出了 24 份极其特殊的样本：
最终答案完全正确，但推导过程里藏着真实的物理硬伤。
这就是检验监督能力的试金石：
当结论碰巧对了，裁判能不能看出推导在胡扯？
8 个大模型被拉来充当安全裁判。
在看不到答案的盲审状态下，裁判揪出推导错误的概率是 52.1%。
可一旦把经过验证的标准答案递给裁判，这个抓出率不仅没涨，反而跌到了 43.8%。
8 个 AI 裁判，在所有测试里表现出完全一致的迟钝。
如果选手的最终答案算错了，裁判拿到标准答案后，报错率会从 65.3% 飙升到 95.1%。
在裁判盲审放行之后，再把标准答案递过去：
答案算错的样本，93.8% 会被裁判重新判定为错误。
而答案蒙对、推导全错的样本，能被重新抓出来的只有 18.0%。
这台机器暴露出来的核心机制，叫「结果一致性比对」。
所谓的思维链监控，根本没有在独立核验逻辑。
裁判看到正确答案的瞬间，算力就自动滑向了逆向倒推：
只要最后的数字对得上，前面哪怕写了一段荒谬的推导，它也会自动脑补出合理的解释一路放行。
只有在最终数字对不上的时候，它才会回过头去挑刺。
它没有在审查推导过程。
它只是在核对收据。
在安全领域，这被称为一种温和的奖励作弊：
一个看似合理的产出，根本无法证明生产它的逻辑是可靠的。
现在的 AI 安全评估，大量依赖已知答案来测试裁判的监控能力。
这种测试给出了一个危险的合规幻觉。
当所有人都以为裁判在替人类盯紧 AI 的思考过程。
裁判其实只是站在终点线，看了一眼记分牌。
如果连已知答案的物理题，都能靠一个碰巧正确的数字把裁判骗过去。
未来面对那些人类自己都不知道答案的前沿推理，这套监控还能防住什么？

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260902-d843eb>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-09-02 12:19:59_
