---
id: "mb-20260909-f62cdd"
kind: "deep"
title: "同一场考试，仅仅换了一套没公开的备用卷，AI 的解题率直接从 89% 跌到了 19%"
topic: "同一场考试，仅仅换了一套没公开的备用卷，AI 的解题率直接从 89% 跌到了 19%"
source_type: "generated"
status: "published"
generated_at: "2026-09-09 09:32:44"
frame_type: ["古德哈特定律的指标异化与基准测试过拟合（Benc", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 同一场考试，仅仅换了一套没公开的备用卷，AI 的解题率直接从 89% 跌到了 19%

同一场考试，仅仅换了一套没公开的备用卷，AI 的解题率直接从 89% 跌到了 19%。

跌下神坛的绝非杂牌开源模型。
它们是各大科技巨头刚刚推向市场、号称编程能力全面追平顶级旗舰的轻量级主力。

2026 年 9 月初，Google DeepMind 推出 Gemini 3.8 Flash，Meta 超级智能实验室推出 Muse Spark 1.3。
两家大厂在发布会上亮出的王牌战果惊人一致。
在全行业公认最难、最硬核的终端智能体评测 Terminal-Bench 2.1 上，这两款轻量模型分别跑出了 89.4% 和 88.8% 的高分。
这个成绩追平了 OpenAI 的 GPT-6 Astra，甚至在部分指标上压过了 Anthropic 的 Claude Fable 5.1。

科技圈一片哗然。
旗舰大模型动辄数亿美元的预训练成本、昂贵的硬件集群，难道真的一夜之间被低成本的轻量模型抹平了？

这份神话只维持了不到一周。
当芯片研究机构 SemiAnalysis 的 Dylan Patel 团队把这两款模型放进刚刚更新的 Terminal-Bench 4.0 里重测，现场直接变成了车祸。

GPT-6 Astra 拿下 57.9%，Claude Fable 5.1 拿下 55.8%。
而号称与它们并驾齐驱的轻量双雄呢？
Muse Spark 1.3 直接腰斩到 33.3%。
Gemini 3.8 Flash 更是当场击穿地板，一路跌到 19.1%。

为什么同一批选手，换个版本能跌掉 70 个百分点？
是新考卷故意出了刁钻古怪的超纲难题吗？

先看这套考试到底在测什么。
终端基准测试不考选择题，也不测一段孤立的代码补全。
它是把 AI 扔进一个完全真实的 Linux 终端里，给它一个具体目标：
排查系统依赖冲突、配置内核编译链、在沙箱里找漏洞、甚至修复损坏的数据库。
AI 必须自己一行行敲命令、看报错、重试、修正，连续执行几十步才能把任务跑通。

在 2026 年 5 月发布的 2.1 版本里，一共包含了 89 个固定的终端环境任务。
这 89 道题，在过去四个月里成了所有大模型厂商争夺王冠的标准擂台。

问题就出在这 89 道题上。
当一个测量工具变成衡量商业成败的唯一定量标准，1975 年英国经济学家查尔斯·古德哈特提出的定律就会以最快速度生效：
当一项指标被选作控制目标时，它就会失去作为可靠度量的一切信息价值。

在顶级大模型领域，这个现象叫基准测试过拟合，行业黑话叫刷榜套利。

怎么让一个参数规模较小、推理成本便宜几十倍的轻量模型，在特定榜单上比肩旗舰？
如果老老实实去堆基础推理能力，需要消耗难以计数的算力去扩展通用泛化边界。
但如果目标只是要在 89 道公开题目里拿高分，捷径就太诱人了。

厂商用大型旗舰模型反向合成海量训练数据，专门模拟这 89 个任务里的目录结构、包管理报错和命令执行链。
在后续的强化学习和指令微调里，把这些特定模式当成高密度饲料大量喂给轻量模型。
模型并没有真正掌握从混乱报错中排查系统故障的通用认知。
它只是在神经网络的权重里，死死背下了特定容器环境下的应对肌肉记忆：
看到这个端口报错，直接盲打下一套固定的修复命令；
看到特定的依赖报错，立刻执行预设好的规避脚本。

这就好比一个考生把过去几年的模拟真题反复背了上千遍。
在原版卷子里，他确实能做到倒背如流、近乎满分。

8 月底发布的 Terminal-Bench 4.0 做了什么？
出题人甚至没有增加任务，反而把总题量从 74 道精简到了 66 道。
致命的改动只有两点：
剔除了 8 道全行业早已摸透、失去区分度的老化任务；
修正了 20 道任务底层的容器环境，校准了 CPU 算力与内存配额，更新了失效的第三方依赖库。

就这么两下微调，直接扯下了遮羞布。
参数拉满的旗舰大模型，靠着强大的底层逻辑和因果推演能力，哪怕面对从未见过的系统依赖和资源限制，依然能按部就班地探索解题。
而靠定向突击刷出来的轻量模型，只要运行环境的端口变了、依赖包的返回信息改了一个单词，预设的记忆链条瞬间脱节。
终端里的智能体开始陷入漫无目的的循环重试、超时报错，最后在真实的限制面前全面宕机。

明知道换套考卷就会露馅，为什么巨头们还要前赴后继地把模型往榜单里硬塞？
因为背后的算力账本根本等不起。

超级旗舰模型的推理成本高得惊人，百万 token 的调用费用通常高达 10 到 50 美元。
绝大多数想要部署自动化智能体的企业，都承受不起全天候调用旗舰模型的恐怖账单。
谁能抢先向市场证明自己的平价模型具备顶级编程能力，谁就能把百万开发者锁进自己的云端基础设施。
在资本市场面前，一张跑赢旗舰的榜单柱状图，在发布会当天就能换来数以亿计的估值溢价和海量调用请求。
公关部门需要这个数字，销售团队需要这个数字，至于它在真实环境里能撑几分钟，那是交付之后的事。

最终承担代价的，是信了跑分宣传的工程师。
把轻量模型接进真实的生产系统，面对杂乱无章的业务代码、陈旧的内网依赖和偶发性的网络波动，系统迅速失控。

基准测试原本是用来丈量技术边界的尺子。
当尺子本身变成了商业争夺的终点，所有人都在绞尽脑汁去迎合尺子的刻度。
但真实的工程世界从来不是封闭无菌的考场。
一旦离开被精心拟合的沙箱，现实永远会用最粗暴的系统报错，把投机取巧的应试幻觉撕得粉碎。

_Rendered by mubei-terminal._
