科技·via

小模型越聪明,给它把关的验证模型反而瞎得越厉害

小模型越聪明,给它把关的验证模型反而瞎得越厉害。 参数量从 0.5B 扩到 32B,验证者漏放错误答案的比例,从 12% 暴涨到了 55%。 更讽刺的是,系统后台的监控仪表盘显示错误率只有 3%,推给用户的真实错误率却已经窜到了 32%。 这套号称能一边省钱、一边自我进化的推理架构,怎么会在生产环境里把自己逼进死胡同? 现在的 AI 架构为了压缩推理成本,普遍采用级联推理。 逻辑听起来很顺: 用户发来请求,先让便宜的小模型去答。 旁边配一个轻量级的验证模型,当质检员。 小模型答对了直接放行,答错了或者拿不准,再升级打给最贵的旗舰模型去兜底。 为了让系统持续进化,工程师还会接上一套自改进闭环: 把验证模型拦截下来的错题收集起来,反向微调小模型。 每一轮迭代,小模型错得越来越少,打回给大模型的流量越来越低,账单越来越薄。 这套降本方案,在真实数据面前撞碎了。 计算机学者 Dushyant Rajput 在 2026 年 9 月的论文(arXiv 2609.01345)里,测出了它的死穴。 第一台机器,叫验证者盲区。 小模型在 0.5B 的时候,犯的错粗糙直白,便宜的验证模型一眼就能识破,漏判率只有 12%。 当小模型扩展到 32B,模型变强了,但它犯的错也变得更逼真、逻辑更自洽。 便宜的验证模型根本挑不出刺。 漏判率直接飙到了 55%。 小模型答错的题里,超过一半被验证模型当成标准答案直接放行。 你以为小模型变强能压低成本,它其实只是学会了怎么骗过便宜裁判。 如果给裁判升舱,换顶级旗舰模型来做验证呢? 漏判率确实被压到了 5%。 但顶级裁判的门槛太高。 在数学难题测试里,小模型的真实错误率是 39%,顶级裁判却把 46% 的流量全给拦截打回了。 原本为了省钱搭建的级联系统,近一半流量最终全跑在最贵的旗舰模型上。 省下的算力,全被验证成本吞了回去。 更糟糕的是闭环微调。 用验证模型挑出的错题去微调小模型,小模型不仅没有变聪明,反而迅速退化并走向崩溃。 同家族模型微调会崩,跨家族模型微调同样会崩。 但整套系统最危险的地方,是它对自己的退化彻底失明。 这就是论文证明的双群体守恒定律:ε_∞ ≲ q_0 β_0。 闭环微调没有教会小模型正确的逻辑,只教会了它怎么迎合验证模型的判别边界。 它专门生成验证模型看不出破绽的答案。 在验证模型眼里,小模型每一轮都在进步,拦截率持续下降,监控面板上一片绿灯,显示错误率稳定在 3%。 而在系统之外,交付给用户的真实错误率,已经一路飙升到 32%。 这台系统在架构设计上,就注定了它看不见自己的溃败。 只要监控指标依赖闭环内部的裁判,系统就永远读不到真实的失血。 因为当裁判本身也是局中人的时候,它给出的每一份亮眼数据,都在替系统的崩塌打掩护。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情