让大模型多烧十倍的算力去深度思考,有些难题的得分不仅没涨,反而直接往下掉
让大模型多烧十倍的算力去深度思考,有些难题的得分不仅没涨,反而直接往下掉。 现在行业里最流行的信仰,是把所有任务都塞进推理模型里。 无论是写代码、解奥数,还是查法律条文、做事实问答。 大家默认了一条铁律:只要给足思考标记,算力就能自动换来智商。 直到有人给这笔账拉了一张真实的边际成本清单。 联想基础架构方案集团的 Sachin Gopal Wani 团队,把主流推理模型拉到 7 个核心测试集上,跑了整整 151 组对照实验。 他们做了一件事:不只看模型答得有多准,专门计算模型每拿 1% 的准确率提升,背后到底多消耗了多少倍的思考标记。 这个边际产出效率指标,被定义为 Token 经济学得分 TES。 结果测出了一组让整个行业冒冷汗的数据。 同样是公认的高难度考题。 在 AIME 2025 数学竞赛和 LiveCodeBench 编程测试里,拉满思考标记,收益极其惊人。 每一步符号推演、自我纠错和代码回溯,都在实打实地推高正确率。 但在同样极度硬核的 MMLU-Pro 知识召回测试里,边际效率直接砸到了地板上。 耗费成千上万个思考标记,准确率曲线几乎是一条水平死线。 甚至在部分高强度思考模式下,模型因为过度推演和自我怀疑,把原本选对的答案给改错了。 为什么同样的思考算力,在两类难题上的回报会天差地别? 秘密不在题目表面上有多难。 在题目底层的任务结构。 这台支配着算力回报率的隐形机器,叫推理税。 大模型的思维链,本质上是一台因果搜索与符号验证机。 它擅长的是长序列逻辑推导。 前一步推导是后一步的前提,每一步都有明确的逻辑断言可以自我校验。 面对这种任务结构,思考标记买到的是逻辑深度的确定性。 但面对事实检索和专业知识召回,底层的物理法则全变了。 模型权重的神经元里如果没有存进那个冷僻事实,在内存里空转一万次思维链,也不可能凭空把真相推导出来。 这时候强行开启深度思考,模型不是在推演。 是在虚无中疯狂寻找相关性。 是在用漫长的思考标记,为自己的知识盲区编造看似自洽的幻觉。 结果是,内部推理成本占比 RCS 飙升到 80% 以上,产出的却是一堆昂贵的废话。 这就是为什么盲目开启全局推理,正在变成企业部署中最隐蔽的财务黑洞。 算力买不来不存在的记忆。 在缺乏外部检索支持的事实型场景里,盲目加注思考预算,就是在白白缴纳巨额的推理税。 真正决定模型投资回报的,从来不是标称难度,是任务本身的因果链条长度。 该用逻辑推演的地方,每颗思考标记都是杠杆。 该拼知识检索的地方,多出来的思考全都是摩擦。 算力可以按需堆叠。 但任务本身的结构,早已在暗处给每一颗 Token 标好了回报率的上限。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。