{"id":"mb-20260828-cc4a34","account":"mubei","brand":"","title":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉","summary":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉","body":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉。\n现在行业里最流行的信仰，是把所有任务都塞进推理模型里。\n无论是写代码、解奥数，还是查法律条文、做事实问答。\n大家默认了一条铁律：只要给足思考标记，算力就能自动换来智商。\n直到有人给这笔账拉了一张真实的边际成本清单。\n联想基础架构方案集团的 Sachin Gopal Wani 团队，把主流推理模型拉到 7 个核心测试集上，跑了整整 151 组对照实验。\n他们做了一件事：不只看模型答得有多准，专门计算模型每拿 1% 的准确率提升，背后到底多消耗了多少倍的思考标记。\n这个边际产出效率指标，被定义为 Token 经济学得分 TES。\n结果测出了一组让整个行业冒冷汗的数据。\n同样是公认的高难度考题。\n在 AIME 2025 数学竞赛和 LiveCodeBench 编程测试里，拉满思考标记，收益极其惊人。\n每一步符号推演、自我纠错和代码回溯，都在实打实地推高正确率。\n但在同样极度硬核的 MMLU-Pro 知识召回测试里，边际效率直接砸到了地板上。\n耗费成千上万个思考标记，准确率曲线几乎是一条水平死线。\n甚至在部分高强度思考模式下，模型因为过度推演和自我怀疑，把原本选对的答案给改错了。\n为什么同样的思考算力，在两类难题上的回报会天差地别？\n秘密不在题目表面上有多难。\n在题目底层的任务结构。\n这台支配着算力回报率的隐形机器，叫推理税。\n大模型的思维链，本质上是一台因果搜索与符号验证机。\n它擅长的是长序列逻辑推导。\n前一步推导是后一步的前提，每一步都有明确的逻辑断言可以自我校验。\n面对这种任务结构，思考标记买到的是逻辑深度的确定性。\n但面对事实检索和专业知识召回，底层的物理法则全变了。\n模型权重的神经元里如果没有存进那个冷僻事实，在内存里空转一万次思维链，也不可能凭空把真相推导出来。\n这时候强行开启深度思考，模型不是在推演。\n是在虚无中疯狂寻找相关性。\n是在用漫长的思考标记，为自己的知识盲区编造看似自洽的幻觉。\n结果是，内部推理成本占比 RCS 飙升到 80% 以上，产出的却是一堆昂贵的废话。\n这就是为什么盲目开启全局推理，正在变成企业部署中最隐蔽的财务黑洞。\n算力买不来不存在的记忆。\n在缺乏外部检索支持的事实型场景里，盲目加注思考预算，就是在白白缴纳巨额的推理税。\n真正决定模型投资回报的，从来不是标称难度，是任务本身的因果链条长度。\n该用逻辑推演的地方，每颗思考标记都是杠杆。\n该拼知识检索的地方，多出来的思考全都是摩擦。\n算力可以按需堆叠。\n但任务本身的结构，早已在暗处给每一颗 Token 标好了回报率的上限。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:26","created_at":"2026-08-28 12:02:26"}