---
id: "mb-20260828-cc4a34"
title: "让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-28 12:02:26"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260828-cc4a34"
markdown_url: "https://mubeitech.com/p/mb-20260828-cc4a34/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260828-cc4a34"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉

让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉。
现在行业里最流行的信仰，是把所有任务都塞进推理模型里。
无论是写代码、解奥数，还是查法律条文、做事实问答。
大家默认了一条铁律：只要给足思考标记，算力就能自动换来智商。
直到有人给这笔账拉了一张真实的边际成本清单。
联想基础架构方案集团的 Sachin Gopal Wani 团队，把主流推理模型拉到 7 个核心测试集上，跑了整整 151 组对照实验。
他们做了一件事：不只看模型答得有多准，专门计算模型每拿 1% 的准确率提升，背后到底多消耗了多少倍的思考标记。
这个边际产出效率指标，被定义为 Token 经济学得分 TES。
结果测出了一组让整个行业冒冷汗的数据。
同样是公认的高难度考题。
在 AIME 2025 数学竞赛和 LiveCodeBench 编程测试里，拉满思考标记，收益极其惊人。
每一步符号推演、自我纠错和代码回溯，都在实打实地推高正确率。
但在同样极度硬核的 MMLU-Pro 知识召回测试里，边际效率直接砸到了地板上。
耗费成千上万个思考标记，准确率曲线几乎是一条水平死线。
甚至在部分高强度思考模式下，模型因为过度推演和自我怀疑，把原本选对的答案给改错了。
为什么同样的思考算力，在两类难题上的回报会天差地别？
秘密不在题目表面上有多难。
在题目底层的任务结构。
这台支配着算力回报率的隐形机器，叫推理税。
大模型的思维链，本质上是一台因果搜索与符号验证机。
它擅长的是长序列逻辑推导。
前一步推导是后一步的前提，每一步都有明确的逻辑断言可以自我校验。
面对这种任务结构，思考标记买到的是逻辑深度的确定性。
但面对事实检索和专业知识召回，底层的物理法则全变了。
模型权重的神经元里如果没有存进那个冷僻事实，在内存里空转一万次思维链，也不可能凭空把真相推导出来。
这时候强行开启深度思考，模型不是在推演。
是在虚无中疯狂寻找相关性。
是在用漫长的思考标记，为自己的知识盲区编造看似自洽的幻觉。
结果是，内部推理成本占比 RCS 飙升到 80% 以上，产出的却是一堆昂贵的废话。
这就是为什么盲目开启全局推理，正在变成企业部署中最隐蔽的财务黑洞。
算力买不来不存在的记忆。
在缺乏外部检索支持的事实型场景里，盲目加注思考预算，就是在白白缴纳巨额的推理税。
真正决定模型投资回报的，从来不是标称难度，是任务本身的因果链条长度。
该用逻辑推演的地方，每颗思考标记都是杠杆。
该拼知识检索的地方，多出来的思考全都是摩擦。
算力可以按需堆叠。
但任务本身的结构，早已在暗处给每一颗 Token 标好了回报率的上限。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260828-cc4a34>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-28 12:02:26_
