{"source":{"id":"mb-20260828-1833fd","title":"让 AI 编程账单暴涨的，不是代码太难","url":"https://mubeitech.com/p/mb-20260828-1833fd"},"method":"semantic-similarity","count":2,"items":[{"rank":1,"id":"mb-20260828-cc4a34","account":"mubei","brand":"","title":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉","summary":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉","body":"让大模型多烧十倍的算力去深度思考，有些难题的得分不仅没涨，反而直接往下掉。\n现在行业里最流行的信仰，是把所有任务都塞进推理模型里。\n无论是写代码、解奥数，还是查法律条文、做事实问答。\n大家默认了一条铁律：只要给足思考标记，算力就能自动换来智商。\n直到有人给这笔账拉了一张真实的边际成本清单。\n联想基础架构方案集团的 Sachin Gopal Wani 团队，把主流推理模型拉到 7 个核心测试集上，跑了整整 151 组对照实验。\n他们做了一件事：不只看模型答得有多准，专门计算模型每拿 1% 的准确率提升，背后到底多消耗了多少倍的思考标记。\n这个边际产出效率指标，被定义为 Token 经济学得分 TES。\n结果测出了一组让整个行业冒冷汗的数据。\n同样是公认的高难度考题。\n在 AIME 2025 数学竞赛和 LiveCodeBench 编程测试里，拉满思考标记，收益极其惊人。\n每一步符号推演、自我纠错和代码回溯，都在实打实地推高正确率。\n但在同样极度硬核的 MMLU-Pro 知识召回测试里，边际效率直接砸到了地板上。\n耗费成千上万个思考标记，准确率曲线几乎是一条水平死线。\n甚至在部分高强度思考模式下，模型因为过度推演和自我怀疑，把原本选对的答案给改错了。\n为什么同样的思考算力，在两类难题上的回报会天差地别？\n秘密不在题目表面上有多难。\n在题目底层的任务结构。\n这台支配着算力回报率的隐形机器，叫推理税。\n大模型的思维链，本质上是一台因果搜索与符号验证机。\n它擅长的是长序列逻辑推导。\n前一步推导是后一步的前提，每一步都有明确的逻辑断言可以自我校验。\n面对这种任务结构，思考标记买到的是逻辑深度的确定性。\n但面对事实检索和专业知识召回，底层的物理法则全变了。\n模型权重的神经元里如果没有存进那个冷僻事实，在内存里空转一万次思维链，也不可能凭空把真相推导出来。\n这时候强行开启深度思考，模型不是在推演。\n是在虚无中疯狂寻找相关性。\n是在用漫长的思考标记，为自己的知识盲区编造看似自洽的幻觉。\n结果是，内部推理成本占比 RCS 飙升到 80% 以上，产出的却是一堆昂贵的废话。\n这就是为什么盲目开启全局推理，正在变成企业部署中最隐蔽的财务黑洞。\n算力买不来不存在的记忆。\n在缺乏外部检索支持的事实型场景里，盲目加注思考预算，就是在白白缴纳巨额的推理税。\n真正决定模型投资回报的，从来不是标称难度，是任务本身的因果链条长度。\n该用逻辑推演的地方，每颗思考标记都是杠杆。\n该拼知识检索的地方，多出来的思考全都是摩擦。\n算力可以按需堆叠。\n但任务本身的结构，早已在暗处给每一颗 Token 标好了回报率的上限。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:26","created_at":"2026-08-28 12:02:26","url":"https://mubeitech.com/p/mb-20260828-cc4a34","markdown_url":"https://mubeitech.com/p/mb-20260828-cc4a34/markdown"},{"rank":2,"id":"2080728910291959884","account":"mubei","brand":"@mubei","title":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…","summary":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEval 测试里，GPT-4 直接裸跑，得分只有 67.0%。 上一代的 GPT-3.5 裸跑更惨，只有 48.1%。 但只要把 GPT-3.5 塞进多智能体工作流…","body":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？\n搭个工作流。\n\n看一组刺眼的测试数据。\n在写代码的 HumanEval 测试里，GPT-4 直接裸跑，得分只有 67.0%。\n上一代的 GPT-3.5 裸跑更惨，只有 48.1%。\n但只要把 GPT-3.5 塞进多智能体工作流，得分直接飙到了 95.1%。\n\n落后一代的模型，靠着架构，把最强模型按在地上摩擦。\n系统设计，比选哪个模型更重要。\n\n吴恩达把这套逻辑彻底拆开了。\n逼大模型一次性给个完美答案，就像让人类一口气写完万字长文不改稿，违背常理。\n解法就是让 AI 走四步：反思、用工具、做规划、多智能体协作。\n翻译一下：让它打草稿、上网查、拆任务、拉个群开会。\n\n到了 2026 年 7 月，这套系统又进化了。\n多个 AI 员工一起干活，最大的痛点是状态和记忆不同步。\n于是，知识图谱成了这个虚拟公司的底座。\n\n这套新架构分工极其明确。\n顶层是架构师 Agent，负责定计划。\n中间是技术主管 Agent，负责分发和评估。\n最底层是开发者 Agent，负责敲代码调用工具。\n它们围着一个共享的知识图谱实时读写，不再单线传话。\n事实能保存，跨任务能推理，连逻辑都能追溯。\n\n吴恩达把话放这了：\n今年智能体工作流带来的进步，可能比下一代基础模型的升级还要大。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2080961389712036214","translated_status_id":"2080961389712036214","published_at":"2026-07-25 10:18:05","created_at":"2026-07-25T12:16:10.252442","url":"https://mubeitech.com/p/2080728910291959884","markdown_url":"https://mubeitech.com/p/2080728910291959884/markdown"}]}