{"id":"mb-20260828-142667","account":"mubei","brand":"","title":"给 AI 智能体连续调用 6 次外部工具，它 70% 的原生推理能力会被自己前面的小错直接吞噬","summary":"给 AI 智能体连续调用 6 次外部工具，它 70% 的原生推理能力会被自己前面的小错直接吞噬","body":"给 AI 智能体连续调用 6 次外部工具，它 70% 的原生推理能力会被自己前面的小错直接吞噬。\n更致命的是，几乎所有主流基准测试都会告诉你同一个结论：\n只要智能体在早期选错一个工具或填错一个参数，后面的纠错恢复率就是绝对的零。\n在 580 次偏离测试中，成功重回正轨的次数是精准的 0 次。\n真实的多步推理真有这么绝望吗？\n为什么一个具备强大逻辑能力的大模型，一旦执行长链条工具调用，就会像掉进黑洞一样彻底瘫痪？\n把测试代码的底层逻辑拆到底，会看到一场极其隐蔽的测量学事故。\n固定黄金轨迹的结构性伪影。\n智能体调用工具，主要栽在两个地方：挑错了工具，或者给工具填了错误的参数。\n在单步、干净的理想提示词环境里，开源大模型的工具调用准确率通常能维持在较高水准。\n一旦进入自由运行的多步长链条，第一步生成的微小偏差，就会被当成历史上下文塞回输入端。\n到了第 6 步深度，这种级联污染会把模型原本具备的能力抹掉七成。\n早期的小错误在静默中毒化了整个下游系统。\n但过去学术界和行业评估这种错误传播时，用了一把有严重硬伤的尺子。\n固定标准轨迹的精确匹配打分。\n这套测试系统预设了一套标准答案轨迹，规定每一步必须输出固定的工具名和参数。\n荒谬的死局就在这里锁死了。\n假设模型在第 2 步选了另一个接口，或者拿到了不同的返回数据。\n到了第 3 步，标准答案要求模型填入一个特定的常量。\n这个常量，只有在执行了第 2 步的标准接口后才会生成。\n模型既然在第 2 步走了另一条分支，它的上下文里就物理性地不存在这个常量。\n这意味着评分系统在第 3 步，要求模型给出一个它从未接收过的未知信息。\n除非靠纯粹的随机猜测撞大运，否则模型在这一步的得分只能是零。\n在 869 次被毒化的步骤中，没有一次能拿到正确评分。\n在 580 次偏离轨迹的步骤中，没有一次能回到人类预设的原轨。\n这根本不是模型丧失了逻辑修复能力。\n是打分规则在它偏离标准答案的那一秒，就已经在数学上剥夺了它答对的可能。\n甚至有研究对着这组被规则硬锁死的数据，拟合出 0.92 和 0.73 的高置信度参数。\n整个行业用极其精密的数学模型，去拟合了一个由评测代码自带的假象。\n真正的解法，是换掉这把僵硬的尺子。\n引入基于当前状态的条件评分。\n不去强求模型猜出它没见过的常量，而是在它当前已经偏离的实际状态下，判断它基于手头现有信息做出的下一步决策是否合乎逻辑。\n仅仅把这套动态评分应用在已经缓存的完成记录上，零额外算力成本，就能把严重性指标从被锁死的零点修正回真实的数值区间。\n过去两年，整个行业都在为长链条智能体的脆弱性焦虑，把海量资源投向越来越重的反思重试机制和复杂框架。\n当一套系统显得不可救药时，问题往往出在测量这台机器的坐标系上。\n如果连评估工具都在系统性制造无法自愈的假象，我们又怎么分得清，究竟是智能体的推理触碰了天花板，还是我们一开始就把题出成了死局？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:24","created_at":"2026-08-28 12:02:24"}