给 AI 智能体连续调用 6 次外部工具,它 70% 的原生推理能力会被自己前面的小错直接吞噬
给 AI 智能体连续调用 6 次外部工具,它 70% 的原生推理能力会被自己前面的小错直接吞噬。 更致命的是,几乎所有主流基准测试都会告诉你同一个结论: 只要智能体在早期选错一个工具或填错一个参数,后面的纠错恢复率就是绝对的零。 在 580 次偏离测试中,成功重回正轨的次数是精准的 0 次。 真实的多步推理真有这么绝望吗? 为什么一个具备强大逻辑能力的大模型,一旦执行长链条工具调用,就会像掉进黑洞一样彻底瘫痪? 把测试代码的底层逻辑拆到底,会看到一场极其隐蔽的测量学事故。 固定黄金轨迹的结构性伪影。 智能体调用工具,主要栽在两个地方:挑错了工具,或者给工具填了错误的参数。 在单步、干净的理想提示词环境里,开源大模型的工具调用准确率通常能维持在较高水准。 一旦进入自由运行的多步长链条,第一步生成的微小偏差,就会被当成历史上下文塞回输入端。 到了第 6 步深度,这种级联污染会把模型原本具备的能力抹掉七成。 早期的小错误在静默中毒化了整个下游系统。 但过去学术界和行业评估这种错误传播时,用了一把有严重硬伤的尺子。 固定标准轨迹的精确匹配打分。 这套测试系统预设了一套标准答案轨迹,规定每一步必须输出固定的工具名和参数。 荒谬的死局就在这里锁死了。 假设模型在第 2 步选了另一个接口,或者拿到了不同的返回数据。 到了第 3 步,标准答案要求模型填入一个特定的常量。 这个常量,只有在执行了第 2 步的标准接口后才会生成。 模型既然在第 2 步走了另一条分支,它的上下文里就物理性地不存在这个常量。 这意味着评分系统在第 3 步,要求模型给出一个它从未接收过的未知信息。 除非靠纯粹的随机猜测撞大运,否则模型在这一步的得分只能是零。 在 869 次被毒化的步骤中,没有一次能拿到正确评分。 在 580 次偏离轨迹的步骤中,没有一次能回到人类预设的原轨。 这根本不是模型丧失了逻辑修复能力。 是打分规则在它偏离标准答案的那一秒,就已经在数学上剥夺了它答对的可能。 甚至有研究对着这组被规则硬锁死的数据,拟合出 0.92 和 0.73 的高置信度参数。 整个行业用极其精密的数学模型,去拟合了一个由评测代码自带的假象。 真正的解法,是换掉这把僵硬的尺子。 引入基于当前状态的条件评分。 不去强求模型猜出它没见过的常量,而是在它当前已经偏离的实际状态下,判断它基于手头现有信息做出的下一步决策是否合乎逻辑。 仅仅把这套动态评分应用在已经缓存的完成记录上,零额外算力成本,就能把严重性指标从被锁死的零点修正回真实的数值区间。 过去两年,整个行业都在为长链条智能体的脆弱性焦虑,把海量资源投向越来越重的反思重试机制和复杂框架。 当一套系统显得不可救药时,问题往往出在测量这台机器的坐标系上。 如果连评估工具都在系统性制造无法自愈的假象,我们又怎么分得清,究竟是智能体的推理触碰了天花板,还是我们一开始就把题出成了死局?
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。