一个只有 80 亿参数的小模型,在长程智能体基准测试里拿下了 96.9% 的胜率
一个只有 80 亿参数的小模型,在长程智能体基准测试里拿下了 96.9% 的胜率。 这个成绩,直接追平了算力消耗是它几十倍的 Claude Opus 4.5。 在需要连续做几十步复杂决策的任务里,小模型靠什么打赢了参数规模高出几个数量级的行业巨头? 关键根本不在模型体积。 在于它终于学会了怎么管理自己的草稿纸。 在 ALFWorld 这种需要智能体在模拟环境里连续交互、搜索、操作的复杂长程测试中,大模型经常在几十步之后彻底崩溃。 传统的解法,是人类工程师给模型写一套死板的提示词脚手架。 每走一步,就强制模型做一遍推理,或者把所有的历史观察全量塞回上下文。 任务一旦超过三十步,海量的工具输出和交互噪音就会迅速填满上下文窗口。 模型不是算力不够,是被自己前面产生的几万字信息垃圾活活淹死。 如果为了省算力把流程写死成固定流水线,只要真实环境出现一个意外报错,模型就会卡死在死循环里。 Meta AI 与伊利诺伊大学厄巴纳-香槟分校团队提出的 EvoHarness-RL,彻底换了一套底层逻辑。 研发团队没有强行堆砌参数,他们给模型搭了一台可训练运行时脚手架。 这台机器的核心,是一个包含状态信念、目标进度和历史经验的三元工作区。 状态信念记录当前环境里什么是真的,目标进度跟踪子任务完成到了哪一步,历史经验沉淀跨任务的教训。 但最关键的突破,不是这三块工作区长什么样。 是研发团队没有替模型写死任何读写规则。 他们把创建、更新、压缩工作区的权限,全部做成了模型可以自主调用的动作空间。 模型先通过监督微调学会工作区的操作语法。 随后引入带成本感知的强化学习算法 GRPO 进行深度训练。 模型成功完成任务会拿到奖励,但每多做一次无用的工作区读写、每多浪费一组 token,都会受到严厉的惩罚。 在这种机制倒逼下,系统底层涌现出了一个精妙的动态过程:脚手架退火。 刚开始时,小模型像一个慌乱的新手,每走一步都要在外部工作区里疯狂记笔记。 随着强化学习不断优化成本,模型逐步把那些高频的常规操作,内化进了自己的神经网络权重里。 它不再频繁依赖外部记事本。 只有遇到环境突变、报错异常或复杂的逻辑分叉时,它才会精准唤醒外部工作区更新状态。 外部的草稿纸也随之进化,从最初的冗长杂乱,自发提炼成精简高效的决策锚点。 原本需要上万亿参数硬扛的长程记忆负荷,被这套元认知调度策略彻底拆解。 用 Qwen3-8B 跑出来的 96.9% 胜率,把行业习以为常的规模定律撕开了一道口子。 整个行业一直在迷信只要参数足够大、上下文窗口足够长,智能体就能解决一切复杂问题。 但长程任务的真正瓶颈,从来不是神经元的数量,是注意力与工作记忆的调度效率。 一个背着几十万字上下文垃圾乱撞的超级模型,在走几十步迷宫时,远不如一个懂得适时清空大脑的轻装行者。 真正的技术分野,从来不在谁堆了更多参数。 在于谁能找到让模型摆脱算力蛮力诅咒的优雅机制。 当小模型学会像顶尖工程师一样管理自己的认知负荷,大模型赢家通吃的叙事正在被悄悄改写。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。