{"id":"mb-20260830-62ab79","kind":"deep","title":"一个只有 80 亿参数的小模型，在长程智能体基准测试里拿下了 96.9% 的胜率","summary":"一个只有 80 亿参数的小模型，在长程智能体基准测试里拿下了 96.9% 的胜率","body":"一个只有 80 亿参数的小模型，在长程智能体基准测试里拿下了 96.9% 的胜率。\n这个成绩，直接追平了算力消耗是它几十倍的 Claude Opus 4.5。\n在需要连续做几十步复杂决策的任务里，小模型靠什么打赢了参数规模高出几个数量级的行业巨头？\n关键根本不在模型体积。\n在于它终于学会了怎么管理自己的草稿纸。\n在 ALFWorld 这种需要智能体在模拟环境里连续交互、搜索、操作的复杂长程测试中，大模型经常在几十步之后彻底崩溃。\n传统的解法，是人类工程师给模型写一套死板的提示词脚手架。\n每走一步，就强制模型做一遍推理，或者把所有的历史观察全量塞回上下文。\n任务一旦超过三十步，海量的工具输出和交互噪音就会迅速填满上下文窗口。\n模型不是算力不够，是被自己前面产生的几万字信息垃圾活活淹死。\n如果为了省算力把流程写死成固定流水线，只要真实环境出现一个意外报错，模型就会卡死在死循环里。\nMeta AI 与伊利诺伊大学厄巴纳-香槟分校团队提出的 EvoHarness-RL，彻底换了一套底层逻辑。\n研发团队没有强行堆砌参数，他们给模型搭了一台可训练运行时脚手架。\n这台机器的核心，是一个包含状态信念、目标进度和历史经验的三元工作区。\n状态信念记录当前环境里什么是真的，目标进度跟踪子任务完成到了哪一步，历史经验沉淀跨任务的教训。\n但最关键的突破，不是这三块工作区长什么样。\n是研发团队没有替模型写死任何读写规则。\n他们把创建、更新、压缩工作区的权限，全部做成了模型可以自主调用的动作空间。\n模型先通过监督微调学会工作区的操作语法。\n随后引入带成本感知的强化学习算法 GRPO 进行深度训练。\n模型成功完成任务会拿到奖励，但每多做一次无用的工作区读写、每多浪费一组 token，都会受到严厉的惩罚。\n在这种机制倒逼下，系统底层涌现出了一个精妙的动态过程：脚手架退火。\n刚开始时，小模型像一个慌乱的新手，每走一步都要在外部工作区里疯狂记笔记。\n随着强化学习不断优化成本，模型逐步把那些高频的常规操作，内化进了自己的神经网络权重里。\n它不再频繁依赖外部记事本。\n只有遇到环境突变、报错异常或复杂的逻辑分叉时，它才会精准唤醒外部工作区更新状态。\n外部的草稿纸也随之进化，从最初的冗长杂乱，自发提炼成精简高效的决策锚点。\n原本需要上万亿参数硬扛的长程记忆负荷，被这套元认知调度策略彻底拆解。\n用 Qwen3-8B 跑出来的 96.9% 胜率，把行业习以为常的规模定律撕开了一道口子。\n整个行业一直在迷信只要参数足够大、上下文窗口足够长，智能体就能解决一切复杂问题。\n但长程任务的真正瓶颈，从来不是神经元的数量，是注意力与工作记忆的调度效率。\n一个背着几十万字上下文垃圾乱撞的超级模型，在走几十步迷宫时，远不如一个懂得适时清空大脑的轻装行者。\n真正的技术分野，从来不在谁堆了更多参数。\n在于谁能找到让模型摆脱算力蛮力诅咒的优雅机制。\n当小模型学会像顶尖工程师一样管理自己的认知负荷，大模型赢家通吃的叙事正在被悄悄改写。","topic":"一个只有 80 亿参数的小模型，在长程智能体基准测试里拿下了 96.9% 的胜率","frame_type":["可训练运行时脚手架与动态退火机制","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:58:48","legal_anchor_count":0,"transcript_citation_count":0}