科技·via

模型权重一个字节没动,解决真实编程任务的数量直接从 43 题暴涨到了 72 题

模型权重一个字节没动,解决真实编程任务的数量直接从 43 题暴涨到了 72 题。 这不是发布了下一代大模型。 也没有投入天价算力做微调。 工程师只是给它换了一件「外套」。 整个行业都在死磕参数规模、训练数据和基准榜单。 所有人都在默认一个前提: 编程智能体能否解决工程难题,全看基座大模型够不够聪明。 但如果决定一个 AI 程序员生死的,其实是包在它外面的脚手架呢? 大语言模型写代码时,最致命的顽疾是什么? 是鬼打墙。 大模型本质上是一个概率预测引擎。 它没有内置的重试计数器,也没有真正的挫败感。 当它写出的代码报错时,大段的错误日志会被原封不动塞回上下文。 模型在看到这堆报错信息后,注意力会被错误日志强行牵引。 它会在同一个概率泥潭里打转,用差不多的语法反复修改同一个错误,陷入无限死循环。 最后耗尽 Token 额度,超时崩溃。 为什么越聪明的大脑,越容易在长流程任务里原地转圈? 因为给它的历史信息越多,它被自身生成的错误垃圾锁死的概率就越高。 这台打破瓶颈的机器,叫脚手架确定性干预。 在编程智能体的体系里,系统是由两部分构成的: 大脑,也就是底座大模型。 脚手架,也就是负责管理上下文、调用工具和监控执行环境的控制外壳。 计算机学者 Sydney Lewis 在一篇关于智能体脚手架的论文(arXiv:2608.26218)中,做了一组极其干净的对照实验。 模型权重完全冻结,测试任务完全固定。 对照组使用行业最普遍的朴素脚手架: 把所有对话历史和工具输出,按时间顺序原封不动叠进上下文。 实验组只在脚手架上加了两台极简的机械装置。 第一台装置:陈旧工具输出的半衰期修剪。 随着交互轮数增加,脚手架不等上下文被撑爆,主动把较早之前终端工具吐出的大段日志机械式压缩折叠。 它只保留最近几轮的高精度上下文。 不让失效的堆栈追踪占用注意力带宽,把最宝贵的上下文窗口留给当下的代码逻辑。 第二台装置:死循环检测与硬打断。 脚手架在后台静默监控终端命令日志。 它不看模型的文字解释,只看实际执行动作。 一旦检测到模型在连续使用相同的命令、反复撞上同一类报错,脚手架立即强行介入。 它不等模型自己觉醒,直接往上下文注入一条不可抗拒的确定性指令: 你正在重复无效动作,立刻放弃当前策略,更换全新解法。 这套看似简单的外壳改造,在严苛的基准测试中打出了震撼的数据。 在针对真实代码修复的 SWE-bench Verified 榜单上: 测试选取了 169 道真实开源项目任务,把上下文窗口严格压在 20,480 Token,并设定 480 秒硬性超时。 在面对严苛的上下文和时间压力时: 朴素脚手架只解决了 43 道任务。 换上确定性干预脚手架后,完全相同的模型成功解出了 72 道任务。 任务从失败到通过的平均比例,直接从 28% 飙升到了 49%。 更具说服力的是: 当研究人员把这套完全冻结的脚手架,套用到另外 3 个架构截然不同的基座模型上时,所有模型的任务解决数全部暴涨。 在宽松的大上下文窗口测试下,这套脚手架同样大幅削减了每轮对话的输入 Token 消耗,显著降低了推理开支。 技术行业长期存在一种模型拜物教。 评测机构习惯把编程任务的胜负,百分之百归功或归咎于大模型本身。 所有人都在苦等千亿参数的下一代权重,期待纯粹的算力奇迹能跨越工程鸿沟。 但真实的系统工程从来不是单点突破。 自回归大模型拥有惊人的发散创造力,却天然缺乏跳出局部最优的自律。 当一个概率系统被困在自己的错误记忆里时,指望它靠自身顿悟,就像指望一个人提着自己的头发离开地球。 真正让智能体产生质变的,是在概率系统周围搭起一层冷酷、确定、守纪律的工程脚手架。 用外部的规则清退过期的垃圾信息。 用外部的监工踢醒原地打转的思考。 决定生产力上限的,往往不是大脑拥有多高的智商。 是在智商陷入死胡同的那一刻,有没有一套清醒的机制,果断把它从泥潭里拽出来。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情