{"id":"mb-20260828-c1a866","account":"mubei","brand":"","title":"模型权重一个字节没动，解决真实编程任务的数量直接从 43 题暴涨到了 72 题","summary":"模型权重一个字节没动，解决真实编程任务的数量直接从 43 题暴涨到了 72 题","body":"模型权重一个字节没动，解决真实编程任务的数量直接从 43 题暴涨到了 72 题。\n这不是发布了下一代大模型。\n也没有投入天价算力做微调。\n工程师只是给它换了一件「外套」。\n整个行业都在死磕参数规模、训练数据和基准榜单。\n所有人都在默认一个前提：\n编程智能体能否解决工程难题，全看基座大模型够不够聪明。\n但如果决定一个 AI 程序员生死的，其实是包在它外面的脚手架呢？\n大语言模型写代码时，最致命的顽疾是什么？\n是鬼打墙。\n大模型本质上是一个概率预测引擎。\n它没有内置的重试计数器，也没有真正的挫败感。\n当它写出的代码报错时，大段的错误日志会被原封不动塞回上下文。\n模型在看到这堆报错信息后，注意力会被错误日志强行牵引。\n它会在同一个概率泥潭里打转，用差不多的语法反复修改同一个错误，陷入无限死循环。\n最后耗尽 Token 额度，超时崩溃。\n为什么越聪明的大脑，越容易在长流程任务里原地转圈？\n因为给它的历史信息越多，它被自身生成的错误垃圾锁死的概率就越高。\n这台打破瓶颈的机器，叫脚手架确定性干预。\n在编程智能体的体系里，系统是由两部分构成的：\n大脑，也就是底座大模型。\n脚手架，也就是负责管理上下文、调用工具和监控执行环境的控制外壳。\n计算机学者 Sydney Lewis 在一篇关于智能体脚手架的论文（arXiv:2608.26218）中，做了一组极其干净的对照实验。\n模型权重完全冻结，测试任务完全固定。\n对照组使用行业最普遍的朴素脚手架：\n把所有对话历史和工具输出，按时间顺序原封不动叠进上下文。\n实验组只在脚手架上加了两台极简的机械装置。\n第一台装置：陈旧工具输出的半衰期修剪。\n随着交互轮数增加，脚手架不等上下文被撑爆，主动把较早之前终端工具吐出的大段日志机械式压缩折叠。\n它只保留最近几轮的高精度上下文。\n不让失效的堆栈追踪占用注意力带宽，把最宝贵的上下文窗口留给当下的代码逻辑。\n第二台装置：死循环检测与硬打断。\n脚手架在后台静默监控终端命令日志。\n它不看模型的文字解释，只看实际执行动作。\n一旦检测到模型在连续使用相同的命令、反复撞上同一类报错，脚手架立即强行介入。\n它不等模型自己觉醒，直接往上下文注入一条不可抗拒的确定性指令：\n你正在重复无效动作，立刻放弃当前策略，更换全新解法。\n这套看似简单的外壳改造，在严苛的基准测试中打出了震撼的数据。\n在针对真实代码修复的 SWE-bench Verified 榜单上：\n测试选取了 169 道真实开源项目任务，把上下文窗口严格压在 20,480 Token，并设定 480 秒硬性超时。\n在面对严苛的上下文和时间压力时：\n朴素脚手架只解决了 43 道任务。\n换上确定性干预脚手架后，完全相同的模型成功解出了 72 道任务。\n任务从失败到通过的平均比例，直接从 28% 飙升到了 49%。\n更具说服力的是：\n当研究人员把这套完全冻结的脚手架，套用到另外 3 个架构截然不同的基座模型上时，所有模型的任务解决数全部暴涨。\n在宽松的大上下文窗口测试下，这套脚手架同样大幅削减了每轮对话的输入 Token 消耗，显著降低了推理开支。\n技术行业长期存在一种模型拜物教。\n评测机构习惯把编程任务的胜负，百分之百归功或归咎于大模型本身。\n所有人都在苦等千亿参数的下一代权重，期待纯粹的算力奇迹能跨越工程鸿沟。\n但真实的系统工程从来不是单点突破。\n自回归大模型拥有惊人的发散创造力，却天然缺乏跳出局部最优的自律。\n当一个概率系统被困在自己的错误记忆里时，指望它靠自身顿悟，就像指望一个人提着自己的头发离开地球。\n真正让智能体产生质变的，是在概率系统周围搭起一层冷酷、确定、守纪律的工程脚手架。\n用外部的规则清退过期的垃圾信息。\n用外部的监工踢醒原地打转的思考。\n决定生产力上限的，往往不是大脑拥有多高的智商。\n是在智商陷入死胡同的那一刻，有没有一套清醒的机制，果断把它从泥潭里拽出来。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:25","created_at":"2026-08-28 12:02:25"}