一个独立开发者让 4 个 AI 智能体连续运转了 4 周
一个独立开发者让 4 个 AI 智能体连续运转了 4 周。 任务是反编译 2009 年的经典游戏《使命召唤:现代战争2》。 整个过程烧掉了 2350 亿个 Token。 产生了大大小小超过 2GB 的会话日志。 如果按大模型的官方 API 标价计费,这笔算力开销折合 85207 美元。 当他把这 2GB 的运行日志完整导出来逐行审计时。 当下 AI 圈子里最流行的一批架构直觉,被几乎全盘推翻。
现在的工程师习惯怎么搭多智能体? 疯狂派生子智能体去查资料,免得污染母体的上下文。 给智能体塞满详尽的提示词,反复告诫它什么能做、什么不能做。 迷信更贵、参数更大的模型,觉得写代码必须用顶配。
但 2350 亿个 Token 跑出来的真实数据,完全是另一回事。
子智能体并没有提升效率,反而在疯狂制造内耗。 很多人以为把任务切给子智能体,母体能保持干净。 日志审计却发现,子智能体从大文件里读取的内容,有 54.7% 是纯粹的重复数据。 一个记录项目进度的 STATUS.md 文件,被 21 个子智能体来回读了 28 次。 不同子智能体重复读取同一份文件的中位间隔,只有 35 分钟。 如果让母体自己查,文件一直在上下文缓存里,根本不需要反复重新加载。 子智能体之间没有共享记忆,隔离上下文省下的空间,全变成了成倍交纳的重复读取税。 作者把子智能体彻底关掉之后,团队的日均提交量没有下滑,反而从 243 次跳升到了 311 次。
靠提示词规劝智能体,几乎全在白费力气。 智能体写完几行代码,就会忍不住在本地跑一遍耗时 4 分钟的完整测试。 开发者在提示词里严厉禁止它本地测试,要求全部交给云端流水线。 智能体最多听话 5 分钟,随后立刻故态复萌。 要求它说话简短、要求它提交后不要反复确认任务,只要经过几次上下文压缩,这些规则就会被彻底抛到脑后。 软性的语言规劝,在长周期自主运行的系统里毫无约束力。 最终起效的只有机械阻断:直接在底层代码里把本地测试的执行入口封死,改用网页钩子在报错时被动唤醒。 管住机器不能靠讲道理,只能靠物理开关。
决定系统质量上限的,甚至不是写代码的工人。 测试显示,用昂贵的 Opus 5 写代码,编译失败率高达 23.9%,每小时只能提交 1.6 次。 换成便宜轻快的 Sonnet 5,失败率降到 9.1%,每小时提交 6.1 次。 如果按每个提交的代码缺陷率来算,两个模型其实都在 19% 左右,干活犯错的概率不相上下。 真正的分野发生在审查岗位上。 让 Sonnet 担任监督员审查代码,能抓出 19.6% 的缺陷。 换成 Opus 担任监督员,抓出的缺陷率只有 14.3%。 把更聪明、更贵的模型放在写代码的位置,收益极低。 把对细节最敏锐的模型放在审查哨位上,才能兜住整个系统的底。
烧掉 2350 亿个 Token,换来的是一套格外朴素的工程常识: 砍掉没有共享记忆的子节点。 用物理阻断代替语言教育。 把审查哨位摆在开发之前。 拖垮智能体系统的,往往不是模型的智力上限。 是人类凭空搭出来的复杂架构,正在暗中向算力征收高额的混乱税。
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。