---
id: "mb-20260823-ce0400"
title: "一个独立开发者让 4 个 AI 智能体连续运转了 4 周"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-23 00:21:50"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260823-ce0400"
markdown_url: "https://mubeitech.com/p/mb-20260823-ce0400/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260823-ce0400"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 一个独立开发者让 4 个 AI 智能体连续运转了 4 周

一个独立开发者让 4 个 AI 智能体连续运转了 4 周。
任务是反编译 2009 年的经典游戏《使命召唤：现代战争2》。
整个过程烧掉了 2350 亿个 Token。
产生了大大小小超过 2GB 的会话日志。
如果按大模型的官方 API 标价计费，这笔算力开销折合 85207 美元。
当他把这 2GB 的运行日志完整导出来逐行审计时。
当下 AI 圈子里最流行的一批架构直觉，被几乎全盘推翻。

现在的工程师习惯怎么搭多智能体？
疯狂派生子智能体去查资料，免得污染母体的上下文。
给智能体塞满详尽的提示词，反复告诫它什么能做、什么不能做。
迷信更贵、参数更大的模型，觉得写代码必须用顶配。

但 2350 亿个 Token 跑出来的真实数据，完全是另一回事。

子智能体并没有提升效率，反而在疯狂制造内耗。
很多人以为把任务切给子智能体，母体能保持干净。
日志审计却发现，子智能体从大文件里读取的内容，有 54.7% 是纯粹的重复数据。
一个记录项目进度的 STATUS.md 文件，被 21 个子智能体来回读了 28 次。
不同子智能体重复读取同一份文件的中位间隔，只有 35 分钟。
如果让母体自己查，文件一直在上下文缓存里，根本不需要反复重新加载。
子智能体之间没有共享记忆，隔离上下文省下的空间，全变成了成倍交纳的重复读取税。
作者把子智能体彻底关掉之后，团队的日均提交量没有下滑，反而从 243 次跳升到了 311 次。

靠提示词规劝智能体，几乎全在白费力气。
智能体写完几行代码，就会忍不住在本地跑一遍耗时 4 分钟的完整测试。
开发者在提示词里严厉禁止它本地测试，要求全部交给云端流水线。
智能体最多听话 5 分钟，随后立刻故态复萌。
要求它说话简短、要求它提交后不要反复确认任务，只要经过几次上下文压缩，这些规则就会被彻底抛到脑后。
软性的语言规劝，在长周期自主运行的系统里毫无约束力。
最终起效的只有机械阻断：直接在底层代码里把本地测试的执行入口封死，改用网页钩子在报错时被动唤醒。
管住机器不能靠讲道理，只能靠物理开关。

决定系统质量上限的，甚至不是写代码的工人。
测试显示，用昂贵的 Opus 5 写代码，编译失败率高达 23.9%，每小时只能提交 1.6 次。
换成便宜轻快的 Sonnet 5，失败率降到 9.1%，每小时提交 6.1 次。
如果按每个提交的代码缺陷率来算，两个模型其实都在 19% 左右，干活犯错的概率不相上下。
真正的分野发生在审查岗位上。
让 Sonnet 担任监督员审查代码，能抓出 19.6% 的缺陷。
换成 Opus 担任监督员，抓出的缺陷率只有 14.3%。
把更聪明、更贵的模型放在写代码的位置，收益极低。
把对细节最敏锐的模型放在审查哨位上，才能兜住整个系统的底。

烧掉 2350 亿个 Token，换来的是一套格外朴素的工程常识：
砍掉没有共享记忆的子节点。
用物理阻断代替语言教育。
把审查哨位摆在开发之前。
拖垮智能体系统的，往往不是模型的智力上限。
是人类凭空搭出来的复杂架构，正在暗中向算力征收高额的混乱税。

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260823-ce0400>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-23 00:21:50_
