SpaceXAI 如何让一人管理 200 个代码智能体:三层科层制与外部状态机实践
一个人最多能同时盯住几个写代码的 AI? 15 个。 再多一个,光看测试报错和排查冲突,人脑就得先累瘫。 但在 SpaceXAI,一位工程师现在同时带着 200 多个代码智能体在跑。 团队里一位工程师,一个月交了 2000 多个 PR。 这是怎么做到的?
把上下文窗口拉大,靠模型硬记? 行不通。 窗口越大,调用费用飙升,智能体也更容易在冗长的历史记录里迷路。 李凌熙在工程实践里给出的解法很干脆: 把单体模型的记忆缺陷,直接变成团队的组织分工问题。
人类怎么管理 200 个员工? 分层,设岗,定规矩。 他们把这套管理逻辑平移给代码智能体,搭起一个三层架构。
最底层是执行层,200 个 Cursor 云端智能体。 它们分布在云端服务器,甚至一台闲置的 Mac mini 上跑 iOS 模拟器。 随调随起,专门负责写代码、跑测试、截取修改前后的界面图作为证据。 遇到环境抖动卡住,不需要人去敲键盘,管理层机器人会主动给它发指令疏通。 活干完了立刻销毁,绝不占用长线记忆。
中间层是管理层,5 个常驻的工程师机器人。 它们各守一块防区: Baltata 负责移动端与 iOS, Shaoruru 盯死桌面端与自动化发布流水线, Hogan 专查基础设施与疑难工单, Craig 攻坚安卓端, Quill 专攻测试脚手架。 为什么要拆成 5 个机器人,不做一个全能总监? 因为大模型的上下文容量有限。 把记忆系统物理隔离,让每个机器人只装自己领域的代码规范与设计原则,给出的方案才最精准。 跨领域协作可以,防区不能乱。
最顶上那一层最有意思:运营层。 负责管这 5 个工程师机器人的,是一个叫 Jenny 的运营机器人。 Jenny 是全队唯一一行代码都不写的智能体。 它每天凌晨 5 点准时上线,挨个找 5 个工程师机器人开 1 对 1 早会。 早会不过具体代码,只对作业手册,排查堵点,统一调性。 平时哪个代码机器人犯了错,比如审核放水、没深究代码隐患,必须立刻去找 Jenny 领罚复盘。 Jenny 调取它的思考轨迹,找出根本原因,把踩坑教训写进团队的作业手册,再向全体机器人广播通报。 有新机器人加入,也由 Jenny 下发工程守则,协调老员工带着上手。 复杂流程老是记不住怎么办? 靠每天清晨的 1 对 1 早会和制度广播,把规矩硬变成日常肌肉记忆。
200 个智能体并发推进,状态怎么跟? 全靠机器人的上下文硬撑,两轮对话就会丢三落四。 他们的解法是状态解耦,把所有进度挂在一张共享的 Notion 数据库里。 工程师机器人每 30 分钟轮巡一次表格,只查三项硬指标: 安全扫描报出的隐患是不是真的, 自动化测试有没有挂, 分支代码存不存在合并冲突。 如果遇到高优先级任务,直接切进 5 分钟轮询模式,主动纠偏。 只要有一项没过,立刻打回重修。 指标全部干净了,才推入代码审查。
海量拉取请求涌进来,人类工程师会不会被审查累瘫? 这里设了一道爆炸半径门禁。 高置信度、改动范围极小的拉取请求,机器人自己审核合并。 只有涉及核心架构和高风险逻辑的代码,才交由人类工程师做最终裁判。 人类退到系统的最顶端,只看核心代码与前后对比截图,彻底摆脱日常巡检的体力消耗。
到了夜里,这套系统照样运转。 每天凌晨 3 点,夜间审计自动触发。 机器人们自发清扫死代码,优化安装包体积,排查不同客户端的功能漂移。 最绝的是给智能体的一条例行指令:今晚给你们 6 小时,想建什么就建什么,玩得开心。 工程师早上一睁眼,桌面上已经整整齐齐码着一批跑通了测试、附带界面对比证据的清洁代码。
带好 200 个代码智能体,秘诀不在把提示词写得多长。 给智能体配齐能自行验证的全栈操作能力, 把易失的运行状态移出模型脑子、交给外部数据库, 用早会复盘把个体犯错沉淀为制度手册。 从一个人肉工头盯 15 个智能体就濒临崩溃, 到 1 个人带着 5 个机器人管理 200 多个云端打工人, 区别不在模型智商有多高。 把上下文装不下的流程,做成早会制度与外部数据库, 把人类从巡查杂役变成终审法官, 200 个代码智能体,一个人真带得动。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论,周一发出。带出处,可核查。