几乎所有让 AI「自我进化」的尝试,最后都死在同一个陷阱里
几乎所有让 AI「自我进化」的尝试,最后都死在同一个陷阱里: 它没有变聪明,只是把自己的提示词越改越乱,最终退化成团队最想关掉的烦人实习生。 第一天写好的提示词和技能文件,跑了一个月。 代码库在变,业务边界在变,工程师在审查记录里不断纠偏。 但会话一关,交互上下文瞬间蒸发。 第二天,它依然会犯同一个愚蠢的低级错误。 既然如此,为什么不让智能体在每次执行完后,直接修改自己的提示词? 因为只要你在执行当下让它自我修改,灾难性的认知漂移就会发生。 它会把一次偶然的临时修复当成永久铁律,不断叠加互相冲突的规则,直到整个逻辑彻底崩塌。 不改就会脱节,实时改就会跑偏。 这个死局怎么解? Anthropic 与 Warp 在一套工程实践里,给出了底层的解法。 核心是一台可命名的机器:双环学习解耦(Double-Loop Learning)。 这套机制早在 1978 年就由哈佛大学学者克里斯·阿吉里斯(Chris Argyris)提出。 单环学习只纠正当下的操作动作,双环学习才去修正动作背后的底层原则。 落到工程上,就是把智能体拆成两个完全独立的循环。 第一个是内环执行层。 它只负责按照固定的技能指令干活,做代码审查或排查缺陷。 它在执行过程中绝对不碰自己的提示词,只做两件事:完成任务,以及把人类工程师的每一次真实修正完整留痕。 第二个是外环进化层。 它不参与日常写代码,而是一个异步运行的观察者。 它定期回溯过去几十次会话的留痕,对比 AI 当初的建议与资深工程师最终合并的代码。 它只提炼带原因的通用原则,坚决不打临时补丁。 最关键的闸门在这里: 外环进化层改写了技能文件之后,绝不静默生效。 它会向代码仓库提交一个拉取请求(PR)。 只有当真正懂业务的资深工程师审查通过并点击合并,这套新技能才会被写入内环。 这打破了过去两难的死局。 人类不再需要痛苦地给 AI 当全职提示词保姆。 工程师只需要照常工作,照常在日常开发里修正错误。 进化系统把人类的自然反馈变成了持续升级的养料。 而代码审查机制,守住了最后的安全底线。 真正的智能体进化,从来不是给模型堆更多的参数,也不是给它无边界的自我修改权。 把执行和反思拆成两套循环,把进化的审批权交还给代码审查。 能让系统持续变强的,从来不是孤立的模型,而是那套能把人类日常经验稳定固化下来的工程闭环。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。