其它·via @mubei
4到6个月后,没人再去死磕提示词了。 Anthropic内部,80%的工程师已经切到了自改进循环。 他们现在玩什么? 编…
4到6个月后,没人再去死磕提示词了。 Anthropic内部,80%的工程师已经切到了自改进循环。 他们现在玩什么? 编排图(Graph),用图来协调那些能自我进化的Agent。
AI的干活方式,正在经历一次底层的工程演变。 退回2024年初,Opus 3时代。 模型顶多能自主干10到20分钟。 这种“短上下文协作”,人类必须死死盯着,一行行喂指令。
后来,同步代码Agent(比如Claude Code)出来了。 它能自己跑大概一小时。 一小时听着不错。 但在本地跑,一旦遇到报错,它马上掉头回来找你哭。
想让它跑十个小时?甚至几天? 这就得靠异步自改进Agent。 怎么搞? 第一步,把“大脑”和“双手”劈开。 双手是执行容器,死了就死了;大脑是一个无状态进程,只管把进度写进追加日志。 容器崩溃,任务一分一秒都不会丢。
第二步,给它配一个冷酷的独立验证器。 以前让AI边干活边给自己打分,它经常陷入幻觉,疯狂肯定自己。 现在,把验证切进另一个独立的上下文窗口。 一边建,一边测,死循环,直到通过验证才准许输出。
第三步:让AI“做梦”。 执行长任务时,AI会把过程写进短时记忆,但这种记忆极其短视。 玩宝可梦时,模型记错了一个没用的细节,导致它一次次掉进同一个陷阱。 怎么救?靠离线的“做梦”机制。 在后台洗一遍记忆,踢掉局部最优的废数据,沉淀出正确的长期记忆。 醒来再跑,它精准绕开了陷阱。
当异步Agent足够聪明,最后一步就是Graph编排。 把它们连成一张网。 不再是你电脑里的私人小助手,而是接入全公司数据的组织级大脑。 新人入职第一天就能用,它甚至能主动跳出来警告你别踩别人的坑。