一万个 AI 智能体关在同一个系统里,连续算了整整 88 个小时
一万个 AI 智能体关在同一个系统里,连续算了整整 88 个小时。
最后它们总共发了多少条消息?
只有 270 万条。
算下来,平均每个智能体,一个小时只说了 3 句话。
但这 270 万条消息,生生吞掉了 1300 亿个 Token。
单条消息的平均长度,接近 5 万个 Token。
它们面对的题目,是数学史上最顽固的堡垒之一:纳维-斯托克斯方程。
这套由纳维和斯托克斯在 19 世纪写下的方程,管着空气、水流和湍流的一切运动。
2000 年,克雷数学研究所把它列入千禧年七大数学难题,悬赏 100 万美元。
两百年来,人类顶尖数学家都在问同一个问题:
三维空间里的流体方程,在光滑的初始条件下,解究竟会永远保持光滑,还是会在有限时间内突然爆发出无穷大的奇点?
如果解会出现奇点,意味着现有的经典物理方程在某一个瞬间会彻底失效。
两百年间,全世界没有一个人能给出严格证明。
直到 OpenAI 的研究团队披露,他们代号 Astra 的推理系统完成了这项数学搜索。
消息一出,很多人脑子里浮现的画面,是一万个智能体像人类专家开会一样,在群聊里热烈讨论、互相纠错。
任何亲手搭过多智能体系统的人都知道,这种多人开会的设想在现实里是一场灾难。
两个智能体对话,很快就会陷入互相客套的死循环。
五个智能体拉进一个群,只要其中一个产生幻觉,剩下的就会开始集体强化这个错误。
聊上二十轮,上下文窗口就被大量毫无意义的寒暄和重复填满,逻辑推理能力直接归零。
要是真把一万个智能体放进传统的聊天架构里,跑上 10 分钟,系统就会在海量的信息垃圾中宕机。
为什么 OpenAI 这一万个智能体没有吵成一团?
多智能体框架 AutoGen 的创建者 Chi Wang 点出了这台机器的真实骨架。
一万个智能体根本没聚在一个聊天室里。
整套系统的调度核心只在做三件事:激进剪枝、确定性路由,以及对局部证明成果的无情复用。
先看它是怎么剪枝的。
数学推导和其他文本任务最大的不同,在于它不存在似是而非的中间地带。
对就是对,错就是错。
系统背后站着一个没有感情的裁判:Lean 形式化数学证明器。
智能体推导出来的每一步逻辑,都会被直接编译成严密的机器代码。
某个智能体沿着一条路径去构造奇点,只要在 Lean 里报出一个语法或逻辑错误,调度器直接掐断这条分支。
没有委婉的提示,没有复盘讨论,这条死路上的算力瞬间被清空回收。
再看它是怎么路由的。
这一万个智能体彼此之间根本看不见对方。
系统切断了横向交流的网状通道,直接把证明任务拆成树状层级。
有的智能体专门负责在特定坐标系下构造能量积分,有的专门计算速度场的边界条件,有的只负责把自然语言推论转译成 Lean 语法。
每个智能体只接收上一层路由分发给它的特定输入,推导完成后直接把数据丢给验证节点。
横向没有窃窃私语,自然就没有噪声的指数级放大。
最关键的一步,是局部成果复用。
单条消息为什么能达到近 5 万个 Token?
智能体交出来的从来不是闲聊,是一整篇包含几万行推导的局部定理验证。
只要有一个智能体成功攻克了一个关键引理,并通过了 Lean 的严格核验,这个引理就会立即被冻结成公共资产。
它被直接写入中央黑板。
后面几千个智能体在探索其他分支时,可以直接把这个已证实的引理当成公理调用。
不需要任何人重新推导一遍,也不需要开会通报。
88 个小时里,一万个智能体就是靠着这种流水线般的冰冷吞吐,在天文数字般的数学解空间里完成了地毯式搜索。
随后的 17 个小时,整套证明在 Lean 系统里跑完了最后的形式化闭环。
这场探索在学术界掀起了轩然大波。
纽约大学数学家 Tristan Buckmaster 和 Anthropic 的合作者甚至公开提出质疑,担心自己此前保存在平台工具里的研究草稿间接提供了启发。
克雷数学研究所要求的同行评审通常长达两年,数学共同体对这个结果的最终有效性依然保持着审慎。
但对于计算机科学而言,一个更底层的分水岭已经立在了所有人面前。
长期以来,外界对多智能体的想象,总是停留在模拟人类社会的协同上。
人们以为只要给不同智能体分配角色,让它们自由对话,就能涌现出群体智慧。
这组数据无情地击碎了这个幻想。
一万个智能体,只发了 270 万条消息。
把算力推向人类智力极限的,不是更频繁的交流。
是把所有的社交摩擦压缩到零,让机器验证器在沉默中砍掉成千上万条死路,只留下最硬的逻辑骨架。
引用 / CITATIONS
No citations exported.
同领域解读 / AI & LLMS
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。