DEEPgeneratedpublished

人类预计要敲 5 年的严密代码,AI 用 11 天写了 1300 万行,而且全部通过了编译

有向无环图前沿调度机制

人类预计要敲 5 年的严密代码,AI 用 11 天写了 1300 万行,而且全部通过了编译。 这不是在写一篇似是而非的学术摘要。 这是费马大定理自 1995 年被安德鲁·怀尔斯证明以来,第一次被计算机从头到尾彻底形式化检验。 1300 万行 Lean 代码,体量是全球数学界多年心血 Mathlib 的 5 倍。 向来以概率抽卡和胡说八道出名的大模型,凭什么能连跨 3 万个子命题,写出环环相扣的绝密逻辑? 支撑这套系统的核心,是一台叫有向无环图前沿调度的协作机器。 过去让 AI 做长链条形式化证明,最大的死穴是状态丢失。 代码一旦超过几千行,模型的上下文就会被冲垮,智能体之间开始互相冲突,逻辑迅速散架。 这次 Anthropic 联手哥伦比亚大学彭天一团队,在 Prove2Me 平台上换了一种解法。 他们把怀尔斯的证明蓝图,拆解成一张拓扑有向无环图。 整张图被细化为 30300 个互相咬合的中间定理。 成百上千个 Claude 智能体,不互相闲聊,也不把千万行代码塞进上下文。 它们只做一件事:从图谱最前沿领走一个未解决的数学节点。 写出的代码,直接扔给 Lean 编译器检验。 只要极简内核判定通过,这个节点立刻被锁死为不可动摇的基础依赖,供下游所有智能体调用。 编译报错,就根据错误日志原地重新搜索证明路径。 这彻底打破了关于大模型推理能力的旧共识。 过去人们认为,大模型是纯粹的概率生成,推理步数越多,累积犯错率越高。 但只要把大模型接进形式化验证内核,短板瞬间就变成了绝对长板。 模型的发散猜测能力,成了在庞大证明空间里暴力搜寻路径的探针。 编译器毫无妥协的验证闸门,成了滤除所有幻觉的硬性裁判。 在 60 亿个 Token 的算力轰炸下,最终 29500 个定理被精准咬合进同一棵依赖树。 帝国理工学院的凯文·巴扎德在 2024 年启动这个项目时,预估人类社区需要耗时数年。 结果在 264 个小时之内,整座现代数学高塔被机器彻底重铸了一遍。 这件事带来的震动,根本不在费马大定理本身。 那个结论,人类三十年前就已经知道了。 这里发生的质变,是严密逻辑的生产被彻底工业化了。 过去人类需要耗费几十年去人工核验超长推导,如今只要裁判规则清晰,机器几天内就能推平整个认知高地。 从纯数学证明,到芯片指令集验证、密码学协议、操作系统内核。 当形式化验证被算力推平,还有多少建立在人类大脑疲劳上的逻辑黑箱,能够继续隐藏下去?

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情