---
id: "mb-20260905-b5e835"
kind: "deep"
title: "人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译"
topic: "人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译"
source_type: "generated"
status: "published"
generated_at: "2026-09-05 07:31:32"
frame_type: ["有向无环图前沿调度", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译

人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译。
这不是在写一篇似是而非的学术摘要。
这是费马大定理自 1995 年被安德鲁·怀尔斯证明以来，第一次被计算机从头到尾彻底形式化检验。
1300 万行 Lean 代码，体量是全球数学界多年心血 Mathlib 的 5 倍。
向来以概率抽卡和胡说八道出名的大模型，凭什么能连跨 3 万个子命题，写出环环相扣的绝密逻辑？
支撑这套系统的核心，是一台叫有向无环图前沿调度的协作机器。
过去让 AI 做长链条形式化证明，最大的死穴是状态丢失。
代码一旦超过几千行，模型的上下文就会被冲垮，智能体之间开始互相冲突，逻辑迅速散架。
这次 Anthropic 联手哥伦比亚大学彭天一团队，在 Prove2Me 平台上换了一种解法。
他们把怀尔斯的证明蓝图，拆解成一张拓扑有向无环图。
整张图被细化为 30300 个互相咬合的中间定理。
成百上千个 Claude 智能体，不互相闲聊，也不把千万行代码塞进上下文。
它们只做一件事：从图谱最前沿领走一个未解决的数学节点。
写出的代码，直接扔给 Lean 编译器检验。
只要极简内核判定通过，这个节点立刻被锁死为不可动摇的基础依赖，供下游所有智能体调用。
编译报错，就根据错误日志原地重新搜索证明路径。
这彻底打破了关于大模型推理能力的旧共识。
过去人们认为，大模型是纯粹的概率生成，推理步数越多，累积犯错率越高。
但只要把大模型接进形式化验证内核，短板瞬间就变成了绝对长板。
模型的发散猜测能力，成了在庞大证明空间里暴力搜寻路径的探针。
编译器毫无妥协的验证闸门，成了滤除所有幻觉的硬性裁判。
在 60 亿个 Token 的算力轰炸下，最终 29500 个定理被精准咬合进同一棵依赖树。
帝国理工学院的凯文·巴扎德在 2024 年启动这个项目时，预估人类社区需要耗时数年。
结果在 264 个小时之内，整座现代数学高塔被机器彻底重铸了一遍。
这件事带来的震动，根本不在费马大定理本身。
那个结论，人类三十年前就已经知道了。
这里发生的质变，是严密逻辑的生产被彻底工业化了。
过去人类需要耗费几十年去人工核验超长推导，如今只要裁判规则清晰，机器几天内就能推平整个认知高地。
从纯数学证明，到芯片指令集验证、密码学协议、操作系统内核。
当形式化验证被算力推平，还有多少建立在人类大脑疲劳上的逻辑黑箱，能够继续隐藏下去？

_Rendered by mubei-terminal._
