{"id":"mb-20260905-b5e835","kind":"deep","title":"人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译","summary":"人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译","body":"人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译。\n这不是在写一篇似是而非的学术摘要。\n这是费马大定理自 1995 年被安德鲁·怀尔斯证明以来，第一次被计算机从头到尾彻底形式化检验。\n1300 万行 Lean 代码，体量是全球数学界多年心血 Mathlib 的 5 倍。\n向来以概率抽卡和胡说八道出名的大模型，凭什么能连跨 3 万个子命题，写出环环相扣的绝密逻辑？\n支撑这套系统的核心，是一台叫有向无环图前沿调度的协作机器。\n过去让 AI 做长链条形式化证明，最大的死穴是状态丢失。\n代码一旦超过几千行，模型的上下文就会被冲垮，智能体之间开始互相冲突，逻辑迅速散架。\n这次 Anthropic 联手哥伦比亚大学彭天一团队，在 Prove2Me 平台上换了一种解法。\n他们把怀尔斯的证明蓝图，拆解成一张拓扑有向无环图。\n整张图被细化为 30300 个互相咬合的中间定理。\n成百上千个 Claude 智能体，不互相闲聊，也不把千万行代码塞进上下文。\n它们只做一件事：从图谱最前沿领走一个未解决的数学节点。\n写出的代码，直接扔给 Lean 编译器检验。\n只要极简内核判定通过，这个节点立刻被锁死为不可动摇的基础依赖，供下游所有智能体调用。\n编译报错，就根据错误日志原地重新搜索证明路径。\n这彻底打破了关于大模型推理能力的旧共识。\n过去人们认为，大模型是纯粹的概率生成，推理步数越多，累积犯错率越高。\n但只要把大模型接进形式化验证内核，短板瞬间就变成了绝对长板。\n模型的发散猜测能力，成了在庞大证明空间里暴力搜寻路径的探针。\n编译器毫无妥协的验证闸门，成了滤除所有幻觉的硬性裁判。\n在 60 亿个 Token 的算力轰炸下，最终 29500 个定理被精准咬合进同一棵依赖树。\n帝国理工学院的凯文·巴扎德在 2024 年启动这个项目时，预估人类社区需要耗时数年。\n结果在 264 个小时之内，整座现代数学高塔被机器彻底重铸了一遍。\n这件事带来的震动，根本不在费马大定理本身。\n那个结论，人类三十年前就已经知道了。\n这里发生的质变，是严密逻辑的生产被彻底工业化了。\n过去人类需要耗费几十年去人工核验超长推导，如今只要裁判规则清晰，机器几天内就能推平整个认知高地。\n从纯数学证明，到芯片指令集验证、密码学协议、操作系统内核。\n当形式化验证被算力推平，还有多少建立在人类大脑疲劳上的逻辑黑箱，能够继续隐藏下去？","topic":"人类预计要敲 5 年的严密代码，AI 用 11 天写了 1300 万行，而且全部通过了编译","frame_type":["有向无环图前沿调度","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-05 07:31:32","legal_anchor_count":0,"transcript_citation_count":0}