深度解读软件与工程generatedpublished

一个卡了全球数学界整整四年的世界级密码难题,被机房里的边角料算开了

算力碎屑套利与智能体底层工程重构机制

一个卡了全球数学界整整四年的世界级密码难题,被机房里的边角料算开了。 260 位的半素数 RSA-260,从 1991 年设立挑战以来,一直挂在未解清单上。 上一次有人刷新公开纪录还是 2020 年。 当时几个国家的研究机构联合起来,调动上千台服务器苦战几个月,才勉强算到了 250 位。 之后的四年里,这道题再也没人能往前推进一步。 上周这个世界纪录突然被打破了。 没有国家级实验室牵头,没有算法层面的惊天突破,甚至解题的人都不是全职研究密码学的学者。 是一家人工智能公司的工程师,带着十几个人工智能体,用三周业余时间搞定的。 按市价计算,这次运算消耗了大约 4900 个 GPU 天,算力账面价值接近 40 万美元。 但他实际付出的边际算力成本,是零。 为什么一个业余项目能把全球学术界卡了四年的天堑推平? 难道量子计算提前落地了? 还是有人找到了分解大质数的数学捷径? 都不是。 核心算法依然是 1990 年就诞生的通用数域筛法。 数学公式三十年没变,为什么以前做不到,现在一个人就能做完? 因为阻碍因数分解推进的从来不只是数学,是底层工程。 要分解一个 260 位的超大数,必须经过极其庞杂的晶格筛阶段。 这个阶段要从天文数字般的可能中,筛选出上百亿组符合条件的线性关系。 在数学家的纸面上,晶格筛属于所谓令人尴尬的易并行。 意思是可以随便切成几十万份,分给不同的机器各自跑,彼此不需要频繁同步。 可一旦落到工程实现上,它是所有程序员的噩梦。 每一小块计算,都伴随着海量、随机的内存读写。 过去三十年里,全球密码学界沉淀下来的开源工具叫 CADO-NFS。 那是几代学者用数十万行 C 语言堆出来的庞然大物,骨子里全是针对传统 CPU 架构写的代码。 图形处理器 GPU 拥有极其恐怖的显存带宽,理论上效率能甩开 CPU 几条街。 但要把几十万行充斥着深奥代数数论的旧代码,重构到底层 CUDA 架构上,谈何容易。 学术机构拿不出这么庞大的工程人力,顶尖的系统工程师也没兴趣替象牙塔里的数论难题去一行行改代码。 这道卡了四年的工程窄门,被智能体一脚踹开了。 8 月 13 日半夜,工程师给人工智能工程师 Devin 发了一条指令: 用 GPU 写一个能替代传统 CPU 晶格筛的程序。 两个小时后,他补充了一句参数要求,然后去睡觉了。 七个小时后他醒过来,Devin 已经交出了第一个能跑通的 GPU 晶格筛原型。 接下来三周,他拉起了一支智能体小队。 平均同时有 3 个 Devin 协作,高峰时多达 18 个会话并行推进。 智能体没有去推导新公式,它承担了人类工程师最不想干的脏活和累活。 重写多项式选择工具,优化数亿个任务的分发调度,把稀疏线性方程组求解移植到多节点跨卡通信上。 当计算推进到最后的求平方根阶段,数据量暴增到 1760 亿位,开源高精度库的整数计数器直接溢出崩溃。 换作人类团队,可能要停下来排查好几天。 Devin 在沙箱里连续推翻重构了三次代码,最后手写了一个基于数论变换 NTT 的 GPU 加速开方程序,只用了 88 分钟就吐出了最终的质因数。 整整 233 个会话,智能体自己还衍生出了 101 个子任务。 原本需要一支资深高性能计算团队死磕大半年的工程迁移,被压缩进了三个星期。 那 4900 个 GPU 天的算力又是从哪里白嫖来的? 这触碰到了今天算力基础设施里一个隐秘的结构性浪费:算力碎屑。 训练大语言模型的集群,比如包含 72 颗芯片的整机柜服务器,对网络互联有着近乎变态的要求。 几十张芯片必须通过专用超高速总线紧紧捆绑在一起,同时吞吐参数。 但在实际的调度算法里,总有一些机柜会因为容灾冗余或者配对不齐,剩下那么一两台落单的机器。 这类落单的节点,对大模型训练来说毫无用处,甚至不够塞牙缝。 每一家拥有超大规模算力中心的公司,每天都有 3% 到 7% 的算力以这种碎屑形态被白白蒸发。 晶格筛恰恰是处理算力碎屑的完美容器。 它既不需要跨机柜同步,又能随时在单台机器上独立推进,遇上高优先级任务哪怕被瞬间抢占强退,也不会损坏整体进度。 智能体一边重写底层代码,调度器一边像吸尘器一样,把机房缝隙里溢出来的算力碎屑全部吃干抹净。 四百个节点散在集群各处,在大模型训练的间隙里,把 260 位的密码天堑咬开了一个窟窿。 这件事最吓人的地方,不在于一个数学挑战被终结。 很多人看到新闻的第一反应,是担心自己的银行卡密码和浏览器加密是不是要失效了。 答案是完全不用慌。 今天主流互联网使用的 RSA 密钥长度是 2048 位。 按照数域筛法的难度曲线上升,破解 2048 位的难度比 1024 位还要高出整整十亿倍,现有经典算力根本碰不到它的边。 真正的警钟敲给那些躲在历史角落里的旧系统。 2013 年就被官方宣布弃用的 1024 位 RSA 密钥,在不少老旧工业设备和遗留网络协议里依然在跑。 过去大家觉得破译 1024 位只存在于理论猜想,或者需要国家情报机构专门造一台专用集成电路芯片去暴力硬解。 但按照这次验证出来的算力换算比,破解 1024 位的计算量仅仅是 260 位的 78 倍。 任何一家手握集群的云厂商,只要愿意掏出 3000 万美元的算力碎屑,就能把 1024 位的大门直接推开。 科学研究的门槛正在发生一场剧烈的地壳变动。 过去几百年里,一个领域的研究高度,取决于有多少顶尖学者愿意把青春耗在繁琐的工具链打磨上。 现在,只要一个工程问题能够被代码定义,智能体就能在几天内抹平成倍的人力差距。 当深奥的学术壁垒被降维成可自动化的工程流水线,当昂贵的算力可以从大工业的排污口免费接管。 世界上那些曾经被认为固若金汤的坚硬堡垒,还剩下几个?

引用 / CITATIONS

No citations exported.

同领域解读 / SOFTWARE & ENGINEERING

查看全部「软件与工程」解读 →

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情