DEEPgeneratedpublished

很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息,第一反应是眩晕

算力颗粒度上移与工业时钟错位机制

很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息,第一反应是眩晕。 10 万块顶级芯片,过去是国家级超算都要仰望的天文数字。 但如果把视线从模型参数移开,挪到硬件工厂的流水线上,会看到一个更让人窒息的算力现实。 NVIDIA 和它的制造伙伴,正在把 Vera Rubin NVL72 机柜的产能目标推向每天 1000 个。 一个 NVL72 机柜,封装了 72 块 GPU。 每天 1000 个机柜,意味着一天就能下线 7.2 万块 GPU。 那座被公众当成人类科技图腾的 10 万卡集群,在流水线上不过是 34 个小时的工业产出。 为什么动用几十亿美元才能搭起的超级集群,突然变成了流水线上的工业标品? 当芯片制造彻底跑出汽车组装线的速度,算力扩张真正的死穴又转移到了哪里? 把这套硬件架构拆开,会看到两台互相咬合、却转速截然相反的机器。 算力颗粒度上移,以及工业时钟错位。 过去大家理解算力,最小单位始终是那张插在主板上的独立芯片。 买显卡、插服务器、拉网线组网。 但随着模型规模指数级膨胀,单卡算力早就不是瓶颈,芯片之间的通信延迟才是致命的死穴。 NVIDIA 的解法,是直接把计算的最小颗粒度从单张芯片上移到了整座机柜。 在单个 NVL72 机柜里,72 块 GPU 和 36 块 CPU 被直接焊接在统一的铜缆背板上。 5184 根高频铜线,在机柜内部拉出了总长超过 3 公里的连接网络。 它省掉了昂贵且耗电的光电转换模块,直接省出 20 千瓦的电力用于计算,同时用直触液冷压住热量。 这让整座重达一吨多的机柜,在电气和拓扑结构上,彻底变成了一块超大型的单体计算机。 当计算单元被标准化封装成机柜,制造逻辑就从精细的半导体调试,跃升成了模块化的重工业装配。 富士康和广达这类代工巨头,可以用生产智能手机和汽车的成熟供应链,日夜不停地把机柜推下产线。 但流水线转得越快,撞上的物理围墙就越硬。 制造端可以按半导体的摩尔时钟狂奔,物理世界的能源系统却依然按重工业的百年时钟爬行。 一个 NVL72 机柜的运行功耗超过 130 千瓦。 每天下线 1000 个机柜,意味着每天都在向世界新增 130 兆瓦的电力需求。 每生产三天,就等同于要平地拔起一座中型核电站的发电量。 工厂能在 34 个小时内造出 10 万块芯片的机柜硬件。 但要给这 10 万块芯片通上电,一台特高压大型变压器的交付周期长达 4 年。 区域电网的并网审批和变电站扩建排队,动辄需要 5 年。 一端是 34 小时就能下线的算力硬件,另一端是需要数年才能铺设好的变电站、高压线缆与水冷基础设施。 算力竞赛的瓶颈,从来没有消失。 它只是顺着供应链迅速穿透了芯片制造层,一头撞死在现实世界的电网与重工业基建上。 当多数人还在惊叹模型用了多少张显卡时,决定下一次技术跃迁上限的,早已不再是工厂造芯片的产能,是在地表上接通变电站的速度。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情