---
id: "mb-20260907-ed560f"
kind: "deep"
title: "很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕"
topic: "很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕"
source_type: "generated"
status: "published"
generated_at: "2026-09-07 06:53:21"
frame_type: ["算力颗粒度上移与工业时钟错位", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕

很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕。
10 万块顶级芯片，过去是国家级超算都要仰望的天文数字。
但如果把视线从模型参数移开，挪到硬件工厂的流水线上，会看到一个更让人窒息的算力现实。
NVIDIA 和它的制造伙伴，正在把 Vera Rubin NVL72 机柜的产能目标推向每天 1000 个。
一个 NVL72 机柜，封装了 72 块 GPU。
每天 1000 个机柜，意味着一天就能下线 7.2 万块 GPU。
那座被公众当成人类科技图腾的 10 万卡集群，在流水线上不过是 34 个小时的工业产出。
为什么动用几十亿美元才能搭起的超级集群，突然变成了流水线上的工业标品？
当芯片制造彻底跑出汽车组装线的速度，算力扩张真正的死穴又转移到了哪里？
把这套硬件架构拆开，会看到两台互相咬合、却转速截然相反的机器。
算力颗粒度上移，以及工业时钟错位。
过去大家理解算力，最小单位始终是那张插在主板上的独立芯片。
买显卡、插服务器、拉网线组网。
但随着模型规模指数级膨胀，单卡算力早就不是瓶颈，芯片之间的通信延迟才是致命的死穴。
NVIDIA 的解法，是直接把计算的最小颗粒度从单张芯片上移到了整座机柜。
在单个 NVL72 机柜里，72 块 GPU 和 36 块 CPU 被直接焊接在统一的铜缆背板上。
5184 根高频铜线，在机柜内部拉出了总长超过 3 公里的连接网络。
它省掉了昂贵且耗电的光电转换模块，直接省出 20 千瓦的电力用于计算，同时用直触液冷压住热量。
这让整座重达一吨多的机柜，在电气和拓扑结构上，彻底变成了一块超大型的单体计算机。
当计算单元被标准化封装成机柜，制造逻辑就从精细的半导体调试，跃升成了模块化的重工业装配。
富士康和广达这类代工巨头，可以用生产智能手机和汽车的成熟供应链，日夜不停地把机柜推下产线。
但流水线转得越快，撞上的物理围墙就越硬。
制造端可以按半导体的摩尔时钟狂奔，物理世界的能源系统却依然按重工业的百年时钟爬行。
一个 NVL72 机柜的运行功耗超过 130 千瓦。
每天下线 1000 个机柜，意味着每天都在向世界新增 130 兆瓦的电力需求。
每生产三天，就等同于要平地拔起一座中型核电站的发电量。
工厂能在 34 个小时内造出 10 万块芯片的机柜硬件。
但要给这 10 万块芯片通上电，一台特高压大型变压器的交付周期长达 4 年。
区域电网的并网审批和变电站扩建排队，动辄需要 5 年。
一端是 34 小时就能下线的算力硬件，另一端是需要数年才能铺设好的变电站、高压线缆与水冷基础设施。
算力竞赛的瓶颈，从来没有消失。
它只是顺着供应链迅速穿透了芯片制造层，一头撞死在现实世界的电网与重工业基建上。
当多数人还在惊叹模型用了多少张显卡时，决定下一次技术跃迁上限的，早已不再是工厂造芯片的产能，是在地表上接通变电站的速度。

_Rendered by mubei-terminal._
