把「10 万颗 GPU」叫成「10 万台服务器」,中间到底差了什么
把「10 万颗 GPU」叫成「10 万台服务器」,中间到底差了什么? 中间差了 720 万颗顶尖芯片。 差了 3500 亿美元硬件预算。 还差了 10 座核电反应堆的发电量。
两个词听起来差不多。 为什么差了 72 倍?
英伟达把 GB200 NVL72 包装成了一台单体服务器。 但这台所谓的服务器,是一个两米高的巨型水冷机柜。 一台机柜里面,整整塞了 72 颗 Blackwell GPU、36 颗 Grace CPU、9 个网络交换机托盘,以及 5000 根 NVLink 铜缆。 单台机柜净重 1.3 吨。 只要通上电,一台机柜的功耗就是 130 千瓦。
如果真按传闻建一座「10 万台 NVL72」的数据中心,机柜级计算的物理硬约束会立刻把人砸醒。 10 万台机柜乘上 72,那是 720 万颗芯片。 单是买硬件,就要掏出 3500 亿美元,超过微软、谷歌、Meta 三家一年的资本开支总和。
更要命的是电网。 10 万台机柜全功率开机,IT 功耗高达 13 吉瓦。 这是什么概念? 胡佛水坝的总装机容量只有 2 吉瓦。 三峡水电站峰值发电量是 22.5 吉瓦。 13 吉瓦相当于半座三峡水电站,或者 10 座标准核电反应堆在旁边全力发电。 没有任何国家的民用电网能承受这种级别的瞬间负荷。
今天科技巨头拼尽全力建的「10 万卡超级集群」,究竟是什么? 是 10 万颗 GPU 芯片。 折算下来,大约是 1389 台 NVL72 机柜。 1389 台机柜,总功耗大约在 180 兆瓦到 200 兆瓦。 为了给这 1389 台机柜找电,科技公司已经把天然气轮机直接拖到了厂房门口,排队几年去抢变电站配额。 调度这 1389 台机柜协同计算,哪怕一根铜缆过热降频,整个训练任务都会直接中断。
在 PPT 和金融模型的叙事里,算力只是一个可以无限放大的数字,从 10 万颗喊到 100 万颗。 但在物理世界里,算力是铜缆的信号衰减极限,是冷却液在管道里的流速,是变电站变压器的耐热温度。 100 万颗 GPU 的训练集群,至今依然躺在未来的图纸上。 更别提被随口夸大了 72 倍的「10 万台机柜」。
当物理定律、电网负荷和资本开支把边界死死焊在地面上时,算力不会因为少写了一个单位,就在空气里凭空长出来。
引用 / CITATIONS
No citations exported.
同领域解读 / CHIPS & HARDWARE
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封科技与 AI 深度解读,周一发出。不受审查,带出处,可核查。