{"id":"mb-20260907-ed560f","kind":"deep","title":"很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕","summary":"很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕","body":"很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕。\n10 万块顶级芯片，过去是国家级超算都要仰望的天文数字。\n但如果把视线从模型参数移开，挪到硬件工厂的流水线上，会看到一个更让人窒息的算力现实。\nNVIDIA 和它的制造伙伴，正在把 Vera Rubin NVL72 机柜的产能目标推向每天 1000 个。\n一个 NVL72 机柜，封装了 72 块 GPU。\n每天 1000 个机柜，意味着一天就能下线 7.2 万块 GPU。\n那座被公众当成人类科技图腾的 10 万卡集群，在流水线上不过是 34 个小时的工业产出。\n为什么动用几十亿美元才能搭起的超级集群，突然变成了流水线上的工业标品？\n当芯片制造彻底跑出汽车组装线的速度，算力扩张真正的死穴又转移到了哪里？\n把这套硬件架构拆开，会看到两台互相咬合、却转速截然相反的机器。\n算力颗粒度上移，以及工业时钟错位。\n过去大家理解算力，最小单位始终是那张插在主板上的独立芯片。\n买显卡、插服务器、拉网线组网。\n但随着模型规模指数级膨胀，单卡算力早就不是瓶颈，芯片之间的通信延迟才是致命的死穴。\nNVIDIA 的解法，是直接把计算的最小颗粒度从单张芯片上移到了整座机柜。\n在单个 NVL72 机柜里，72 块 GPU 和 36 块 CPU 被直接焊接在统一的铜缆背板上。\n5184 根高频铜线，在机柜内部拉出了总长超过 3 公里的连接网络。\n它省掉了昂贵且耗电的光电转换模块，直接省出 20 千瓦的电力用于计算，同时用直触液冷压住热量。\n这让整座重达一吨多的机柜，在电气和拓扑结构上，彻底变成了一块超大型的单体计算机。\n当计算单元被标准化封装成机柜，制造逻辑就从精细的半导体调试，跃升成了模块化的重工业装配。\n富士康和广达这类代工巨头，可以用生产智能手机和汽车的成熟供应链，日夜不停地把机柜推下产线。\n但流水线转得越快，撞上的物理围墙就越硬。\n制造端可以按半导体的摩尔时钟狂奔，物理世界的能源系统却依然按重工业的百年时钟爬行。\n一个 NVL72 机柜的运行功耗超过 130 千瓦。\n每天下线 1000 个机柜，意味着每天都在向世界新增 130 兆瓦的电力需求。\n每生产三天，就等同于要平地拔起一座中型核电站的发电量。\n工厂能在 34 个小时内造出 10 万块芯片的机柜硬件。\n但要给这 10 万块芯片通上电，一台特高压大型变压器的交付周期长达 4 年。\n区域电网的并网审批和变电站扩建排队，动辄需要 5 年。\n一端是 34 小时就能下线的算力硬件，另一端是需要数年才能铺设好的变电站、高压线缆与水冷基础设施。\n算力竞赛的瓶颈，从来没有消失。\n它只是顺着供应链迅速穿透了芯片制造层，一头撞死在现实世界的电网与重工业基建上。\n当多数人还在惊叹模型用了多少张显卡时，决定下一次技术跃迁上限的，早已不再是工厂造芯片的产能，是在地表上接通变电站的速度。","topic":"很多人看到 GPT-6 在 Stargate 超级集群上用超过 10 万块 GPU 预训练的消息，第一反应是眩晕","frame_type":["算力颗粒度上移与工业时钟错位","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-07 06:53:21","legal_anchor_count":0,"transcript_citation_count":0}