DEEPgeneratedpublished

一张卖三万美元的顶级显卡,被塞进几万张卡的机房后,大半时间根本没在算题

通信墙与机房集群交通管制(All-Reduce同机制

本框架为第三方 AI 对公开观点的解读,非郭文贵本人发声。

一张卖三万美元的顶级显卡,被塞进几万张卡的机房后,大半时间根本没在算题。 它不是算力不够。 它是在等数据。 几万张显卡同时训练一个大模型。 只要有一条网络线路堵车,其余上万张卡就得集体熄火干等。 这个现象在分布式计算里,叫通信墙。 参数表上往往只写单张芯片的跑分:多少晶体管、多少算力、主频提了多少。 但参数在规模面前,是最容易失效的东西。 训练和运行前沿大模型,本质是把一个庞大的数学矩阵切碎。 分摊给成千上万张显卡同时计算。 尤其在主流的混合专家架构(MoE)下,不同的显卡负责不同的专家模块。 计算每推进一层,海量数据就要在几万张卡之间进行一次全员大换位。 每张卡算完手头的部分,必须全网同步中间结果。 同步完成,才能开启下一轮计算。 这就是全归约通信(All-Reduce)与全到全通信(All-to-All)。 机房网络只要发生毫秒级拥堵,或者某台交换机丢了一个数据包。 掉队者效应就会立刻发生。 跑得最快的那批芯片,必须原地待机,等那条最慢的线路把数据送达。 单张显卡的算力哪怕翻上一倍,只要卡与卡之间的网络跟不上,整个集群的实际利用率就会掉到三成以下。 买来的是算力,烧掉的却是等路况的电费。 早在 2019 年 3 月,黄仁勋就用 69 亿美元全现金,买下了以色列网络设备商 Mellanox。 当时华尔街很多人觉得买贵了,英伟达不过是个卖显卡的公司。 但黄仁勋当时下的注很明确:单颗芯片的时代结束了,整个数据中心才是真正的计算机。 从自研的高速互连协议 NVLink,到底层的专用交换机 NVSwitch。 机房里的较量,早就转移到了交通管制。 它卖的从来不是单颗计算核心。 它卖的是一整套让几万条车道同时狂奔、绝不堵车的高速路网。 对手可以造出纸面参数咬得很紧的芯片。 可一旦拉出上万张卡的阵列。 缺乏毫秒级的控流网络,算力就会在漫长的等待中被彻底耗光。 真正的技术壁垒,往往不在那个最显眼的零件上。 在那个把所有零件咬合在一起、不让系统陷入内耗的调度网络里。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情