16万张国产AI芯片,堆在一座耗电1吉瓦的数据中心里,却一张都不能用来训练大模型
16万张国产AI芯片,堆在一座耗电1吉瓦的数据中心里,却一张都不能用来训练大模型。 这不是产能不够,也不是算力跑分低。 DeepSeek 在内蒙古乌兰察布规划了一个庞大的算力基地。 彭博社披露的信息里,有一个关键细节: 这 16 万张华为昇腾 950DT 芯片,全部只用来做推理,训练依然留在英伟达身上。 既然买了 16 万张,为什么不拿来训练? 答案不在单张芯片的算力大小,在分布式计算里那道看不见的硬墙。 这道墙叫同步屏障。 大模型训练是世界上对木桶理论要求最苛刻的系统工程。 几万张芯片连在一起预训练,每一轮计算,所有芯片都必须通过全归约通信同步梯度。 只要 16 万张卡里有 1 张掉线、丢包或者驱动崩溃,整个集群就会瞬间停摆。 系统的平均无故障时间,会随着芯片数量增加而成倍雪崩。 即便单张芯片有 99.9% 的稳定性,几万张卡同步咬合在一起,也会频繁卡死在等待同伴的屏障前。 推理是完全不同的逻辑。 推理是并联的水龙头。 16 万张卡不需要全集群同步。它被切分成上万个互不干涉的小单元,每 8 张卡跑一个模型副本。 第 500 号节点死机了,只有这几个用户的请求需要重试,其余几千个节点照常吐字。 这就是为什么 16 万张卡看起来是一个巨大的整体。 在物理世界上,它是一万个独立运作的小岛。 堆卡做推理,考验的是供货能力与单卡显存带宽。 堆卡做训练,考验的是底层的集群互连、软件生态与全集群容错。 当外界还在用芯片采购总数衡量算力自给率时,底层的工程分水岭早就划好了。 能拆散独立运行的边缘任务,可以用数量并联把瑕疵消化掉。 需要全集群毫秒级协同的核心中枢,只要有一张卡掉队,整座算力大厦就寸步难行。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。