---
id: "mb-20260904-6d8c80"
kind: "deep"
title: "16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型"
topic: "16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型"
source_type: "generated"
status: "published"
generated_at: "2026-09-04 20:42:02"
frame_type: ["同步屏障（Synchronization Bar", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# 16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型

16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型。
这不是产能不够，也不是算力跑分低。
DeepSeek 在内蒙古乌兰察布规划了一个庞大的算力基地。
彭博社披露的信息里，有一个关键细节：
这 16 万张华为昇腾 950DT 芯片，全部只用来做推理，训练依然留在英伟达身上。
既然买了 16 万张，为什么不拿来训练？
答案不在单张芯片的算力大小，在分布式计算里那道看不见的硬墙。
这道墙叫同步屏障。
大模型训练是世界上对木桶理论要求最苛刻的系统工程。
几万张芯片连在一起预训练，每一轮计算，所有芯片都必须通过全归约通信同步梯度。
只要 16 万张卡里有 1 张掉线、丢包或者驱动崩溃，整个集群就会瞬间停摆。
系统的平均无故障时间，会随着芯片数量增加而成倍雪崩。
即便单张芯片有 99.9% 的稳定性，几万张卡同步咬合在一起，也会频繁卡死在等待同伴的屏障前。
推理是完全不同的逻辑。
推理是并联的水龙头。
16 万张卡不需要全集群同步。它被切分成上万个互不干涉的小单元，每 8 张卡跑一个模型副本。
第 500 号节点死机了，只有这几个用户的请求需要重试，其余几千个节点照常吐字。
这就是为什么 16 万张卡看起来是一个巨大的整体。
在物理世界上，它是一万个独立运作的小岛。
堆卡做推理，考验的是供货能力与单卡显存带宽。
堆卡做训练，考验的是底层的集群互连、软件生态与全集群容错。
当外界还在用芯片采购总数衡量算力自给率时，底层的工程分水岭早就划好了。
能拆散独立运行的边缘任务，可以用数量并联把瑕疵消化掉。
需要全集群毫秒级协同的核心中枢，只要有一张卡掉队，整座算力大厦就寸步难行。

_Rendered by mubei-terminal._
