{"id":"mb-20260904-6d8c80","kind":"deep","title":"16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型","summary":"16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型","body":"16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型。\n这不是产能不够，也不是算力跑分低。\nDeepSeek 在内蒙古乌兰察布规划了一个庞大的算力基地。\n彭博社披露的信息里，有一个关键细节：\n这 16 万张华为昇腾 950DT 芯片，全部只用来做推理，训练依然留在英伟达身上。\n既然买了 16 万张，为什么不拿来训练？\n答案不在单张芯片的算力大小，在分布式计算里那道看不见的硬墙。\n这道墙叫同步屏障。\n大模型训练是世界上对木桶理论要求最苛刻的系统工程。\n几万张芯片连在一起预训练，每一轮计算，所有芯片都必须通过全归约通信同步梯度。\n只要 16 万张卡里有 1 张掉线、丢包或者驱动崩溃，整个集群就会瞬间停摆。\n系统的平均无故障时间，会随着芯片数量增加而成倍雪崩。\n即便单张芯片有 99.9% 的稳定性，几万张卡同步咬合在一起，也会频繁卡死在等待同伴的屏障前。\n推理是完全不同的逻辑。\n推理是并联的水龙头。\n16 万张卡不需要全集群同步。它被切分成上万个互不干涉的小单元，每 8 张卡跑一个模型副本。\n第 500 号节点死机了，只有这几个用户的请求需要重试，其余几千个节点照常吐字。\n这就是为什么 16 万张卡看起来是一个巨大的整体。\n在物理世界上，它是一万个独立运作的小岛。\n堆卡做推理，考验的是供货能力与单卡显存带宽。\n堆卡做训练，考验的是底层的集群互连、软件生态与全集群容错。\n当外界还在用芯片采购总数衡量算力自给率时，底层的工程分水岭早就划好了。\n能拆散独立运行的边缘任务，可以用数量并联把瑕疵消化掉。\n需要全集群毫秒级协同的核心中枢，只要有一张卡掉队，整座算力大厦就寸步难行。","topic":"16万张国产AI芯片，堆在一座耗电1吉瓦的数据中心里，却一张都不能用来训练大模型","frame_type":["同步屏障（Synchronization Bar","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-04 20:42:02","legal_anchor_count":0,"transcript_citation_count":0}