{"id":"mb-20260904-c511e4","kind":"deep","title":"一条消息在科技圈刷屏：DeepSeek 计划采购超过十万片华为芯片，用来摆脱对英伟达的依赖","summary":"一条消息在科技圈刷屏：DeepSeek 计划采购超过十万片华为芯片，用来摆脱对英伟达的依赖","body":"一条消息在科技圈刷屏：DeepSeek 计划采购超过十万片华为芯片，用来摆脱对英伟达的依赖。\n很多人看到这个数字，立刻得出一个结论：国产算力对英伟达的全面替代开始了。\n但翻开这份计划的工程细节，会发现所有简化的标题都漏掉了一个定语。\n这批部署在内蒙古乌兰察布数据中心的十六万片华为昇腾 950DT 芯片，全部只用来做一件事：推理。\n在最核心的模型训练环节，DeepSeek 依然把底座死死压在英伟达上。\n为什么敢在吞吐量最大的服务环节换上国产芯片，\n却在模型诞生的核心底座上，连一块英伟达都不敢动？\n是国产芯片算得不够快，还是大模型的运转逻辑里，藏着两套完全相反的物理法则？\n把这笔工程账拆到底，会看到一台支配着整个算力世界的冰冷机器。\n算力双轨制与容错断层。\n大模型的运算被笼统地叫做算力，底下其实是两台截然不同的物理系统。\n第一台机器叫模型训练。\n这是整个计算工业里容错率最低的极限工程。\n数万张旗舰 GPU 连成一个超大规模集群，芯片之间通过高带宽总线实时进行全同步梯度通信。\n这是严苛的木桶模型。\n三万张卡同时运转，哪怕只有一张卡出现几毫秒的延迟抖动或者死机，\n整个价值数千万美元的训练任务就会立刻中断，被迫回滚到上一个检查点。\n集群的真实性能，不取决于最快的那张卡算得多快，\n取决于最慢的那张卡什么时候掉线。\n英伟达最深的护城河从来不是单张显卡的浮点跑分。\n是数万张卡互联时的超低通信延迟，以及近二十年积累下来的零故障容错生态。\n第二台机器叫模型推理。\n当模型训练完成，部署到机房响应全球用户的实时提问，规则彻底变了。\n推理本质上是无状态的并发吞吐。\n用户的每一个请求被分发到不同的服务器节点，各自独立计算。\n某一台机器突然死机或者掉线，负载均衡网关只需在几毫秒内把请求切给下一台服务器。\n终端用户最多感知到半秒卡顿，整个集群的运行丝毫不受影响。\n在推理的世界里，系统的容错率从零被放大到了接近无穷大。\nDeepSeek 敢在乌兰察布下注十六万片昇腾芯片，底气来自算法对硬件瓶颈的解耦。\n团队在架构上设计的多头潜在注意力，把推理时最消耗显存的缓存带宽压缩了九成以上。\n当内存墙的压力被算法卸掉，推理对芯片之间极致通信互联的苛刻要求随之大幅降低。\n把容错率极高的并发苦力交给国产芯片，\n把毫无容错空间的训练母体留在英伟达。\n这是一场极其精密的工程分流。\n但这台机器的运转，同样必须面对真实的物理约束。\n彭博社披露的信息显示，这笔十六万片昇腾 950DT 的订单，华为需要耗费一年以上才能完成交付。\n先进制程的封装良率，以及高带宽内存 HBM 的供应短缺，成了产能面前无法绕过的硬墙。\n商业叙事喜欢把芯片博弈描绘成非黑即白的单点替换。\n底层的物理世界只服从通信拓扑、故障概率与制造成本。\n真正的算力突围，从来不需要靠口号去宣布脱钩。\n能够看清两台机器各自的容错边界，用最现实的架构妥协换取最大的生存空间，才是工程世界的硬道理。","topic":"一条消息在科技圈刷屏：DeepSeek 计划采购超过十万片华为芯片，用来摆脱对英伟达的依赖","frame_type":["算力双轨制与训练推理容错断层","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-09-04 20:42:02","legal_anchor_count":0,"transcript_citation_count":0}