一条消息在科技圈刷屏:DeepSeek 计划采购超过十万片华为芯片,用来摆脱对英伟达的依赖
一条消息在科技圈刷屏:DeepSeek 计划采购超过十万片华为芯片,用来摆脱对英伟达的依赖。 很多人看到这个数字,立刻得出一个结论:国产算力对英伟达的全面替代开始了。 但翻开这份计划的工程细节,会发现所有简化的标题都漏掉了一个定语。 这批部署在内蒙古乌兰察布数据中心的十六万片华为昇腾 950DT 芯片,全部只用来做一件事:推理。 在最核心的模型训练环节,DeepSeek 依然把底座死死压在英伟达上。 为什么敢在吞吐量最大的服务环节换上国产芯片, 却在模型诞生的核心底座上,连一块英伟达都不敢动? 是国产芯片算得不够快,还是大模型的运转逻辑里,藏着两套完全相反的物理法则? 把这笔工程账拆到底,会看到一台支配着整个算力世界的冰冷机器。 算力双轨制与容错断层。 大模型的运算被笼统地叫做算力,底下其实是两台截然不同的物理系统。 第一台机器叫模型训练。 这是整个计算工业里容错率最低的极限工程。 数万张旗舰 GPU 连成一个超大规模集群,芯片之间通过高带宽总线实时进行全同步梯度通信。 这是严苛的木桶模型。 三万张卡同时运转,哪怕只有一张卡出现几毫秒的延迟抖动或者死机, 整个价值数千万美元的训练任务就会立刻中断,被迫回滚到上一个检查点。 集群的真实性能,不取决于最快的那张卡算得多快, 取决于最慢的那张卡什么时候掉线。 英伟达最深的护城河从来不是单张显卡的浮点跑分。 是数万张卡互联时的超低通信延迟,以及近二十年积累下来的零故障容错生态。 第二台机器叫模型推理。 当模型训练完成,部署到机房响应全球用户的实时提问,规则彻底变了。 推理本质上是无状态的并发吞吐。 用户的每一个请求被分发到不同的服务器节点,各自独立计算。 某一台机器突然死机或者掉线,负载均衡网关只需在几毫秒内把请求切给下一台服务器。 终端用户最多感知到半秒卡顿,整个集群的运行丝毫不受影响。 在推理的世界里,系统的容错率从零被放大到了接近无穷大。 DeepSeek 敢在乌兰察布下注十六万片昇腾芯片,底气来自算法对硬件瓶颈的解耦。 团队在架构上设计的多头潜在注意力,把推理时最消耗显存的缓存带宽压缩了九成以上。 当内存墙的压力被算法卸掉,推理对芯片之间极致通信互联的苛刻要求随之大幅降低。 把容错率极高的并发苦力交给国产芯片, 把毫无容错空间的训练母体留在英伟达。 这是一场极其精密的工程分流。 但这台机器的运转,同样必须面对真实的物理约束。 彭博社披露的信息显示,这笔十六万片昇腾 950DT 的订单,华为需要耗费一年以上才能完成交付。 先进制程的封装良率,以及高带宽内存 HBM 的供应短缺,成了产能面前无法绕过的硬墙。 商业叙事喜欢把芯片博弈描绘成非黑即白的单点替换。 底层的物理世界只服从通信拓扑、故障概率与制造成本。 真正的算力突围,从来不需要靠口号去宣布脱钩。 能够看清两台机器各自的容错边界,用最现实的架构妥协换取最大的生存空间,才是工程世界的硬道理。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。