---
id: "mb-20260831-6988a1"
kind: "deep"
title: "OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了"
topic: "OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了"
source_type: "generated"
status: "published"
generated_at: "2026-08-31 14:02:14"
frame_type: ["通用税（General-Purpose Tax）", "机制"]
legal_anchor_count: 0
transcript_citation_count: 0
---

# OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了

OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了。
更戏剧的是，量出这个差距的尺子，是黄仁勋自己亲手递过去的。
怎么做到的？
一家软件公司找博通合作，九个月就能追平芯片霸主几十年的积累？
听起来像给资本市场讲的故事。
但数据很硬。
在公开基准测试 InferenceX 里，OpenAI 的自研推理芯片 Jalapeño，正面撞上英伟达当家旗舰 Blackwell。
每瓦吞吐量高出 1.5 到 1.9 倍。
端到端延迟压低了整整 1.7 到 3.6 倍。
关键不在于谁赢了这一轮。
关键在于这场比赛的计分板，到底是谁立的。
今年在 Computex 上，黄仁勋给全行业算过一笔账：
如果手里有 1 吉瓦的电力配额，每瓦吞吐量，就是你的收入。
电网给数据中心的配电是锁死的。
芯片多贵不重要，谁能在固定的一度电里吐出更多 token，谁就能赚到更多真金白银。
黄仁勋立这块计分板，本意是证明英伟达即便卖得死贵，算力能效依然不可替代。
但他大概没想到，这块计分板，反手成了对手最精准的瞄准镜。
为什么？
因为英伟达的江山，建立在一个巨大的优势上：通用性。
GPU 是个全能选手。
它要跑万亿参数的模型训练，要算反向传播，还要兼顾各种复杂的调度和图形指令。
为了这份什么都能干的自由，芯片上必须留出大量的控制单元、复杂的缓存层级和冗余晶体管。
这笔能耗开销，在芯片体系结构里叫「通用税」。
在大家都在探索模型结构的早期，谁都离不开通用芯片，这笔税交得心甘情愿。
但当技术走到每天被调用几十亿次、要吐出海量 token 的推理阶段，事情彻底变了。
推理不需要反向传播，不需要复杂的控制流，它的核心瓶颈只有两个：内存带宽和供电。
OpenAI 和博通打造 Jalapeño 时，做了一个彻底的取舍：
把所有跟训练相关的包袱全部剔除。
不跑训练，不兼顾图形，所有 700 瓦的功耗预算，全部用来喂饱 216 GiB 的 HBM4 内存和专一的矩阵运算。
当一个轻装上阵、只练一招的专用打手，在黄仁勋立下的「每瓦吞吐量」擂台上，正面撞上背着重重行囊的全能冠军。
胜负在芯片设计的第一天就已经注定。
真正动摇巨头统治的，往往不是别人做出了更完美的通用产品。
当最赚钱的业务收敛成极其单一的动作，客户迟早会算清楚账：
他们不再愿意为那座全能宫殿的公摊面积，交一分钱的能耗税。

_Rendered by mubei-terminal._
