DEEPgeneratedpublished

OpenAI 第一次造芯片,就把英伟达最新的旗舰显卡跑赢了

通用税(General-Purpose Tax)机制

OpenAI 第一次造芯片,就把英伟达最新的旗舰显卡跑赢了。 更戏剧的是,量出这个差距的尺子,是黄仁勋自己亲手递过去的。 怎么做到的? 一家软件公司找博通合作,九个月就能追平芯片霸主几十年的积累? 听起来像给资本市场讲的故事。 但数据很硬。 在公开基准测试 InferenceX 里,OpenAI 的自研推理芯片 Jalapeño,正面撞上英伟达当家旗舰 Blackwell。 每瓦吞吐量高出 1.5 到 1.9 倍。 端到端延迟压低了整整 1.7 到 3.6 倍。 关键不在于谁赢了这一轮。 关键在于这场比赛的计分板,到底是谁立的。 今年在 Computex 上,黄仁勋给全行业算过一笔账: 如果手里有 1 吉瓦的电力配额,每瓦吞吐量,就是你的收入。 电网给数据中心的配电是锁死的。 芯片多贵不重要,谁能在固定的一度电里吐出更多 token,谁就能赚到更多真金白银。 黄仁勋立这块计分板,本意是证明英伟达即便卖得死贵,算力能效依然不可替代。 但他大概没想到,这块计分板,反手成了对手最精准的瞄准镜。 为什么? 因为英伟达的江山,建立在一个巨大的优势上:通用性。 GPU 是个全能选手。 它要跑万亿参数的模型训练,要算反向传播,还要兼顾各种复杂的调度和图形指令。 为了这份什么都能干的自由,芯片上必须留出大量的控制单元、复杂的缓存层级和冗余晶体管。 这笔能耗开销,在芯片体系结构里叫「通用税」。 在大家都在探索模型结构的早期,谁都离不开通用芯片,这笔税交得心甘情愿。 但当技术走到每天被调用几十亿次、要吐出海量 token 的推理阶段,事情彻底变了。 推理不需要反向传播,不需要复杂的控制流,它的核心瓶颈只有两个:内存带宽和供电。 OpenAI 和博通打造 Jalapeño 时,做了一个彻底的取舍: 把所有跟训练相关的包袱全部剔除。 不跑训练,不兼顾图形,所有 700 瓦的功耗预算,全部用来喂饱 216 GiB 的 HBM4 内存和专一的矩阵运算。 当一个轻装上阵、只练一招的专用打手,在黄仁勋立下的「每瓦吞吐量」擂台上,正面撞上背着重重行囊的全能冠军。 胜负在芯片设计的第一天就已经注定。 真正动摇巨头统治的,往往不是别人做出了更完美的通用产品。 当最赚钱的业务收敛成极其单一的动作,客户迟早会算清楚账: 他们不再愿意为那座全能宫殿的公摊面积,交一分钱的能耗税。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情