{"id":"mb-20260831-6988a1","kind":"deep","title":"OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了","summary":"OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了","body":"OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了。\n更戏剧的是，量出这个差距的尺子，是黄仁勋自己亲手递过去的。\n怎么做到的？\n一家软件公司找博通合作，九个月就能追平芯片霸主几十年的积累？\n听起来像给资本市场讲的故事。\n但数据很硬。\n在公开基准测试 InferenceX 里，OpenAI 的自研推理芯片 Jalapeño，正面撞上英伟达当家旗舰 Blackwell。\n每瓦吞吐量高出 1.5 到 1.9 倍。\n端到端延迟压低了整整 1.7 到 3.6 倍。\n关键不在于谁赢了这一轮。\n关键在于这场比赛的计分板，到底是谁立的。\n今年在 Computex 上，黄仁勋给全行业算过一笔账：\n如果手里有 1 吉瓦的电力配额，每瓦吞吐量，就是你的收入。\n电网给数据中心的配电是锁死的。\n芯片多贵不重要，谁能在固定的一度电里吐出更多 token，谁就能赚到更多真金白银。\n黄仁勋立这块计分板，本意是证明英伟达即便卖得死贵，算力能效依然不可替代。\n但他大概没想到，这块计分板，反手成了对手最精准的瞄准镜。\n为什么？\n因为英伟达的江山，建立在一个巨大的优势上：通用性。\nGPU 是个全能选手。\n它要跑万亿参数的模型训练，要算反向传播，还要兼顾各种复杂的调度和图形指令。\n为了这份什么都能干的自由，芯片上必须留出大量的控制单元、复杂的缓存层级和冗余晶体管。\n这笔能耗开销，在芯片体系结构里叫「通用税」。\n在大家都在探索模型结构的早期，谁都离不开通用芯片，这笔税交得心甘情愿。\n但当技术走到每天被调用几十亿次、要吐出海量 token 的推理阶段，事情彻底变了。\n推理不需要反向传播，不需要复杂的控制流，它的核心瓶颈只有两个：内存带宽和供电。\nOpenAI 和博通打造 Jalapeño 时，做了一个彻底的取舍：\n把所有跟训练相关的包袱全部剔除。\n不跑训练，不兼顾图形，所有 700 瓦的功耗预算，全部用来喂饱 216 GiB 的 HBM4 内存和专一的矩阵运算。\n当一个轻装上阵、只练一招的专用打手，在黄仁勋立下的「每瓦吞吐量」擂台上，正面撞上背着重重行囊的全能冠军。\n胜负在芯片设计的第一天就已经注定。\n真正动摇巨头统治的，往往不是别人做出了更完美的通用产品。\n当最赚钱的业务收敛成极其单一的动作，客户迟早会算清楚账：\n他们不再愿意为那座全能宫殿的公摊面积，交一分钱的能耗税。","topic":"OpenAI 第一次造芯片，就把英伟达最新的旗舰显卡跑赢了","frame_type":["通用税（General-Purpose Tax）","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-31 14:02:14","legal_anchor_count":0,"transcript_citation_count":0}