其它·via @mubei

OpenAI 自己造的芯片,把英伟达打懵了。 功耗只有英伟达旗舰的一半,极限能效却拉出了上百倍差距。 这是 OpenAI…

OpenAI 自己造的芯片,把英伟达打懵了。

功耗只有英伟达旗舰的一半,极限能效却拉出了上百倍差距。 这是 OpenAI 首次公布自研推理芯片 Jalapeño 的实测战绩。 对比的对象不是老架构,而是英伟达当家旗舰 GB200 与 GB300。

两边差距有多夸张? 单看功耗,Jalapeño 封装功耗 700 瓦,GB300 则是 1400 瓦。 刚一通电,功耗先砍掉一半。

再看跑大模型的真实能效。 跑 6700 亿参数的 DeepSeek R1,在普通峰值下,Jalapeño 每千瓦吞吐是 GB300 的 1.7 倍。 可一旦把用户需要的生成速度拉高,差距瞬间拉开。 当速度要求达到每秒 169 个词时,GB300 的能效跌到 118,Jalapeño 依然能跑出 12258。 能效整整差了 104 倍!

跑开源的 120B 模型也是一样。 高交互速度下,Jalapeño 的能效是 GB200 的 53.7 倍。 跑万亿参数的 Kimi K2.5,端到端延迟降低了 2.2 倍,生成速度一路顶到每秒近 700 词。

为什么全能的通用 GPU 会被拉开这么大距离? 英伟达要兼顾训练和各类通用计算,芯片上堆了大量通用冗余。 OpenAI 的专用芯片只干一件事:把所有晶体管和供电,死死焊在推理访存和生成上。

大模型规模化落地,核心死穴就是每瓦功耗和电费成本。 自研定制芯片把特定模型的推理能效拉高上百倍,直接砸穿了成本底线。 英伟达靠通用 GPU 垄断推理市场的格局,正在被巨头们亲手撕开。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情