其它·via @mubei
OpenAI 自己造的芯片,把英伟达打懵了。 功耗只有英伟达旗舰的一半,极限能效却拉出了上百倍差距。 这是 OpenAI…
OpenAI 自己造的芯片,把英伟达打懵了。
功耗只有英伟达旗舰的一半,极限能效却拉出了上百倍差距。 这是 OpenAI 首次公布自研推理芯片 Jalapeño 的实测战绩。 对比的对象不是老架构,而是英伟达当家旗舰 GB200 与 GB300。
两边差距有多夸张? 单看功耗,Jalapeño 封装功耗 700 瓦,GB300 则是 1400 瓦。 刚一通电,功耗先砍掉一半。
再看跑大模型的真实能效。 跑 6700 亿参数的 DeepSeek R1,在普通峰值下,Jalapeño 每千瓦吞吐是 GB300 的 1.7 倍。 可一旦把用户需要的生成速度拉高,差距瞬间拉开。 当速度要求达到每秒 169 个词时,GB300 的能效跌到 118,Jalapeño 依然能跑出 12258。 能效整整差了 104 倍!
跑开源的 120B 模型也是一样。 高交互速度下,Jalapeño 的能效是 GB200 的 53.7 倍。 跑万亿参数的 Kimi K2.5,端到端延迟降低了 2.2 倍,生成速度一路顶到每秒近 700 词。
为什么全能的通用 GPU 会被拉开这么大距离? 英伟达要兼顾训练和各类通用计算,芯片上堆了大量通用冗余。 OpenAI 的专用芯片只干一件事:把所有晶体管和供电,死死焊在推理访存和生成上。
大模型规模化落地,核心死穴就是每瓦功耗和电费成本。 自研定制芯片把特定模型的推理能效拉高上百倍,直接砸穿了成本底线。 英伟达靠通用 GPU 垄断推理市场的格局,正在被巨头们亲手撕开。
相关 / RELATED
JSON- M全球最强的三个AI大模型,有两个已经不用英伟达的芯片了。 Claude和Gemini的底层算力,全跑在谷歌的TPU上。…
- M英伟达要砸 60 亿美元,造一个全球最顶级的开源大模型。 一个卖芯片的硬件巨头,疯了吗? 《华尔街日报》爆出猛料。 英伟…
- MAI 的核心计量单位,变了。 不再是囤了多少张 GPU,而是“吉瓦”(GW)。 马斯克交了底。 今年年底,他的算力规模要…
- M英伟达换一次半导体工艺,迁移三千个标准单元库曾经需要8个人干10个月。 现在单张GPU跑一夜就能搞定。 最终产出的功耗和…
- M科技英伟达刚用 4-bit 精度,跑完了一个 120 亿参数大模型的预训练。 喂进去的数据量是 10 万亿 token。 以…
- MAI 产业 85% 的利润去了哪? 全进了一家公司的口袋。 那就是英伟达。 硅谷这帮老钱其实根本看不懂硅基硬件。 现在却…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。