一家做大模型的软件公司,用 16 个月做出来的一块自研芯片,在推理能效上把 Nvidia 最强的 Blackwell 超
一家做大模型的软件公司,用 16 个月做出来的一块自研芯片,在推理能效上把 Nvidia 最强的 Blackwell 超了。 过去十年,整个算力工业都把黄仁勋的 CUDA 生态当成不可撼动的物理定律。 硬件架构容易画,但数以万计由顶尖工程师手写的底层算子库,能把所有挑战者活活耗死。 没有任何一家芯片初创公司能活着跨过这条软件护城河。 为什么 OpenAI 第一次下场造芯,就能在推理吞吐和能效上跑出将近两倍的优势? 答案不在半导体制程,在一台被掩盖了十年的隐形机器:通用算力税与软件自举。 Nvidia 的 GPU 是一台什么都能算的通用机器。 它要兼顾大模型训练、图形渲染、科学仿真、双精度浮点、光线追踪,还要兼容上百万种不同的历史算法。 为了照顾这种通用性,芯片上大比例的硅片面积、控制逻辑和功耗,都在为那些你永远用不上的功能待命。 但今天 AI 商业的核心战线,已经彻底从训练转向了推理。 推理是一道纯粹的物理题。 模型架构是固定的,矩阵乘法的尺寸是确定的,注意力机制的数据流是透明的。 在推理的世界里,决定运营成本的不看纸面算力,看每焦耳能量能吐出多少个字符。 当你在通用显卡上跑推理,买下的每一个核心,都在替那些闲置的通用电路交税。 OpenAI 找博通合作自研的这块芯片,代号 Jalapeño,从第一天起就做了一件事:把通用包袱全部砍光。 700 瓦功耗,单包封装塞进 15.4 TB/s 显存带宽的 HBM4,只保留专为大模型定制的矩阵引擎和权重静态脉动阵列。 在 SemiAnalysis 的基准测试里,它的每瓦吞吐量做到了 Blackwell 的 1.5 到 1.9 倍,端到端延迟降低了数倍。 如果只是在硬件上做减法,过去无数 ASIC 芯片公司也尝试过,全都撞得粉身碎骨。 因为它们撞上了一堵无法逾越的高墙:底层软件库。 想让一块新芯片跑出极致性能,需要数百名顶尖工程师花几年时间,一行一行手写汇编级内核。 OpenAI 拆掉这堵高墙,靠的是两样核心工具。 第一样叫 Triton 和 Gluon。 他们自己搭建了编译器,用代数规则直接把张量映射到芯片寄存器,彻底绕开了 Nvidia 的闭源底层库。 第二样更致命:让 AI 自己写驱动。 OpenAI 直接调用内部的 Codex 模型,去生成并调优成千上万行繁重复杂、精细到寄存器的底层汇编算子。 人类工程师需要耗费数月攻坚的代码调优,大模型在几天之内就能遍历出最优解。 从 2024 年年中组建团队,到 2025 年 11 月流片,整个开发周期只用了 16 个月。 真正瓦解旧垄断的,往往不是更先进的光刻机。 是当你的业务规模大到可以直接定制硬件,同时用自己的软件编译器和 AI 工具链,抹平所有生态迁移成本。 当制造顶级芯片的门槛,从数百名硬件专家的手艺沉淀,变成编译器加模型自举,旧霸主的护城河还能守住多久?
相关 / RELATED
JSON导出 / EXPORT
订阅 · SUBSCRIBE
每周一封信号简报,重大进展可选即时推送。