---
id: "mb-20260831-98330a"
title: "一家做大模型的软件公司，用 16 个月做出来的一块自研芯片，在推理能效上把 Nvidia 最强的 Blackwell 超"
account: "mubei"
brand: ""
category: "科技"
category_slug: "tech"
score: null
published_at: "2026-08-31 10:58:52"
translated_x_url: null
canonical_url: "https://mubeitech.com/p/mb-20260831-98330a"
markdown_url: "https://mubeitech.com/p/mb-20260831-98330a/markdown"
json_url: "https://mubeitech.com/api/posts/mb-20260831-98330a"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 一家做大模型的软件公司，用 16 个月做出来的一块自研芯片，在推理能效上把 Nvidia 最强的 Blackwell 超

一家做大模型的软件公司，用 16 个月做出来的一块自研芯片，在推理能效上把 Nvidia 最强的 Blackwell 超了。
过去十年，整个算力工业都把黄仁勋的 CUDA 生态当成不可撼动的物理定律。
硬件架构容易画，但数以万计由顶尖工程师手写的底层算子库，能把所有挑战者活活耗死。
没有任何一家芯片初创公司能活着跨过这条软件护城河。
为什么 OpenAI 第一次下场造芯，就能在推理吞吐和能效上跑出将近两倍的优势？
答案不在半导体制程，在一台被掩盖了十年的隐形机器：通用算力税与软件自举。
Nvidia 的 GPU 是一台什么都能算的通用机器。
它要兼顾大模型训练、图形渲染、科学仿真、双精度浮点、光线追踪，还要兼容上百万种不同的历史算法。
为了照顾这种通用性，芯片上大比例的硅片面积、控制逻辑和功耗，都在为那些你永远用不上的功能待命。
但今天 AI 商业的核心战线，已经彻底从训练转向了推理。
推理是一道纯粹的物理题。
模型架构是固定的，矩阵乘法的尺寸是确定的，注意力机制的数据流是透明的。
在推理的世界里，决定运营成本的不看纸面算力，看每焦耳能量能吐出多少个字符。
当你在通用显卡上跑推理，买下的每一个核心，都在替那些闲置的通用电路交税。
OpenAI 找博通合作自研的这块芯片，代号 Jalapeño，从第一天起就做了一件事：把通用包袱全部砍光。
700 瓦功耗，单包封装塞进 15.4 TB/s 显存带宽的 HBM4，只保留专为大模型定制的矩阵引擎和权重静态脉动阵列。
在 SemiAnalysis 的基准测试里，它的每瓦吞吐量做到了 Blackwell 的 1.5 到 1.9 倍，端到端延迟降低了数倍。
如果只是在硬件上做减法，过去无数 ASIC 芯片公司也尝试过，全都撞得粉身碎骨。
因为它们撞上了一堵无法逾越的高墙：底层软件库。
想让一块新芯片跑出极致性能，需要数百名顶尖工程师花几年时间，一行一行手写汇编级内核。
OpenAI 拆掉这堵高墙，靠的是两样核心工具。
第一样叫 Triton 和 Gluon。
他们自己搭建了编译器，用代数规则直接把张量映射到芯片寄存器，彻底绕开了 Nvidia 的闭源底层库。
第二样更致命：让 AI 自己写驱动。
OpenAI 直接调用内部的 Codex 模型，去生成并调优成千上万行繁重复杂、精细到寄存器的底层汇编算子。
人类工程师需要耗费数月攻坚的代码调优，大模型在几天之内就能遍历出最优解。
从 2024 年年中组建团队，到 2025 年 11 月流片，整个开发周期只用了 16 个月。
真正瓦解旧垄断的，往往不是更先进的光刻机。
是当你的业务规模大到可以直接定制硬件，同时用自己的软件编译器和 AI 工具链，抹平所有生态迁移成本。
当制造顶级芯片的门槛，从数百名硬件专家的手艺沉淀，变成编译器加模型自举，旧霸主的护城河还能守住多久？

---

_Translation: (n/a)_
_Canonical: <https://mubeitech.com/p/mb-20260831-98330a>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-08-31 10:58:52_
