DEEPgeneratedpublished

OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño

通用性税与权重驻留架构(专用推理芯片对通用架构冗机制

OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño。 这颗与博通合作、耗时 16 个月流片的专用芯片,在 SemiAnalysis 的基准测试里,性能功耗比直接超越了英伟达的 Blackwell 与下一代 Vera Rubin。 在低并发场景下运行 6700 亿参数的 DeepSeek R1,单用户生成速度冲破了每秒 700 个 Token。 最让硬件界意外的不是跑分。 是它在没用多 Token 预测、没用投机解码、甚至不做预填充与解码解耦的情况下,纯凭硬件底层跑出了这个成绩。 一家做大模型起家的软件公司,为什么能在硬件能效上击败统治通用计算数十年的英伟达? 过去自研芯片最大的坟场不是流片,是软件生态与硬件微架构的适配。 为什么这一战里,看似无坚不摧的通用显卡帝国露出了软肋? 秘密藏在芯片架构底层交了几十年的通用性税。 英伟达的 GPU 是为了应付未知算法与复杂训练设计的超级瑞士军刀。 为了保证灵活性,硅片上塞满了复杂的指令调度、多级缓存和庞大的高精度单元。 但在大模型推理的解码阶段,算力从来不是真正的瓶颈。 真正的死穴是显存搬运。 芯片大部分时间不在计算。 它在等待参数从显存挪进计算单元。 通用显卡每吐出一个字,就得把几百吉字节的模型参数在显存和核心之间搬运一遍。 Jalapeño 的解法是极其彻底的结构减法。 它采用权重驻留脉动阵列。 模型权重被一次性锁定在计算阵列的网格内部,输入的激活数据像流水一样从中穿过。 配合三星 HBM4 带来的每秒 15.4 TB 超高带宽与切片式内存设计,它消除了固定延迟,把数据搬运的摩擦降到了物理极限。 但硬件做减法只是第一步。 定制芯片过去最怕软件生态沦为废铁。 OpenAI 拿出的第二台机器,是基于 Triton 延伸出的 Gluon 编译语言,以及用 Codex 自动生成底层内核。 模型架构、编译器与硬件设计在同一个闭环里咬合。 AI 自己替硬件编写底层算子,把原本需要数百名工程师耗时数年的生态适配,压缩到了几个月。 从单芯片延伸到机架,Katsu 算力托盘、Vindaloo 芯片阵列与 Chana 交换网络咬合成三层架构,最多可以扩展至 2048 颗芯片,剑指 100 兆瓦级的数据中心部署。 芯片行业的权力转移,往往不发生在通用巨头参数翻倍的发布会上。 当单一算法架构的商业规模大到足以吞噬整个行业,通用的灵活性就会从护城河变成昂贵的负重。 真正打破垄断的,从来不是把旧工具磨得更锋利。 是当终点形态确立时,直接造一把不留任何退路的专用铁铲。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情