{"id":"mb-20260830-bef48a","kind":"deep","title":"OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño","summary":"OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño","body":"OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño。\n这颗与博通合作、耗时 16 个月流片的专用芯片，在 SemiAnalysis 的基准测试里，性能功耗比直接超越了英伟达的 Blackwell 与下一代 Vera Rubin。\n在低并发场景下运行 6700 亿参数的 DeepSeek R1，单用户生成速度冲破了每秒 700 个 Token。\n最让硬件界意外的不是跑分。\n是它在没用多 Token 预测、没用投机解码、甚至不做预填充与解码解耦的情况下，纯凭硬件底层跑出了这个成绩。\n一家做大模型起家的软件公司，为什么能在硬件能效上击败统治通用计算数十年的英伟达？\n过去自研芯片最大的坟场不是流片，是软件生态与硬件微架构的适配。\n为什么这一战里，看似无坚不摧的通用显卡帝国露出了软肋？\n秘密藏在芯片架构底层交了几十年的通用性税。\n英伟达的 GPU 是为了应付未知算法与复杂训练设计的超级瑞士军刀。\n为了保证灵活性，硅片上塞满了复杂的指令调度、多级缓存和庞大的高精度单元。\n但在大模型推理的解码阶段，算力从来不是真正的瓶颈。\n真正的死穴是显存搬运。\n芯片大部分时间不在计算。\n它在等待参数从显存挪进计算单元。\n通用显卡每吐出一个字，就得把几百吉字节的模型参数在显存和核心之间搬运一遍。\nJalapeño 的解法是极其彻底的结构减法。\n它采用权重驻留脉动阵列。\n模型权重被一次性锁定在计算阵列的网格内部，输入的激活数据像流水一样从中穿过。\n配合三星 HBM4 带来的每秒 15.4 TB 超高带宽与切片式内存设计，它消除了固定延迟，把数据搬运的摩擦降到了物理极限。\n但硬件做减法只是第一步。\n定制芯片过去最怕软件生态沦为废铁。\nOpenAI 拿出的第二台机器，是基于 Triton 延伸出的 Gluon 编译语言，以及用 Codex 自动生成底层内核。\n模型架构、编译器与硬件设计在同一个闭环里咬合。\nAI 自己替硬件编写底层算子，把原本需要数百名工程师耗时数年的生态适配，压缩到了几个月。\n从单芯片延伸到机架，Katsu 算力托盘、Vindaloo 芯片阵列与 Chana 交换网络咬合成三层架构，最多可以扩展至 2048 颗芯片，剑指 100 兆瓦级的数据中心部署。\n芯片行业的权力转移，往往不发生在通用巨头参数翻倍的发布会上。\n当单一算法架构的商业规模大到足以吞噬整个行业，通用的灵活性就会从护城河变成昂贵的负重。\n真正打破垄断的，从来不是把旧工具磨得更锋利。\n是当终点形态确立时，直接造一把不留任何退路的专用铁铲。","topic":"OpenAI 在 Hot Chips 2026 上公开了自研推理芯片 Jalapeño","frame_type":["通用性税与权重驻留架构（专用推理芯片对通用架构冗","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:55:05","legal_anchor_count":0,"transcript_citation_count":0}