OpenAI 公布了首款自研芯片 Jalapeño 的实测跑分
OpenAI 公布了首款自研芯片 Jalapeño 的实测跑分。 在公开基准测试里,这块芯片在能效和响应速度上,跑赢了英伟达当前的主力系统 GB300。 很多人的第一反应是:OpenAI 要跟英伟达全面开战了? 或者好奇:一家软件和大模型起家的公司,凭什么能在 9 个月内做出一块叫板行业霸主的芯片? 如果你只盯着跑分,就漏掉了底层最关键的那台机器。 为什么 OpenAI 完全不碰模型训练,把所有筹码押在一块专用推理芯片上? 底下的机制叫数据搬运税。 过去大家默认英伟达的 GPU 是整个算力时代的唯一解法。 但英伟达的芯片本质上是一台通用计算怪兽。 它必须同时照顾图形渲染、科学计算、模型训练里的反向传播和庞大梯度更新。 这套无所不能的通用架构,代价极其昂贵。 到了大模型推理和智能体调用的场景,物理瓶颈彻底变了。 系统缺的不是算力,而是被搬运拖死。 模型每生成一个词元,都要把海量的参数权重和上下文缓存从显存挪进计算核心。 芯片大半时间没有在全力计算。 它在等数据跨越物理距离排队送过来。 在通用架构里,超过一半的电量和延迟,全部消耗在数据于核心与存储之间的长距离搬运上。 这就是每一家 AI 厂商每分每秒都在交的数据搬运税。 OpenAI 的硬件主管 Richard Ho 曾参与打造谷歌的 TPU 架构。 他的解法很干脆:从一张白纸重新设计。 他们把所有跟推理无关的图形流水线和反向传播逻辑全部剔除。 通过博通负责物理设计,并引入 HBM4 堆叠显存,把计算核心与存储紧密贴合在一起。 他们甚至让自家的前沿大模型充当虚拟芯片架构师,把通常需要两三年的研发周期直接压缩到了 9 个月。 在 SemiAnalysis 的开源测试基准 InferenceX 下,运行包括 DeepSeek R1 和开源大模型在内的任务,Jalapeño 的每瓦工作量达到了现有系统的 1.5 到 1.9 倍,端到端延迟降低了最高 3.6 倍。 这意味着行业底层的算账逻辑变了。 训练大模型是一次性的资本开支,买英伟达依然是最高效的选择。 推理却是每一秒都在吞噬现金流的日常运营账单。 当几亿活跃用户的提问和智能体自动化任务呈指数级爆发,决定胜负的不再是谁能堆砌更多通用的算力神卡。 谁能拆掉通用架构里多余的零件,把数据搬运的物理损耗降到最低,谁就能把智能的边际成本压到地板上。 硬件从来不是独立于软件的孤岛。 当设计芯片的人,本身就是写模型和运营服务的人,通用巨头的防线就会被切开一道最深的长口。
引用 / CITATIONS
No citations exported.
导出 / EXPORT
订阅 · SUBSCRIBE
新的深度解读发布时,会在每周简报里送到你邮箱。