DEEPgeneratedpublished

OpenAI 披露了自研推理芯片 Jalapeño 的工程细节

硬件自举闭环(大模型自主合成底层汇编算子机制)机制

OpenAI 披露了自研推理芯片 Jalapeño 的工程细节。

一个最反直觉的数据,藏在软件层面。

芯片团队在短短 2 个月内,把 3 款原本不在规划里的前沿大模型塞进了这颗芯片,并且全部跑到了极致性能。

写出这些底层算子的,不是资深的芯片系统工程师。

是 Codex 与内测中的 GPT-Astra。

做芯片的人都知道,造出一颗专用芯片 ASIC 从来不是最难的关卡。

真正的噩梦,是软件。

过去十几年,为什么所有试图挑战 Nvidia 的芯片最后都无疾而终?

外界总以为是硬件工艺或者算力差距。

真正把所有竞争对手困死的,是底层算子这座大山。

每造出一颗全新架构的专用芯片,你就必须给它重新写一套底层汇编指令。

矩阵乘法怎么拆分、注意力机制怎么排布、片上缓存与高带宽内存之间的数据怎么调度,全要靠最顶尖的系统工程师一行一行手写优化。

一个几十人的专家团队,把一个模型调优到能跑满硬件,往往要耗费一两年。

当你终于把算子调完,外面的模型架构早就演进到了下一代。

专用芯片的硬件效率再高,也跑不赢人类手写底层代码的龟速。

这就是芯片行业交了几十年的软件适配税。

Nvidia 真正的护城河,从来不只是显卡硬件,是全球开发者耗费十几年用手堆出来的 CUDA 算子生态。

OpenAI 正在把这套旧秩序连根拔起。

他们把前沿大模型直接丢进了芯片研发的最底层。

让 GPT-Astra 和 Codex 直接理解芯片微架构,自动搜索并生成机器级算子。

测试数据给出了一个震撼的结果:在注意力机制和混合专家模型 MoE 的关键模块上,AI 生成的算子性能,比人类顶级专家手写的还要快 1.5 到 1.8 倍。

原本需要顶尖工程师死磕几个月的底层优化,模型在极短时间内就能遍历出人类想不到的最优解。

GPT-OSS、DeepSeek R1、Kimi K2.5,原本都不在 Jalapeño 的初始生产计划里。

全靠 AI 自主编写底层算子,只用了 2 个月,全部完成极致性能适配。

这颗芯片从立项设计到完成流片,全程也只用了 9 个月。

这台自举机器真正打破的,是算力垄断的底层逻辑。

过去,硬件壁垒本质上是人类高端研发产能的稀缺性。

全球能写出极致汇编算子的专家只有寥寥几千人,谁抢占了这批人,谁就掌握了生态垄断权。

如今,这个壁垒正在坍塌成一道算法搜索题。

底层算子的编写,从昂贵的人工手工业,变成了可以被模型快速求解的数学优化。

芯片不再需要苦等人类来给它写驱动。

大模型在硬件上运行,同时大模型反过来替硬件写底层代码。

更强的大模型,能为专用芯片合成出更极致的算子。

更高效的芯片,又回头为下一代前沿大模型提供更便宜的算力。

当软件生态不再受制于人类工时,硬件竞争的规则就已经彻底改写。

决定一颗芯片生死的,不再是拥有多少编译器工程师。

在于用来给它写代码的大模型,究竟有多聪明。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情