{"id":"mb-20260830-34782c","kind":"deep","title":"OpenAI 披露了自研推理芯片 Jalapeño 的工程细节","summary":"OpenAI 披露了自研推理芯片 Jalapeño 的工程细节","body":"OpenAI 披露了自研推理芯片 Jalapeño 的工程细节。\n\n一个最反直觉的数据，藏在软件层面。\n\n芯片团队在短短 2 个月内，把 3 款原本不在规划里的前沿大模型塞进了这颗芯片，并且全部跑到了极致性能。\n\n写出这些底层算子的，不是资深的芯片系统工程师。\n\n是 Codex 与内测中的 GPT-Astra。\n\n做芯片的人都知道，造出一颗专用芯片 ASIC 从来不是最难的关卡。\n\n真正的噩梦，是软件。\n\n过去十几年，为什么所有试图挑战 Nvidia 的芯片最后都无疾而终？\n\n外界总以为是硬件工艺或者算力差距。\n\n真正把所有竞争对手困死的，是底层算子这座大山。\n\n每造出一颗全新架构的专用芯片，你就必须给它重新写一套底层汇编指令。\n\n矩阵乘法怎么拆分、注意力机制怎么排布、片上缓存与高带宽内存之间的数据怎么调度，全要靠最顶尖的系统工程师一行一行手写优化。\n\n一个几十人的专家团队，把一个模型调优到能跑满硬件，往往要耗费一两年。\n\n当你终于把算子调完，外面的模型架构早就演进到了下一代。\n\n专用芯片的硬件效率再高，也跑不赢人类手写底层代码的龟速。\n\n这就是芯片行业交了几十年的软件适配税。\n\nNvidia 真正的护城河，从来不只是显卡硬件，是全球开发者耗费十几年用手堆出来的 CUDA 算子生态。\n\nOpenAI 正在把这套旧秩序连根拔起。\n\n他们把前沿大模型直接丢进了芯片研发的最底层。\n\n让 GPT-Astra 和 Codex 直接理解芯片微架构，自动搜索并生成机器级算子。\n\n测试数据给出了一个震撼的结果：在注意力机制和混合专家模型 MoE 的关键模块上，AI 生成的算子性能，比人类顶级专家手写的还要快 1.5 到 1.8 倍。\n\n原本需要顶尖工程师死磕几个月的底层优化，模型在极短时间内就能遍历出人类想不到的最优解。\n\nGPT-OSS、DeepSeek R1、Kimi K2.5，原本都不在 Jalapeño 的初始生产计划里。\n\n全靠 AI 自主编写底层算子，只用了 2 个月，全部完成极致性能适配。\n\n这颗芯片从立项设计到完成流片，全程也只用了 9 个月。\n\n这台自举机器真正打破的，是算力垄断的底层逻辑。\n\n过去，硬件壁垒本质上是人类高端研发产能的稀缺性。\n\n全球能写出极致汇编算子的专家只有寥寥几千人，谁抢占了这批人，谁就掌握了生态垄断权。\n\n如今，这个壁垒正在坍塌成一道算法搜索题。\n\n底层算子的编写，从昂贵的人工手工业，变成了可以被模型快速求解的数学优化。\n\n芯片不再需要苦等人类来给它写驱动。\n\n大模型在硬件上运行，同时大模型反过来替硬件写底层代码。\n\n更强的大模型，能为专用芯片合成出更极致的算子。\n\n更高效的芯片，又回头为下一代前沿大模型提供更便宜的算力。\n\n当软件生态不再受制于人类工时，硬件竞争的规则就已经彻底改写。\n\n决定一颗芯片生死的，不再是拥有多少编译器工程师。\n\n在于用来给它写代码的大模型，究竟有多聪明。","topic":"OpenAI 披露了自研推理芯片 Jalapeño 的工程细节","frame_type":["硬件自举闭环（大模型自主合成底层汇编算子机制）","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 21:54:08","legal_anchor_count":0,"transcript_citation_count":0}