{"id":"mb-20260830-09fabb","kind":"deep","title":"全世界最昂贵的 AI 显卡，跑大模型时有超过八成的晶体管都在原地发呆","summary":"全世界最昂贵的 AI 显卡，跑大模型时有超过八成的晶体管都在原地发呆","body":"全世界最昂贵的 AI 显卡，跑大模型时有超过八成的晶体管都在原地发呆。\n你在数据中心为它烧着 1400 瓦的电力，掏着 75% 的硬件溢价。\n它却在吐出每一个字符的间隙里，死死卡在内存通道的拥堵里。\n为什么明明算力过剩，大模型的推理响应却还是又贵又慢？\n是芯片不够强，还是整个行业在过去十年里买错了工具？\n把推理过程的物理账本拆到底，会看到一台正在被彻底打碎的旧机器。\n通用算力税。\n训练大模型和运行大模型，底层完全是两套截然相反的物理定律。\n训练一个基础模型，是高密度的稠密矩阵乘法。\n芯片需要处理海量的前向传播、反向传播和动态梯度更新。\n这需要极其灵活的通用编程架构，以及庞大的动态调度逻辑。\nNVIDIA 的 GPU 靠着通用计算和 CUDA 生态统治了训练时代。\n但当模型训练完成，进入日常问答和推理阶段，物理规律彻底变了。\n推理的核心不是做复杂的数学推演。\n是自回归解码。\n每生成一个汉字或单词，芯片都必须把几百亿甚至上万亿参数的权重和键值缓存，从内存里完整搬运出来一遍。\n这时候芯片的算力远远跑在前面，内存搬运通道却远远落后在后面。\n算力再高，也只能停下来等数据。\n这就是计算科学里的内存墙。\n在通用 GPU 上跑推理，就像雇了一支交响乐团，却只让他们在门口按门铃。\n那些为了训练而设计的复杂浮点单元、通用调度电路和庞大缓存，在推理时全成了无用的发热负赘。\n你不仅要为这些闲置的晶体管买单，还要替它们承担昂贵的电力消耗。\n打破这种浪费的办法，是把通用芯片的伪装全部扒掉。\nOpenAI 联手 Broadcom 拿出来的定制专用芯片 Jalapeño，做的事情就是这场精准的冗余剥离。\n它彻底砍掉了所有与训练相关的通用计算逻辑。\n没有多余的通用调度负担。\n只保留专为大模型自回归解码设计的空间数据流架构。\n然后把所有的资源，全部砸向那个唯一的物理死穴：内存带宽。\n单颗芯片塞进 216 GB 的 HBM4 高带宽内存，把吞吐带宽直接顶到每秒 15.4 TB。\n在 SemiAnalysis 的基准测试里，这颗 700 瓦功耗的专用芯片，对决 1400 瓦的 Blackwell 系统，吞吐能效提升了 1.5 到 1.9 倍，端到端延迟降低了 1.7 到 3.6 倍。\n功耗砍掉近半，速度反而翻倍。\n更致命的信号发生在硬件之外。\n过去设计一颗先进制程的高端芯片，通常需要两到三年的工程周期和上亿美元的试错成本。\n这一次，OpenAI 用自家的代码大模型辅助芯片设计和物理布局，从立项到流片只用了 9 个月。\n当软件大模型开始具备自动设计底层硬件的能力，芯片研发的时间表被硬生生压缩了一个数量级。\n这也宣告了一个时代的转折。\n当 AI 的成本重心从前期的模型训练，全面转向每天消耗数万亿 Token 的推理与智能体调用，通用的硬件垄断就会迅速瓦解。\n没有人能长期忍受为一个闲置了八成硬件的通用架构，持续支付昂贵的垄断溢价。\n专用架构替代通用芯片，不是一场产品参数的竞争。\n是算力经济学逼近物理极限时，必然发生的自我纠错。\n当设计芯片的门槛被 AI 自身打碎，算力的护城河就不会再停留在芯片的制造端。\n最终能定义下一代硬件形态的，从来不是卖铲子的人。\n是那些知道每一滴算力到底该流向哪里的筑渠者。","topic":"全世界最昂贵的 AI 显卡，跑大模型时有超过八成的晶体管都在原地发呆","frame_type":["通用算力税与推理冗余剥离（内存带宽墙与专用空间架","机制"],"citations":[],"channel_note":"","identity_notice":"本框架为第三方 AI 对郭文贵先生公开观点的解读，非郭文贵本人发声。","source_type":"generated","status":"published","generated_at":"2026-08-30 08:41:05","legal_anchor_count":0,"transcript_citation_count":0}