DEEPgeneratedpublished

全世界最昂贵的 AI 显卡,跑大模型时有超过八成的晶体管都在原地发呆

通用算力税与推理冗余剥离(内存带宽墙与专用空间架机制

本框架为第三方 AI 对郭文贵先生公开观点的解读,非郭文贵本人发声。

全世界最昂贵的 AI 显卡,跑大模型时有超过八成的晶体管都在原地发呆。 你在数据中心为它烧着 1400 瓦的电力,掏着 75% 的硬件溢价。 它却在吐出每一个字符的间隙里,死死卡在内存通道的拥堵里。 为什么明明算力过剩,大模型的推理响应却还是又贵又慢? 是芯片不够强,还是整个行业在过去十年里买错了工具? 把推理过程的物理账本拆到底,会看到一台正在被彻底打碎的旧机器。 通用算力税。 训练大模型和运行大模型,底层完全是两套截然相反的物理定律。 训练一个基础模型,是高密度的稠密矩阵乘法。 芯片需要处理海量的前向传播、反向传播和动态梯度更新。 这需要极其灵活的通用编程架构,以及庞大的动态调度逻辑。 NVIDIA 的 GPU 靠着通用计算和 CUDA 生态统治了训练时代。 但当模型训练完成,进入日常问答和推理阶段,物理规律彻底变了。 推理的核心不是做复杂的数学推演。 是自回归解码。 每生成一个汉字或单词,芯片都必须把几百亿甚至上万亿参数的权重和键值缓存,从内存里完整搬运出来一遍。 这时候芯片的算力远远跑在前面,内存搬运通道却远远落后在后面。 算力再高,也只能停下来等数据。 这就是计算科学里的内存墙。 在通用 GPU 上跑推理,就像雇了一支交响乐团,却只让他们在门口按门铃。 那些为了训练而设计的复杂浮点单元、通用调度电路和庞大缓存,在推理时全成了无用的发热负赘。 你不仅要为这些闲置的晶体管买单,还要替它们承担昂贵的电力消耗。 打破这种浪费的办法,是把通用芯片的伪装全部扒掉。 OpenAI 联手 Broadcom 拿出来的定制专用芯片 Jalapeño,做的事情就是这场精准的冗余剥离。 它彻底砍掉了所有与训练相关的通用计算逻辑。 没有多余的通用调度负担。 只保留专为大模型自回归解码设计的空间数据流架构。 然后把所有的资源,全部砸向那个唯一的物理死穴:内存带宽。 单颗芯片塞进 216 GB 的 HBM4 高带宽内存,把吞吐带宽直接顶到每秒 15.4 TB。 在 SemiAnalysis 的基准测试里,这颗 700 瓦功耗的专用芯片,对决 1400 瓦的 Blackwell 系统,吞吐能效提升了 1.5 到 1.9 倍,端到端延迟降低了 1.7 到 3.6 倍。 功耗砍掉近半,速度反而翻倍。 更致命的信号发生在硬件之外。 过去设计一颗先进制程的高端芯片,通常需要两到三年的工程周期和上亿美元的试错成本。 这一次,OpenAI 用自家的代码大模型辅助芯片设计和物理布局,从立项到流片只用了 9 个月。 当软件大模型开始具备自动设计底层硬件的能力,芯片研发的时间表被硬生生压缩了一个数量级。 这也宣告了一个时代的转折。 当 AI 的成本重心从前期的模型训练,全面转向每天消耗数万亿 Token 的推理与智能体调用,通用的硬件垄断就会迅速瓦解。 没有人能长期忍受为一个闲置了八成硬件的通用架构,持续支付昂贵的垄断溢价。 专用架构替代通用芯片,不是一场产品参数的竞争。 是算力经济学逼近物理极限时,必然发生的自我纠错。 当设计芯片的门槛被 AI 自身打碎,算力的护城河就不会再停留在芯片的制造端。 最终能定义下一代硬件形态的,从来不是卖铲子的人。 是那些知道每一滴算力到底该流向哪里的筑渠者。

引用 / CITATIONS

No citations exported.

导出 / EXPORT

订阅 · SUBSCRIBE

新的深度解读发布时,会在每周简报里送到你邮箱。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情