科技·via

英特尔给新显卡堆了 480 GB 显存,却在发布现场对最核心的内存带宽闭口不提

英特尔给新显卡堆了 480 GB 显存,却在发布现场对最核心的内存带宽闭口不提。

专业芯片媒体追问具体速率,官方直接拒绝回答。

为什么能大方宣传 480 GB 容量,却把带宽当成秘密藏起来?

因为显存大小只决定你能装下多大的模型。

真正决定你吐一个字要花多少成本的,全在内存带宽里。

大语言模型推理其实分成两道截然不同的工序。

第一道叫预填充。

系统一口气读完提示词,显卡所有的计算核心全速运转,属于纯粹的算力受限。

第二道叫解码。

模型开始一个字一个字往外吐。

在自回归生成的机制下,每生成一个 Token,芯片都必须把模型的全部参数权重,以及所有历史上下文的键值缓存,从显存里完整搬运进计算核心读一遍。

算力核心再快,算完一次矩阵乘法只需要几纳秒。

剩下的绝大部分时间,计算核心都在原地空转,等待显存把下一批数据送过来。

这就是 1995 年计算机学者 Wulf 和 McKee 命名的「内存墙」。

在解码阶段,大模型的吐字速度被一条物理公式锁死:

生成速度上限,取决于内存带宽除以模型参数量。

英特尔在 Hot Chips 2026 上展示的 Crescent Island 推理卡,做了一笔精打细算的商业妥协。

它放弃了英伟达高端芯片昂贵且紧缺的高带宽内存。

转而采用了手机和轻薄本上常见的低功耗内存 LPDDR5X。

这笔账算得很聪明:

整张卡功耗压到了 350W 风冷,给代工厂定制的容量最高能冲到 480 GB,制造成本砍掉了一大半。

但物理规律没有折扣。

LPDDR5X 即使拉满多通道,实际带宽也只有顶尖高带宽内存的几分之一。

显存大,意味着你可以把几十个智能体的超长上下文同时塞进卡里。

带宽低,意味着当这些智能体同时并发生成回复时,每个 Token 的吐出速度会被死死按在低位。

大谈 480 GB,是因为容量写在宣传册上足够震撼。

避谈带宽,是因为带宽直接暴露了它在单字生成上的真实单位经济学。

这一届发布会上的三款芯片,其实都在同一道物理边界上走钢丝。

服务器处理器 Diamond Rapids 堆了 256 个核心,配上 16 通道内存与 1.28 GB 的三级缓存,就是为了在调度多智能体时拼命填补数据搬运的缺口。

面向终端的 Wildcat Lake 砍掉了昂贵的三维堆叠封装,计算芯片面积省了 38%,代价是神经网络处理单元算力降到 17 TOPS,直接丢掉了微软的 Copilot+ 认证。

每一处被刻意略过的参数,背后都是一张严苛的物理账本。

买芯片的人习惯盯着显存容量和峰值算力。

但决定这套硬件商业寿命的,从来不是它能把多大的模型装进仓库。

是它能不能在系统失去响应耐心之前,把仓库里的货物以足够低的成本运送出来。

装得下模型只是入场门票。

运得动数据才是底层账本。

相关 / RELATED

JSON

导出 / EXPORT

订阅 · SUBSCRIBE

每周一封信号简报,重大进展可选即时推送。

不追踪邮件打开与邮件链接点击,一键退订。 或用 RSS · 详情