{"id":"mb-20260829-693a50","account":"mubei","brand":"","title":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提","summary":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提","body":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提。\n\n专业芯片媒体追问具体速率，官方直接拒绝回答。\n\n为什么能大方宣传 480 GB 容量，却把带宽当成秘密藏起来？\n\n因为显存大小只决定你能装下多大的模型。\n\n真正决定你吐一个字要花多少成本的，全在内存带宽里。\n\n大语言模型推理其实分成两道截然不同的工序。\n\n第一道叫预填充。\n\n系统一口气读完提示词，显卡所有的计算核心全速运转，属于纯粹的算力受限。\n\n第二道叫解码。\n\n模型开始一个字一个字往外吐。\n\n在自回归生成的机制下，每生成一个 Token，芯片都必须把模型的全部参数权重，以及所有历史上下文的键值缓存，从显存里完整搬运进计算核心读一遍。\n\n算力核心再快，算完一次矩阵乘法只需要几纳秒。\n\n剩下的绝大部分时间，计算核心都在原地空转，等待显存把下一批数据送过来。\n\n这就是 1995 年计算机学者 Wulf 和 McKee 命名的「内存墙」。\n\n在解码阶段，大模型的吐字速度被一条物理公式锁死：\n\n生成速度上限，取决于内存带宽除以模型参数量。\n\n英特尔在 Hot Chips 2026 上展示的 Crescent Island 推理卡，做了一笔精打细算的商业妥协。\n\n它放弃了英伟达高端芯片昂贵且紧缺的高带宽内存。\n\n转而采用了手机和轻薄本上常见的低功耗内存 LPDDR5X。\n\n这笔账算得很聪明：\n\n整张卡功耗压到了 350W 风冷，给代工厂定制的容量最高能冲到 480 GB，制造成本砍掉了一大半。\n\n但物理规律没有折扣。\n\nLPDDR5X 即使拉满多通道，实际带宽也只有顶尖高带宽内存的几分之一。\n\n显存大，意味着你可以把几十个智能体的超长上下文同时塞进卡里。\n\n带宽低，意味着当这些智能体同时并发生成回复时，每个 Token 的吐出速度会被死死按在低位。\n\n大谈 480 GB，是因为容量写在宣传册上足够震撼。\n\n避谈带宽，是因为带宽直接暴露了它在单字生成上的真实单位经济学。\n\n这一届发布会上的三款芯片，其实都在同一道物理边界上走钢丝。\n\n服务器处理器 Diamond Rapids 堆了 256 个核心，配上 16 通道内存与 1.28 GB 的三级缓存，就是为了在调度多智能体时拼命填补数据搬运的缺口。\n\n面向终端的 Wildcat Lake 砍掉了昂贵的三维堆叠封装，计算芯片面积省了 38%，代价是神经网络处理单元算力降到 17 TOPS，直接丢掉了微软的 Copilot+ 认证。\n\n每一处被刻意略过的参数，背后都是一张严苛的物理账本。\n\n买芯片的人习惯盯着显存容量和峰值算力。\n\n但决定这套硬件商业寿命的，从来不是它能把多大的模型装进仓库。\n\n是它能不能在系统失去响应耐心之前，把仓库里的货物以足够低的成本运送出来。\n\n装得下模型只是入场门票。\n\n运得动数据才是底层账本。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-29 05:39:09","created_at":"2026-08-29 05:39:09"}