{"source":{"id":"mb-20260829-a060ca","title":"大模型每生成一个词，价值几万美元的 GPU 核心有大半时间都在原地干等","url":"https://mubeitech.com/p/mb-20260829-a060ca"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2069877348653023627","account":"mubei","brand":"@mubei","title":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来…","summary":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。 但不好意思，真正的瓶颈，已经往下移了一层。 拖死这场军备竞赛的，可能是最基础的内存和存储。 最近，存储巨头美光（Micron）的 CEO 出来说了大实…","body":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。\n\n你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。\n\n但不好意思，真正的瓶颈，已经往下移了一层。\n\n拖死这场军备竞赛的，可能是最基础的内存和存储。\n\n最近，存储巨头美光（Micron）的 CEO 出来说了大实话。\n\n他说，客户们现在终于反应过来了，内存和存储的短缺，短时间内根本无解。\n\n甚至， he 用了一个非常绝望的词：“No line of sight”。\n\n意思就是：我们目前完全看不清，内存供应到底什么时候才能追上那帮疯涨的需求。\n\n为什么内存这么致命？\n\n很简单，GPU 算力再强，它也只是个计算引擎。\n\nAI 模型动辄几千亿参数，要把这些庞然大物跑起来，数据得源源不断地送进显存和内存。\n\n如果数据运送通道不够宽、容量不够大，GPU 就只能在那闲置、死等，也就是被“饿死”。\n\n这就好比你造了一辆时速 400 码的顶级超跑，却配了一根吸管粗细的油管。\n\n车跑不快，引擎没问题，是油根本送不上来。\n\nAI 军备竞赛拼到现在，已经进入了找木桶短板的阶段。\n\n第一阶段抢显卡，第二阶段抢电力，现在，终于撞到了内存墙。\n\n美光 CEO 的这番话，直接掀开了算力繁荣背后的残酷真相：\n\n物理极限和产能瓶颈，不会因为你 PPT 上的宏大叙事就凭空消失。\n\n接下来的 AI 竞赛，决定胜负的不再是算法有多聪明。谁能在这个连巨头 CEO 都“看不见尽头”的短缺里多抢到几颗内存芯片，谁就能赢。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2070057086986137989","translated_status_id":"2070057086986137989","published_at":"2026-06-25 08:10:43","created_at":"2026-06-25T10:05:53+02:00","url":"https://mubeitech.com/p/2069877348653023627","markdown_url":"https://mubeitech.com/p/2069877348653023627/markdown"},{"rank":2,"id":"mb-20260829-693a50","account":"mubei","brand":"","title":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提","summary":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提","body":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提。\n\n专业芯片媒体追问具体速率，官方直接拒绝回答。\n\n为什么能大方宣传 480 GB 容量，却把带宽当成秘密藏起来？\n\n因为显存大小只决定你能装下多大的模型。\n\n真正决定你吐一个字要花多少成本的，全在内存带宽里。\n\n大语言模型推理其实分成两道截然不同的工序。\n\n第一道叫预填充。\n\n系统一口气读完提示词，显卡所有的计算核心全速运转，属于纯粹的算力受限。\n\n第二道叫解码。\n\n模型开始一个字一个字往外吐。\n\n在自回归生成的机制下，每生成一个 Token，芯片都必须把模型的全部参数权重，以及所有历史上下文的键值缓存，从显存里完整搬运进计算核心读一遍。\n\n算力核心再快，算完一次矩阵乘法只需要几纳秒。\n\n剩下的绝大部分时间，计算核心都在原地空转，等待显存把下一批数据送过来。\n\n这就是 1995 年计算机学者 Wulf 和 McKee 命名的「内存墙」。\n\n在解码阶段，大模型的吐字速度被一条物理公式锁死：\n\n生成速度上限，取决于内存带宽除以模型参数量。\n\n英特尔在 Hot Chips 2026 上展示的 Crescent Island 推理卡，做了一笔精打细算的商业妥协。\n\n它放弃了英伟达高端芯片昂贵且紧缺的高带宽内存。\n\n转而采用了手机和轻薄本上常见的低功耗内存 LPDDR5X。\n\n这笔账算得很聪明：\n\n整张卡功耗压到了 350W 风冷，给代工厂定制的容量最高能冲到 480 GB，制造成本砍掉了一大半。\n\n但物理规律没有折扣。\n\nLPDDR5X 即使拉满多通道，实际带宽也只有顶尖高带宽内存的几分之一。\n\n显存大，意味着你可以把几十个智能体的超长上下文同时塞进卡里。\n\n带宽低，意味着当这些智能体同时并发生成回复时，每个 Token 的吐出速度会被死死按在低位。\n\n大谈 480 GB，是因为容量写在宣传册上足够震撼。\n\n避谈带宽，是因为带宽直接暴露了它在单字生成上的真实单位经济学。\n\n这一届发布会上的三款芯片，其实都在同一道物理边界上走钢丝。\n\n服务器处理器 Diamond Rapids 堆了 256 个核心，配上 16 通道内存与 1.28 GB 的三级缓存，就是为了在调度多智能体时拼命填补数据搬运的缺口。\n\n面向终端的 Wildcat Lake 砍掉了昂贵的三维堆叠封装，计算芯片面积省了 38%，代价是神经网络处理单元算力降到 17 TOPS，直接丢掉了微软的 Copilot+ 认证。\n\n每一处被刻意略过的参数，背后都是一张严苛的物理账本。\n\n买芯片的人习惯盯着显存容量和峰值算力。\n\n但决定这套硬件商业寿命的，从来不是它能把多大的模型装进仓库。\n\n是它能不能在系统失去响应耐心之前，把仓库里的货物以足够低的成本运送出来。\n\n装得下模型只是入场门票。\n\n运得动数据才是底层账本。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-29 05:39:09","created_at":"2026-08-29 05:39:09","url":"https://mubeitech.com/p/mb-20260829-693a50","markdown_url":"https://mubeitech.com/p/mb-20260829-693a50/markdown"},{"rank":3,"id":"mb-20260823-9f0a1d","account":"mubei","brand":"","title":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","summary":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","body":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%。\n负责组装的代工厂已经陆续向微软、谷歌和甲骨文发出调价通知。\n涉及的机型覆盖了从 Grace Blackwell 到未来的 Vera Rubin 架构。\n很多人第一反应是 NVIDIA 又在利用自己的绝对垄断地位肆意提价。\n但看一眼背后的财务报表，事情有些反常。\nNVIDIA 自身的毛利率常年维持在 75% 的极高水平。\n一家拥有如此丰厚利润垫的芯片巨头，为什么连 15% 的供应链涨幅都不愿意自己消化，非要把成本全额甩给下游客户？\n答案不在 GPU 芯片本身。\n真正的账单藏在那些贴在芯片周围的内存颗粒里。\n推动整台服务器价格飙升的核心推手，是高带宽内存 HBM 与普通服务器内存成本的失控式暴涨。\n为什么在半导体制造技术高度成熟的今天，多造几块内存颗粒会变得这么难？\n顺着晶圆厂的生产线拆到底，会看到一台正在重塑整个算力版图的隐形机器。\n晶圆吞噬效应。\n过去三十年，存储芯片在整个硬件产业链里一直扮演着周期性降价的廉价大宗商品角色。\n只要需求上来，存储原厂开足马力扩产，价格很快就会被砸穿。\n但 AI 大模型打破了这个运行了几十年的旧循环。\n算力芯片跑得越快，对数据吞吐带宽的渴求就越极端。\n普通内存的传输通道已经无法满足需求，工程师只能把 8 层甚至 12 层内存芯片垂直叠在一起，用微米级的硅通孔 TSV 打穿相连，再用先进封装工艺与 GPU 拼装在一起。\n这就是高带宽内存 HBM。\n这种三维堆叠结构在物理上带来了极其苛刻的制造代价。\n因为内部布满了密集的垂直互连通道，单颗 HBM 裸片的物理面积比同等容量的普通内存晶粒大了 50% 到 60%。\n堆叠 12 层芯片意味着良率的乘法损耗：只要其中任意一层存在微小缺陷，整颗封装好的昂贵芯片就必须全盘报废。\n加上底部还需要一块专门的逻辑控制晶圆，半导体行业算出一笔极其残酷的账。\n制造同样容量的 HBM 内存，消耗的 12 英寸原始硅晶圆面积，是制造普通内存的 3 到 4 倍。\n这是一场赤裸裸的零和博弈。\n全球能稳定供应尖端内存的厂商只有 SK Hynix、Samsung 和 Micron 三家。\n面对 HBM 高达数倍的溢价，三大巨头将产线上的晶圆产能大规模切向 HBM。\n结果产生了一场全方位的连环挤压。\n产线切走之后，普通服务器急需的 DDR5 内存供给被硬生生抽干。\n另一边，即便消耗了三倍以上的晶圆产能，造出来的 HBM 依然跟不上算力集群的扩张速度。\n整个半导体供应链同时陷入了双重短缺。\n内存不再是服务器里随行就市的配角，在单台 AI 服务器的硬件物料成本中占比已经突破 20% 到 30%。\n当一个核心零部件因为物理规律的限制产生结构性短缺时，它的定价权就会压倒性地向上游原厂倾斜。\n面对不可抗拒的晶圆物理成本上升，即便是统治算力市场的巨头，也会选择把成本通过代工厂顺流穿透，100% 转移给终端买家。\n很多人以为 AI 算力的扩张是一场无止境的晶体管密度与算法效率竞争。\n底层的物理世界却给出了完全不同的答案。\n算力可以在虚拟世界里无限膨胀，把数据喂进处理器的管道却必须在原子尺度上接受物理定律与良率的严厉惩罚。\n当科技巨头们争相向算力中心投入千亿美元资本时，真正决定这笔账单上限的，从来不单是算力芯片的运算速度，晶圆厂里那道不可逾越的物理置换率才是真正的天花板。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-9f0a1d","markdown_url":"https://mubeitech.com/p/mb-20260823-9f0a1d/markdown"},{"rank":4,"id":"mb-20260827-a4a65d","account":"mubei","brand":"","title":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了","summary":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了","body":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了。\n真实情况恰恰相反。\n70% 只是工厂交货的物理极限，买家开出的真实订单其实早就翻倍了。\n为什么订单多到接不完，营收指引却只能停在七成？\n算力这门狂飙突进的生意，到底在哪道关卡被死死卡住了？\n这台机器叫物理供给约束。\n过去二十年，软件和互联网的扩张规律是零边际成本。\n只要用户点击下载，机房加点带宽，服务就能无限复制。\n但实体硬件世界从来不吃这套虚拟法则。\n一套顶尖的算力集群，不仅需要晶圆制造，还需要高带宽内存堆叠、微米级先进封装、液冷机柜，以及以十万千瓦计的电网配电。\n当大模型对参数和训练算力的需求每年翻倍暴涨，下游的物理供应链根本变不出凭空落地的产线。\nNvidia 首席财务官 Colette Kress 在财报电话里挑明了底牌：客户的实际需求增速冲到了 100%，但受限于高带宽内存等产能瓶颈，公司只能给出约 70% 的交付预期。\n市场的核心矛盾变了。\n增长的上限与买家的钱包无关，死死受制于物理世界一年究竟能交付多少计算设备。\n但这还只是整台机器的表层。\n真正凶狠的飞轮藏在资产负债表里。\n很多人看不懂，为什么一家芯片巨头要掏出几百亿美元，直接砸向前沿 AI 实验室？\n投资机构 Wealth Enhancement Group 的投资主管 Doug Huber 指出了底层的青训农场逻辑。\n顶尖的 AI 实验室在诞生第一天，最稀缺的资源就是极致的算力。\n巨头把资本注入这些初创团队，换来的从来不只是一纸股权凭证。\n真正的杀招，是把自己的通信协议、网络互连架构和底层软件环境，在实验室写第一行代码时就焊死在模型架构里。\n前沿实验室就是整套算力帝国的青训营。\n一旦其中某家实验室跑通了前沿模型、迎来商业化爆发，它后续数以百亿计的算力扩张需求，没有任何改换门庭的余地，全都会原路流回给投资它的硬件母体。\n左手把资金投出去变成初创公司的股权，右手把订单收回来变成源源不断的高毛利硬件销售。\n这是一台自我造血、自我制造需求的确定性闭环。\n超大规模云厂商想靠自研芯片摆脱掌控？\n战场的维度早就变了。\n当其他人还在比拼单颗芯片的跑分高低，新的竞争已经升级为整座算力工厂的系统级交付。\n从处理器、通信网络到机柜级液冷与软件调度，全都打包成了不可拆分的整体。\n换掉一颗芯片代价很小。\n但要拆掉整座已经深度适配了底层协议的算力工厂，成本高到没人承担得起。\n决定这场科技竞逐上限的，根本不是资本市场的短期情绪。\n真正的天花板，是物理世界的工程交付速度与底层的生态锁定。\n当一家公司不仅锁死了下一代硬件的交付产能，还顺手包揽了未来所有核心买家的孵化底座。\n这场竞争，到底是在比谁的算法更聪明，还是在比谁能把物理现实更快地焊进自己的商业闭环里？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:42","created_at":"2026-08-27 22:36:42","url":"https://mubeitech.com/p/mb-20260827-a4a65d","markdown_url":"https://mubeitech.com/p/mb-20260827-a4a65d/markdown"},{"rank":5,"id":"mb-20260828-5faee8","account":"mubei","brand":"","title":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","summary":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","body":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上。\n开测那几天，有人猜它是微软的新架构，有人猜它是硅谷哪家顶尖实验室在放风。\n没人想到这台代号 Ox Alpha 的机器，底层连一张顶规的海外显卡都没用。\n谜底揭开，它是智谱的 GLM-5.3-Flash。\n许多人立刻去算它的商业账：香港上市股价涨了九倍，去年研发砸了 32 亿，亏损 47 亿。\n但金融数字只是表象。\n真正致命的问题只有一个：\n在显存容量和传输带宽双重受限的硬件上，怎么抗住上万亿次的高并发调用？\n很多人以为大模型推理拼的是纯算力。\n算力其实早就不是唯一的瓶颈。\n真正的死穴在显存带宽，计算机科学界早在 1995 年就给它起好了名字：内存墙。\nWulf 和 McKee 在那篇经典论文里指出的困境，在大模型时代被放大了上万倍。\n传统大模型每吐出一个字，就必须把几千亿个参数和之前所有的对话记录，从显存完完整整搬进计算核心一遍。\n计算核心只花了极少时间运算，剩下大半时间全在干等数据从显存搬过来。\n上下文拉得越长，要搬运的键值缓存就越臃肿。\n这笔搬运税，在顶规显卡上可以用极高规格的高带宽内存硬抗。\n可一旦芯片的带宽和互联被卡死，硬扛的代价就是延迟爆炸和成本失控。\n既然硬件层面的路被堵上了，这台机器是怎么绕过去的？\n答案不是去硬拼更快的芯片。\n是把注意力机制的数学逻辑重写了一遍。\n它用了 3200 亿的总参数，但每一次只激活其中的 180 亿。\n更关键的一步在架构层：用线性注意力和稀疏注意力交替堆叠。\n它把原本需要随对话长度无限膨胀的键值缓存，压缩成了固定体积的状态。\n搬运税直接被砍掉了大半。\n硬件不够快，就让软件要搬的数据变少。\n显存通道窄，就让流过去的信息变轻。\n技术的演进往往就是这样。\n当充足的算力唾手可得时，所有人都会选择用最粗暴的方式堆参数、堆显卡。\n只有当物理边界被彻底焊死的时候，真正的架构重构才会被逼出来。\n究竟是算力过剩催生出更聪明的算法，还是算力匮乏逼出了更锋利的刀刃？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 16:48:38","created_at":"2026-08-28 16:48:38","url":"https://mubeitech.com/p/mb-20260828-5faee8","markdown_url":"https://mubeitech.com/p/mb-20260828-5faee8/markdown"},{"rank":6,"id":"mb-20260823-6b2e92","account":"mubei","brand":"","title":"彭博社披露了一份供应链通知","summary":"彭博社披露了一份供应链通知","body":"彭博社披露了一份供应链通知。\nNvidia 已经通知微软、Google 和 Oracle 等主要客户，明年初出货的 AI 服务器价格将全面上涨超过 15%。\n涨价名单里，包括了顶级的 Grace Blackwell，以及刚发布不久的旗舰平台 Vera Rubin。\n坐拥 75% 惊人毛利率、手握算力垄断地位的芯片霸主，为什么突然在这个节点对大客户挥刀加价？\n供应链指出的核心原因只有一个：内存成本彻底失控了。\n过去四十年的计算机体系里，有一条默认的经济学常识。\n逻辑芯片是昂贵的大脑，负责所有的复杂运算。\n内存只是廉价的仓库，在整张物料成本清单里，通常只占 10% 到 15%。\n但这套运行了数十年的规律，被大语言模型和智能体计算彻底击穿了。\nAI 大模型不缺算力芯片的峰值运算次数。\n它缺的是每秒钟把几百亿参数和注意力缓存喂进处理器的速度。\n这就是计算机领域著名的「内存墙」。\n为了打破这道墙，芯片厂商不得不把 DRAM 晶圆打孔切薄，一层层垂直堆叠成立体的高带宽内存。\n这台重塑了半导体格局的机器，叫「成本结构倒置」。\n物理瓶颈被 3D 堆叠强行跨了过去。\n可整个算力系统的账本，却被彻底颠倒了过来。\n在 Grace Blackwell 架构上，高带宽内存占单颗超芯片的物料成本已经达到了 53%。\n而到了下一代 Vera Rubin 架构，这个比例飙升到了 62%。\n在单颗成本约 3.89 万美元的 Vera Rubin 超芯片里，288GB 的 HBM4 加上高速内存，直接吃掉了 2.43 万美元。\n算到一台 72 颗芯片组成的顶级计算机架上，光是塞在里面的内存晶圆，成本就高达 200 万美元。\n每个机架的内存支出，在一代产品之内暴涨了 2.5 倍。\n用来存数据的仓库，造价已经远超负责算力的大脑本身。\n这种立体堆叠的内存良率极低，只要十几层晶圆里有一层瑕疵，整组昂贵的模组就会报废。\n全球能稳定量产的厂商，只剩下 SK Hynix、三星和美光三家。\n制造复杂度的爆炸和产能紧缺，把最强势的话语权，从硅谷的设计巨头，推向了上游的内存晶圆厂。\n即使强如 Nvidia，也无法独自吞下这笔沉重的「内存税」。\n它只能把供应链飙升的硬件账单，连同自己的利润率，原封不动地打包成 15% 的涨价通知，推给硅谷的云巨头们买单。\n许多人以为 AI 算力的军备竞赛，比拼的是谁能设计出更庞大的逻辑核心。\n这轮涨价撕开了一个冰冷的物理现实。\n决定技术扩张速度的，从来不只是算力芯片能跑多快。\n还在于把海量数据送进核心的每一步，究竟要支付多昂贵的过路费。\n当内存吃掉了芯片六成以上的造价，算力竞争的真正关卡，已经从算法与架构，转移到了物理世界的硅片与带宽。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-6b2e92","markdown_url":"https://mubeitech.com/p/mb-20260823-6b2e92/markdown"}]}