{"source":{"id":"mb-20260829-693a50","title":"英特尔给新显卡堆了 480 GB 显存，却在发布现场对最核心的内存带宽闭口不提","url":"https://mubeitech.com/p/mb-20260829-693a50"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260829-a060ca","account":"mubei","brand":"","title":"大模型每生成一个词，价值几万美元的 GPU 核心有大半时间都在原地干等","summary":"大模型每生成一个词，价值几万美元的 GPU 核心有大半时间都在原地干等","body":"大模型每生成一个词，价值几万美元的 GPU 核心有大半时间都在原地干等。\n算力明明已经过剩到了顶点。\n为什么服务器依然卡在吞吐的泥潭里？\n为什么连 NVIDIA 都在短短三个月里，把锁定供应链的采购承诺从 1190 亿美元暴拉到 2790 亿？\n很多人看 AI 芯片，第一反应还是数晶体管数量、比浮点算力跑分。\n但在大模型推理的真实战场上，算力根本不是瓶颈。\n真正的瓶颈在搬运。\n大语言模型生成文本，是一个逐字蹦出、不断循环的自回归过程。\n每蹦出一个新词，芯片都必须把上百吉字节的模型参数，从外部内存完整读一遍。\n在这个过程里，数据搬运的量大得惊人，真正的数学计算却少得可怜。\n算术强度低到了地底。\n结果就是：计算核心跑得飞快，却因为通道太窄，只能眼巴巴等数据从内存里慢吞吞爬过来。\n这是一道统治了计算机工业半个世纪的物理枷锁。\n1977 年，图灵奖得主约翰·巴克斯在获奖演讲里，第一次给它起了名字：冯·诺依曼瓶颈。\n算力单元与存储单元被物理隔开，中间那根狭窄的连接线，成了整个系统永远通不开的堵点。\n到了 1995 年，计算机学者沃尔夫与麦基进一步敲响警钟，称之为内存墙。\n过去三十年，芯片算力翻了成千上万倍。\n可内存读写速度的提升，连算力增长的零头都没赶上。\n把数据从外部内存搬运到计算核心所消耗的能量，甚至比直接完成一次运算高出上百倍。\n这种物理极限，正在把整个半导体产业的设计逻辑彻底颠覆。\n过去半个世纪，所有芯片设计的铁律都是计算优先。\n工程师先定好 CPU 或 GPU 要多强，画好运算单元，最后在边缘留几个接口，把内存当成挂件顺手接上。\n内存只是给计算核心打杂的仓库。\n现在，这套次序彻底倒了过来。\n三星电子在技术峰会上，把这个范式转移明确定义为内存中心计算。\n芯片设计不再先挑 GPU，必须先计算大模型需要多大的内存带宽，再反向决定需要配多少算力、用什么样的三维封装。\n谁掌握了最宽的带宽通道，谁就定义了整颗芯片的性能上限。\n存储巨头卖的不再只是存储容量，真正定价的是单位时间能把数据泵出多快的高带宽。\n甚至为了彻底消灭数据在电路板上的物理传输距离，新一代架构干脆把高带宽内存直接三维垂直堆叠在 AI 加速器正上方。\n当数据搬运的物理极限撞到了墙，原本打杂的配角，就变成了整场游戏的主角。\n真正的产业权力转移，从来不发生在聚光灯照着的前台算力跑分里。\n它发生在底层物理定律卡死通道的那一瞬间。\n谁卡在最窄的那个物理瓶颈上，谁就握住了下一代计算范式的总阀门。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-29 05:39:08","created_at":"2026-08-29 05:39:08","url":"https://mubeitech.com/p/mb-20260829-a060ca","markdown_url":"https://mubeitech.com/p/mb-20260829-a060ca/markdown"},{"rank":2,"id":"mb-20260823-9f0a1d","account":"mubei","brand":"","title":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","summary":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","body":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%。\n负责组装的代工厂已经陆续向微软、谷歌和甲骨文发出调价通知。\n涉及的机型覆盖了从 Grace Blackwell 到未来的 Vera Rubin 架构。\n很多人第一反应是 NVIDIA 又在利用自己的绝对垄断地位肆意提价。\n但看一眼背后的财务报表，事情有些反常。\nNVIDIA 自身的毛利率常年维持在 75% 的极高水平。\n一家拥有如此丰厚利润垫的芯片巨头，为什么连 15% 的供应链涨幅都不愿意自己消化，非要把成本全额甩给下游客户？\n答案不在 GPU 芯片本身。\n真正的账单藏在那些贴在芯片周围的内存颗粒里。\n推动整台服务器价格飙升的核心推手，是高带宽内存 HBM 与普通服务器内存成本的失控式暴涨。\n为什么在半导体制造技术高度成熟的今天，多造几块内存颗粒会变得这么难？\n顺着晶圆厂的生产线拆到底，会看到一台正在重塑整个算力版图的隐形机器。\n晶圆吞噬效应。\n过去三十年，存储芯片在整个硬件产业链里一直扮演着周期性降价的廉价大宗商品角色。\n只要需求上来，存储原厂开足马力扩产，价格很快就会被砸穿。\n但 AI 大模型打破了这个运行了几十年的旧循环。\n算力芯片跑得越快，对数据吞吐带宽的渴求就越极端。\n普通内存的传输通道已经无法满足需求，工程师只能把 8 层甚至 12 层内存芯片垂直叠在一起，用微米级的硅通孔 TSV 打穿相连，再用先进封装工艺与 GPU 拼装在一起。\n这就是高带宽内存 HBM。\n这种三维堆叠结构在物理上带来了极其苛刻的制造代价。\n因为内部布满了密集的垂直互连通道，单颗 HBM 裸片的物理面积比同等容量的普通内存晶粒大了 50% 到 60%。\n堆叠 12 层芯片意味着良率的乘法损耗：只要其中任意一层存在微小缺陷，整颗封装好的昂贵芯片就必须全盘报废。\n加上底部还需要一块专门的逻辑控制晶圆，半导体行业算出一笔极其残酷的账。\n制造同样容量的 HBM 内存，消耗的 12 英寸原始硅晶圆面积，是制造普通内存的 3 到 4 倍。\n这是一场赤裸裸的零和博弈。\n全球能稳定供应尖端内存的厂商只有 SK Hynix、Samsung 和 Micron 三家。\n面对 HBM 高达数倍的溢价，三大巨头将产线上的晶圆产能大规模切向 HBM。\n结果产生了一场全方位的连环挤压。\n产线切走之后，普通服务器急需的 DDR5 内存供给被硬生生抽干。\n另一边，即便消耗了三倍以上的晶圆产能，造出来的 HBM 依然跟不上算力集群的扩张速度。\n整个半导体供应链同时陷入了双重短缺。\n内存不再是服务器里随行就市的配角，在单台 AI 服务器的硬件物料成本中占比已经突破 20% 到 30%。\n当一个核心零部件因为物理规律的限制产生结构性短缺时，它的定价权就会压倒性地向上游原厂倾斜。\n面对不可抗拒的晶圆物理成本上升，即便是统治算力市场的巨头，也会选择把成本通过代工厂顺流穿透，100% 转移给终端买家。\n很多人以为 AI 算力的扩张是一场无止境的晶体管密度与算法效率竞争。\n底层的物理世界却给出了完全不同的答案。\n算力可以在虚拟世界里无限膨胀，把数据喂进处理器的管道却必须在原子尺度上接受物理定律与良率的严厉惩罚。\n当科技巨头们争相向算力中心投入千亿美元资本时，真正决定这笔账单上限的，从来不单是算力芯片的运算速度，晶圆厂里那道不可逾越的物理置换率才是真正的天花板。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-9f0a1d","markdown_url":"https://mubeitech.com/p/mb-20260823-9f0a1d/markdown"},{"rank":3,"id":"mb-20260828-5faee8","account":"mubei","brand":"","title":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","summary":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上","body":"一个刷爆海外开发者圈子的匿名模型，所有流量全跑在被技术限制的国产芯片上。\n开测那几天，有人猜它是微软的新架构，有人猜它是硅谷哪家顶尖实验室在放风。\n没人想到这台代号 Ox Alpha 的机器，底层连一张顶规的海外显卡都没用。\n谜底揭开，它是智谱的 GLM-5.3-Flash。\n许多人立刻去算它的商业账：香港上市股价涨了九倍，去年研发砸了 32 亿，亏损 47 亿。\n但金融数字只是表象。\n真正致命的问题只有一个：\n在显存容量和传输带宽双重受限的硬件上，怎么抗住上万亿次的高并发调用？\n很多人以为大模型推理拼的是纯算力。\n算力其实早就不是唯一的瓶颈。\n真正的死穴在显存带宽，计算机科学界早在 1995 年就给它起好了名字：内存墙。\nWulf 和 McKee 在那篇经典论文里指出的困境，在大模型时代被放大了上万倍。\n传统大模型每吐出一个字，就必须把几千亿个参数和之前所有的对话记录，从显存完完整整搬进计算核心一遍。\n计算核心只花了极少时间运算，剩下大半时间全在干等数据从显存搬过来。\n上下文拉得越长，要搬运的键值缓存就越臃肿。\n这笔搬运税，在顶规显卡上可以用极高规格的高带宽内存硬抗。\n可一旦芯片的带宽和互联被卡死，硬扛的代价就是延迟爆炸和成本失控。\n既然硬件层面的路被堵上了，这台机器是怎么绕过去的？\n答案不是去硬拼更快的芯片。\n是把注意力机制的数学逻辑重写了一遍。\n它用了 3200 亿的总参数，但每一次只激活其中的 180 亿。\n更关键的一步在架构层：用线性注意力和稀疏注意力交替堆叠。\n它把原本需要随对话长度无限膨胀的键值缓存，压缩成了固定体积的状态。\n搬运税直接被砍掉了大半。\n硬件不够快，就让软件要搬的数据变少。\n显存通道窄，就让流过去的信息变轻。\n技术的演进往往就是这样。\n当充足的算力唾手可得时，所有人都会选择用最粗暴的方式堆参数、堆显卡。\n只有当物理边界被彻底焊死的时候，真正的架构重构才会被逼出来。\n究竟是算力过剩催生出更聪明的算法，还是算力匮乏逼出了更锋利的刀刃？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 16:48:38","created_at":"2026-08-28 16:48:38","url":"https://mubeitech.com/p/mb-20260828-5faee8","markdown_url":"https://mubeitech.com/p/mb-20260828-5faee8/markdown"},{"rank":4,"id":"2069877348653023627","account":"mubei","brand":"@mubei","title":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来…","summary":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。 但不好意思，真正的瓶颈，已经往下移了一层。 拖死这场军备竞赛的，可能是最基础的内存和存储。 最近，存储巨头美光（Micron）的 CEO 出来说了大实…","body":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。\n\n你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。\n\n但不好意思，真正的瓶颈，已经往下移了一层。\n\n拖死这场军备竞赛的，可能是最基础的内存和存储。\n\n最近，存储巨头美光（Micron）的 CEO 出来说了大实话。\n\n他说，客户们现在终于反应过来了，内存和存储的短缺，短时间内根本无解。\n\n甚至， he 用了一个非常绝望的词：“No line of sight”。\n\n意思就是：我们目前完全看不清，内存供应到底什么时候才能追上那帮疯涨的需求。\n\n为什么内存这么致命？\n\n很简单，GPU 算力再强，它也只是个计算引擎。\n\nAI 模型动辄几千亿参数，要把这些庞然大物跑起来，数据得源源不断地送进显存和内存。\n\n如果数据运送通道不够宽、容量不够大，GPU 就只能在那闲置、死等，也就是被“饿死”。\n\n这就好比你造了一辆时速 400 码的顶级超跑，却配了一根吸管粗细的油管。\n\n车跑不快，引擎没问题，是油根本送不上来。\n\nAI 军备竞赛拼到现在，已经进入了找木桶短板的阶段。\n\n第一阶段抢显卡，第二阶段抢电力，现在，终于撞到了内存墙。\n\n美光 CEO 的这番话，直接掀开了算力繁荣背后的残酷真相：\n\n物理极限和产能瓶颈，不会因为你 PPT 上的宏大叙事就凭空消失。\n\n接下来的 AI 竞赛，决定胜负的不再是算法有多聪明。谁能在这个连巨头 CEO 都“看不见尽头”的短缺里多抢到几颗内存芯片，谁就能赢。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2070057086986137989","translated_status_id":"2070057086986137989","published_at":"2026-06-25 08:10:43","created_at":"2026-06-25T10:05:53+02:00","url":"https://mubeitech.com/p/2069877348653023627","markdown_url":"https://mubeitech.com/p/2069877348653023627/markdown"},{"rank":5,"id":"mb-20260823-6b2e92","account":"mubei","brand":"","title":"彭博社披露了一份供应链通知","summary":"彭博社披露了一份供应链通知","body":"彭博社披露了一份供应链通知。\nNvidia 已经通知微软、Google 和 Oracle 等主要客户，明年初出货的 AI 服务器价格将全面上涨超过 15%。\n涨价名单里，包括了顶级的 Grace Blackwell，以及刚发布不久的旗舰平台 Vera Rubin。\n坐拥 75% 惊人毛利率、手握算力垄断地位的芯片霸主，为什么突然在这个节点对大客户挥刀加价？\n供应链指出的核心原因只有一个：内存成本彻底失控了。\n过去四十年的计算机体系里，有一条默认的经济学常识。\n逻辑芯片是昂贵的大脑，负责所有的复杂运算。\n内存只是廉价的仓库，在整张物料成本清单里，通常只占 10% 到 15%。\n但这套运行了数十年的规律，被大语言模型和智能体计算彻底击穿了。\nAI 大模型不缺算力芯片的峰值运算次数。\n它缺的是每秒钟把几百亿参数和注意力缓存喂进处理器的速度。\n这就是计算机领域著名的「内存墙」。\n为了打破这道墙，芯片厂商不得不把 DRAM 晶圆打孔切薄，一层层垂直堆叠成立体的高带宽内存。\n这台重塑了半导体格局的机器，叫「成本结构倒置」。\n物理瓶颈被 3D 堆叠强行跨了过去。\n可整个算力系统的账本，却被彻底颠倒了过来。\n在 Grace Blackwell 架构上，高带宽内存占单颗超芯片的物料成本已经达到了 53%。\n而到了下一代 Vera Rubin 架构，这个比例飙升到了 62%。\n在单颗成本约 3.89 万美元的 Vera Rubin 超芯片里，288GB 的 HBM4 加上高速内存，直接吃掉了 2.43 万美元。\n算到一台 72 颗芯片组成的顶级计算机架上，光是塞在里面的内存晶圆，成本就高达 200 万美元。\n每个机架的内存支出，在一代产品之内暴涨了 2.5 倍。\n用来存数据的仓库，造价已经远超负责算力的大脑本身。\n这种立体堆叠的内存良率极低，只要十几层晶圆里有一层瑕疵，整组昂贵的模组就会报废。\n全球能稳定量产的厂商，只剩下 SK Hynix、三星和美光三家。\n制造复杂度的爆炸和产能紧缺，把最强势的话语权，从硅谷的设计巨头，推向了上游的内存晶圆厂。\n即使强如 Nvidia，也无法独自吞下这笔沉重的「内存税」。\n它只能把供应链飙升的硬件账单，连同自己的利润率，原封不动地打包成 15% 的涨价通知，推给硅谷的云巨头们买单。\n许多人以为 AI 算力的军备竞赛，比拼的是谁能设计出更庞大的逻辑核心。\n这轮涨价撕开了一个冰冷的物理现实。\n决定技术扩张速度的，从来不只是算力芯片能跑多快。\n还在于把海量数据送进核心的每一步，究竟要支付多昂贵的过路费。\n当内存吃掉了芯片六成以上的造价，算力竞争的真正关卡，已经从算法与架构，转移到了物理世界的硅片与带宽。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-6b2e92","markdown_url":"https://mubeitech.com/p/mb-20260823-6b2e92/markdown"},{"rank":6,"id":"2081394445682114906","account":"mubei","brand":"@mubei","title":"买最贵的 GPU，已经不再自动赢下推理局。 SemiAnalysis 的分析师 Dylan Patel 揭开了推理时代的…","summary":"买最贵的 GPU，已经不再自动赢下推理局。 SemiAnalysis 的分析师 Dylan Patel 揭开了推理时代的新逻辑。 现在的算力瓶颈，已经从单卡算力转移到了内存和存储。 一款算力稍弱、但内存和存储更好的芯片，能直接打败没有好内存的顶级芯片。 比如在某些场景下，内存更大…","body":"买最贵的 GPU，已经不再自动赢下推理局。\n\nSemiAnalysis 的分析师 Dylan Patel 揭开了推理时代的新逻辑。\n现在的算力瓶颈，已经从单卡算力转移到了内存和存储。\n一款算力稍弱、但内存和存储更好的芯片，能直接打败没有好内存的顶级芯片。\n比如在某些场景下，内存更大的 AMD 显卡，跑得比英伟达还要好。\n\n但英伟达的护城河崩了吗？\n根本没有。\n它现在的终极壁垒，是对系统供给和分发渠道的绝对统治。\n\n英伟达手里，攥着 100 多家新兴云厂商。\n怎么拿捏？\n你不听话，我直接抽走你的算力配额。\n你缺钱买卡，我亲自给你的贷款兜底。\n这 100 多家云厂商帮它卖算力，同时也是替它向全世界喊话的传声筒。\n\n别的硬件生态想进来分一杯羹？\n太难了。\n就算其他厂商（比如 SambaNova）造出了好芯片，如果没有这样一个庞大且忠诚的分发网络替你铺货，卡连机房都进不去。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2081494191515799995","translated_status_id":"2081494191515799995","published_at":"2026-07-26 19:37:08","created_at":"2026-07-26T21:28:03+02:00","url":"https://mubeitech.com/p/2081394445682114906","markdown_url":"https://mubeitech.com/p/2081394445682114906/markdown"}]}