{"source":{"id":"mb-20260827-9314bf","title":"过去二十年，硬件厂商一直在替软件开发者的臃肿买单","url":"https://mubeitech.com/p/mb-20260827-9314bf"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260823-6b2e92","account":"mubei","brand":"","title":"彭博社披露了一份供应链通知","summary":"彭博社披露了一份供应链通知","body":"彭博社披露了一份供应链通知。\nNvidia 已经通知微软、Google 和 Oracle 等主要客户，明年初出货的 AI 服务器价格将全面上涨超过 15%。\n涨价名单里，包括了顶级的 Grace Blackwell，以及刚发布不久的旗舰平台 Vera Rubin。\n坐拥 75% 惊人毛利率、手握算力垄断地位的芯片霸主，为什么突然在这个节点对大客户挥刀加价？\n供应链指出的核心原因只有一个：内存成本彻底失控了。\n过去四十年的计算机体系里，有一条默认的经济学常识。\n逻辑芯片是昂贵的大脑，负责所有的复杂运算。\n内存只是廉价的仓库，在整张物料成本清单里，通常只占 10% 到 15%。\n但这套运行了数十年的规律，被大语言模型和智能体计算彻底击穿了。\nAI 大模型不缺算力芯片的峰值运算次数。\n它缺的是每秒钟把几百亿参数和注意力缓存喂进处理器的速度。\n这就是计算机领域著名的「内存墙」。\n为了打破这道墙，芯片厂商不得不把 DRAM 晶圆打孔切薄，一层层垂直堆叠成立体的高带宽内存。\n这台重塑了半导体格局的机器，叫「成本结构倒置」。\n物理瓶颈被 3D 堆叠强行跨了过去。\n可整个算力系统的账本，却被彻底颠倒了过来。\n在 Grace Blackwell 架构上，高带宽内存占单颗超芯片的物料成本已经达到了 53%。\n而到了下一代 Vera Rubin 架构，这个比例飙升到了 62%。\n在单颗成本约 3.89 万美元的 Vera Rubin 超芯片里，288GB 的 HBM4 加上高速内存，直接吃掉了 2.43 万美元。\n算到一台 72 颗芯片组成的顶级计算机架上，光是塞在里面的内存晶圆，成本就高达 200 万美元。\n每个机架的内存支出，在一代产品之内暴涨了 2.5 倍。\n用来存数据的仓库，造价已经远超负责算力的大脑本身。\n这种立体堆叠的内存良率极低，只要十几层晶圆里有一层瑕疵，整组昂贵的模组就会报废。\n全球能稳定量产的厂商，只剩下 SK Hynix、三星和美光三家。\n制造复杂度的爆炸和产能紧缺，把最强势的话语权，从硅谷的设计巨头，推向了上游的内存晶圆厂。\n即使强如 Nvidia，也无法独自吞下这笔沉重的「内存税」。\n它只能把供应链飙升的硬件账单，连同自己的利润率，原封不动地打包成 15% 的涨价通知，推给硅谷的云巨头们买单。\n许多人以为 AI 算力的军备竞赛，比拼的是谁能设计出更庞大的逻辑核心。\n这轮涨价撕开了一个冰冷的物理现实。\n决定技术扩张速度的，从来不只是算力芯片能跑多快。\n还在于把海量数据送进核心的每一步，究竟要支付多昂贵的过路费。\n当内存吃掉了芯片六成以上的造价，算力竞争的真正关卡，已经从算法与架构，转移到了物理世界的硅片与带宽。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-6b2e92","markdown_url":"https://mubeitech.com/p/mb-20260823-6b2e92/markdown"},{"rank":2,"id":"mb-20260823-9f0a1d","account":"mubei","brand":"","title":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","summary":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%","body":"供应链传出消息，NVIDIA 最新一代 AI 服务器的出厂价格即将全线上调超过 15%。\n负责组装的代工厂已经陆续向微软、谷歌和甲骨文发出调价通知。\n涉及的机型覆盖了从 Grace Blackwell 到未来的 Vera Rubin 架构。\n很多人第一反应是 NVIDIA 又在利用自己的绝对垄断地位肆意提价。\n但看一眼背后的财务报表，事情有些反常。\nNVIDIA 自身的毛利率常年维持在 75% 的极高水平。\n一家拥有如此丰厚利润垫的芯片巨头，为什么连 15% 的供应链涨幅都不愿意自己消化，非要把成本全额甩给下游客户？\n答案不在 GPU 芯片本身。\n真正的账单藏在那些贴在芯片周围的内存颗粒里。\n推动整台服务器价格飙升的核心推手，是高带宽内存 HBM 与普通服务器内存成本的失控式暴涨。\n为什么在半导体制造技术高度成熟的今天，多造几块内存颗粒会变得这么难？\n顺着晶圆厂的生产线拆到底，会看到一台正在重塑整个算力版图的隐形机器。\n晶圆吞噬效应。\n过去三十年，存储芯片在整个硬件产业链里一直扮演着周期性降价的廉价大宗商品角色。\n只要需求上来，存储原厂开足马力扩产，价格很快就会被砸穿。\n但 AI 大模型打破了这个运行了几十年的旧循环。\n算力芯片跑得越快，对数据吞吐带宽的渴求就越极端。\n普通内存的传输通道已经无法满足需求，工程师只能把 8 层甚至 12 层内存芯片垂直叠在一起，用微米级的硅通孔 TSV 打穿相连，再用先进封装工艺与 GPU 拼装在一起。\n这就是高带宽内存 HBM。\n这种三维堆叠结构在物理上带来了极其苛刻的制造代价。\n因为内部布满了密集的垂直互连通道，单颗 HBM 裸片的物理面积比同等容量的普通内存晶粒大了 50% 到 60%。\n堆叠 12 层芯片意味着良率的乘法损耗：只要其中任意一层存在微小缺陷，整颗封装好的昂贵芯片就必须全盘报废。\n加上底部还需要一块专门的逻辑控制晶圆，半导体行业算出一笔极其残酷的账。\n制造同样容量的 HBM 内存，消耗的 12 英寸原始硅晶圆面积，是制造普通内存的 3 到 4 倍。\n这是一场赤裸裸的零和博弈。\n全球能稳定供应尖端内存的厂商只有 SK Hynix、Samsung 和 Micron 三家。\n面对 HBM 高达数倍的溢价，三大巨头将产线上的晶圆产能大规模切向 HBM。\n结果产生了一场全方位的连环挤压。\n产线切走之后，普通服务器急需的 DDR5 内存供给被硬生生抽干。\n另一边，即便消耗了三倍以上的晶圆产能，造出来的 HBM 依然跟不上算力集群的扩张速度。\n整个半导体供应链同时陷入了双重短缺。\n内存不再是服务器里随行就市的配角，在单台 AI 服务器的硬件物料成本中占比已经突破 20% 到 30%。\n当一个核心零部件因为物理规律的限制产生结构性短缺时，它的定价权就会压倒性地向上游原厂倾斜。\n面对不可抗拒的晶圆物理成本上升，即便是统治算力市场的巨头，也会选择把成本通过代工厂顺流穿透，100% 转移给终端买家。\n很多人以为 AI 算力的扩张是一场无止境的晶体管密度与算法效率竞争。\n底层的物理世界却给出了完全不同的答案。\n算力可以在虚拟世界里无限膨胀，把数据喂进处理器的管道却必须在原子尺度上接受物理定律与良率的严厉惩罚。\n当科技巨头们争相向算力中心投入千亿美元资本时，真正决定这笔账单上限的，从来不单是算力芯片的运算速度，晶圆厂里那道不可逾越的物理置换率才是真正的天花板。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-9f0a1d","markdown_url":"https://mubeitech.com/p/mb-20260823-9f0a1d/markdown"},{"rank":3,"id":"2070303759041782054","account":"mubei","brand":"@mubei","title":"马斯克和库克，居然在同一件事上穿了同一条裤子。 这两个平时路数完全不同的人，最近达成了一个惊人的共识： 全球正在陷入一场…","summary":"马斯克和库克，居然在同一件事上穿了同一条裤子。 这两个平时路数完全不同的人，最近达成了一个惊人的共识： 全球正在陷入一场迫在眉睫的“内存危机”。 AI 的终极瓶颈，可能根本不在算法和算力，内存产能才是关键。 马斯克和库克都认为，现在的内存产能必须翻倍、甚至翻几倍地往上飙。 但问题…","body":"马斯克和库克，居然在同一件事上穿了同一条裤子。\n\n这两个平时路数完全不同的人，最近达成了一个惊人的共识：\n全球正在陷入一场迫在眉睫的“内存危机”。\n\nAI 的终极瓶颈，可能根本不在算法和算力，内存产能才是关键。\n马斯克和库克都认为，现在的内存产能必须翻倍、甚至翻几倍地往上飙。\n但问题是，那些传统的“内存大佬们”根本不买账。\n\n传统芯片厂是保守的。\n他们害怕产能过剩重演，宁可慢慢挤牙膏，也不愿意冒风险疯狂建厂。\n这就导致了一个极其尴尬的局面：\n硅谷的 AI 模型在疯狂进化，底层的硬件产能却在慢悠悠地散步。\n\n眼看市场手段失灵，巨头们坐不住了。\n现在的信号非常明确：Big Tech 正在试图把华盛顿拉进这场博弈。\n他们想要美国政府直接介入，用国家力量来强推半导体内存的扩产。\n\n当最崇尚自由市场的硅谷科技巨头，开始呼唤政府力量来强行干预产能，\n你就知道，这场 AI 军备竞赛，已经进入到了多么残暴和焦虑的阶段。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2070485039427502119","translated_status_id":"2070485039427502119","published_at":"2026-06-26 12:31:15","created_at":"2026-06-26T14:27:31+02:00","url":"https://mubeitech.com/p/2070303759041782054","markdown_url":"https://mubeitech.com/p/2070303759041782054/markdown"},{"rank":4,"id":"2069877348653023627","account":"mubei","brand":"@mubei","title":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来…","summary":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。 你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。 但不好意思，真正的瓶颈，已经往下移了一层。 拖死这场军备竞赛的，可能是最基础的内存和存储。 最近，存储巨头美光（Micron）的 CEO 出来说了大实…","body":"搞 AI，所有人都在盯着 NVIDIA 的 GPU。\n\n你抢 H100，我抢 B200，好像只要拿到显卡，就能买到通往未来的门票。\n\n但不好意思，真正的瓶颈，已经往下移了一层。\n\n拖死这场军备竞赛的，可能是最基础的内存和存储。\n\n最近，存储巨头美光（Micron）的 CEO 出来说了大实话。\n\n他说，客户们现在终于反应过来了，内存和存储的短缺，短时间内根本无解。\n\n甚至， he 用了一个非常绝望的词：“No line of sight”。\n\n意思就是：我们目前完全看不清，内存供应到底什么时候才能追上那帮疯涨的需求。\n\n为什么内存这么致命？\n\n很简单，GPU 算力再强，它也只是个计算引擎。\n\nAI 模型动辄几千亿参数，要把这些庞然大物跑起来，数据得源源不断地送进显存和内存。\n\n如果数据运送通道不够宽、容量不够大，GPU 就只能在那闲置、死等，也就是被“饿死”。\n\n这就好比你造了一辆时速 400 码的顶级超跑，却配了一根吸管粗细的油管。\n\n车跑不快，引擎没问题，是油根本送不上来。\n\nAI 军备竞赛拼到现在，已经进入了找木桶短板的阶段。\n\n第一阶段抢显卡，第二阶段抢电力，现在，终于撞到了内存墙。\n\n美光 CEO 的这番话，直接掀开了算力繁荣背后的残酷真相：\n\n物理极限和产能瓶颈，不会因为你 PPT 上的宏大叙事就凭空消失。\n\n接下来的 AI 竞赛，决定胜负的不再是算法有多聪明。谁能在这个连巨头 CEO 都“看不见尽头”的短缺里多抢到几颗内存芯片，谁就能赢。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2070057086986137989","translated_status_id":"2070057086986137989","published_at":"2026-06-25 08:10:43","created_at":"2026-06-25T10:05:53+02:00","url":"https://mubeitech.com/p/2069877348653023627","markdown_url":"https://mubeitech.com/p/2069877348653023627/markdown"},{"rank":5,"id":"mb-20260827-cb5609","account":"mubei","brand":"","title":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元","summary":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元","body":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元。\n但同一个账本上，现金正在以几乎同样恐怖的速度被迅速烧光。\n营收暴涨三倍的同时，亏损不仅没有收窄，反而随着业务规模越滚越大。\n为什么全世界最会赚钱的 AI 编程公司，摆脱不了越卖越亏的怪圈？\n是管理失控，还是软件行业运行了三十年的底层商业模式被彻底打破了？\n顺着这家开发出 Devin 的 AI 初创公司 Cognition 拆开账本，会撞见一台正在颠覆整个科技产业的冰冷机器。\n服务即软件的边际成本陷阱。\n过去三十年，整个硅谷和华尔街的风投体系，全部建立在同一个物理常识之上。\n代码的复制边际成本为零。\n微软把 Windows 刻成光盘，或者 Salesforce 在云端多开一个账号，交付给第 1000 万个用户的成本基本是零。\n这种近乎免费的边际扩张，让传统软件公司坐拥 85% 到 90% 的超高毛利率。\n收进来的每一块钱软件订阅费，绝大部分都能直接沉淀为纯利润。\n资本市场之所以愿意给传统软件几十倍的市销率，买的就是这台不用追加成本就能无限印钞的机器。\n但自主智能体的出现，直接把这台印钞机的底座给拆了。\n像 Devin 这样的工具，卖的不再是一个静态的软件界面或代码补全插件。\n它卖的是一个能够独立工作的数字劳工。\n当一个程序员给它指派一个复杂的系统漏洞，Devin 不仅是在生成文本。\n它必须在独立的虚拟机沙盒里拉取整个代码库，规划架构，反复运行终端命令，甚至自动打开浏览器抓取文档。\n一次看似简单的代码合并请求，背后可能涉及数十次甚至上百次大模型深度推理的连锁循环。\n这意味着软件历史上从未出现过的物理现实：\n每一次交付任务，都在真金白银地消耗电费、显卡与 Token 算力。\n软件的边际成本不再是零，变成了一笔随着任务复杂度成倍膨胀的硬性营业成本。\nCognition 内部把这种计费形态封装成智能体计算单元 ACU。\n客户不再按使用人数买账号，开始按智能体消耗的算力工时买单。\n这也导致了一个极其残酷的财务后果：\n这类前沿智能体公司的真实毛利率，被直接砸到了 30% 到 50% 的泥潭里。\n收入每增加一百万美元，背后就有大几十万美元要原封不动地转交给上游的算力商和芯片巨头。\n既然毛利率这么难看，为什么纽约梅隆银行、桑坦德银行和奔驰这些挑剔的巨头，依然排着队把几千万美元砸给它？\n华尔街又为什么敢给一家低毛利公司报出 450 亿美元的天价？\n因为商业世界对它的估值锚点，已经换到了一个大上百倍的池子里。\n传统软件盯上的是企业每年几千亿美元的 IT 采购预算。\n智能体直接瞄准的，是全球数万亿美元的工程师薪酬与外包工资单。\n对一家大银行来说，让 Devin 修一个陈年老系统 Bug 消耗 50 美元的算力，毛利率哪怕只有三成，也比雇佣一个时薪 150 美元的硅谷工程师在电脑前耗上三天要便宜得多。\n它表面上披着软件的外衣，底层做的是硅基劳务外包。\n这是一场用高昂的算力成本，去强行置换更高昂人类工资的宏大套利。\n但这也决定了这场竞赛最致命的分水岭。\n在传统软件时代，谁的营销团队强，谁就能靠零边际成本赢家通吃。\n在智能体时代，算力账单成了悬在头顶的达摩克利斯之剑。\n谁能通过精细的模型路由、投机解码和工程优化，把每一次修 Bug 的 Token 消耗压低一半，谁才能把代工工头的苦力账本，重新做成真正暴利的护城河。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:40","created_at":"2026-08-27 22:36:40","url":"https://mubeitech.com/p/mb-20260827-cb5609","markdown_url":"https://mubeitech.com/p/mb-20260827-cb5609/markdown"},{"rank":6,"id":"mb-20260827-d0ae18","account":"mubei","brand":"","title":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","summary":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转","body":"把一个 3130 亿参数的庞然大物，塞进一台只有 8GB 内存的 MacBook 里运转。\n按照过去的算力常识，313B 模型哪怕压缩到极限制式，至少也需要 160GB 显存。\n8GB 内存，连这个模型权重文件的零头都装不下。\n但这套系统不仅没有爆内存崩溃，运行所需的常驻内存甚至只要 5.14GB。\n在配备 64GB 内存的笔记本上，它每秒能稳稳吐出接近 4 个 token。\n苹果的统一内存物理定律失效了吗？\n它是怎么在一台消费级笔记本上，把过去需要机房集群才能跑的庞然大物转起来的？\n答案不在更贵的硬件芯片里。\n在一台被重新设计的软件机器里。\n权重感知流式分页机制。\n开发者马可·班比尼（Marco Bambini）写了一个用纯 C 语言构建、零第三方依赖的开源推理引擎 WARP。\n在这之前，他已经用这套引擎在 Mac 上跑通了 2.78 万亿参数的 Kimi K3 模型。\n这套引擎真正击穿的，是整个行业对大模型推理的一条思维惯性。\n过去大家默认：要在本地跑大模型，必须把所有权重一股脑全部塞进物理内存。\n如果内存装不下，交给操作系统的虚拟内存去硬盘交换，系统就会瞬间卡死。\n因为操作系统的分页机制是盲目的。\n它根本不知道神经网络在下一毫秒要算什么，频繁触发缺页中断，读盘延迟会把生成速度直接砸到每秒 0.01 个字。\n但今天的超大模型，底层架构早就变了。\n无论是万亿参数的 Kimi K3，还是 3130 亿参数的 GLM-5.3-Flash，它们都是混合专家模型。\n混合专家模型有一个决定性的物理特性：激活稀疏性。\n虽然模型总参数高达几千亿甚至上万亿，但当它处理某一个特定的词时，真正被激活的专家可能只有百分之几。\n绝大多数参数，在当下的那一瞬间根本不需要参与运算。\n看到这个特性，WARP 做了三件极其精巧的事。\n第一件，主干常驻。\n它把注意力层、基础嵌入层这些每次运算都必不可少的共享骨干，常驻在物理内存中。\n对 3130 亿参数的 GLM-5.3-Flash 来说，这个核心骨干只有 5.14GB。\n一台最普通的 8GB 笔记本，刚好能把它稳稳托住。\n第二件，前瞻路由与流式预取。\n现代苹果电脑的固态硬盘，顺序读取速度高达每秒数吉字节。\nWARP 设计了一套前瞻路由器。\n当系统正在计算第 N 层的时候，路由器就已经提前算出了下一层需要哪几个专家。\n它抢在计算发生前，把那几个特定的专家张量从固态硬盘里异步流式读出来，用完立刻释放。\n硬盘读盘与芯片计算，在时间线上被完全重叠覆盖。\n第三件，专家局部性缓存。\n如果你的电脑有 64GB 内存，剩余的空闲空间就会被自动用作动态专家缓存。\n人类的自然语言具有天然的语义局部性。\n上一个词调用了负责代码或逻辑推理的专家，接下来的一串词大概率还会继续复用它。\n只要命中了内存缓存，连读盘的步骤都被彻底省去。\n整个行业过去两年都在陷入一种硬件堆料的军备竞赛。\n大家以为要在本地跑动前沿智能，唯一的出路就是买更贵的工作站、插满大显存计算卡、或者向云端机房交高昂的接口费。\n但只要推理软件真正理解了神经网络的稀疏几何结构，显存与硬盘之间那道不可逾越的鸿沟就消失了。\n它把一个原本绝望的显存容量死结，转化成了一个优雅的固态硬盘吞吐与路由预测问题。\n技术的范式转移，往往不靠更暴力的硬件堆叠。\n它发生在有人看穿了新算法的物理本质，然后给操作系统那套几十年前的古老齿轮，重新写了一套匹配现代智能的规则。\n当几千亿参数的顶尖模型不再被锁在数据中心的机柜里，能够顺着普通背包里的固态硬盘静静流淌时，算力垄断的围墙其实已经被推开了一条缝隙。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:44","created_at":"2026-08-27 21:12:44","url":"https://mubeitech.com/p/mb-20260827-d0ae18","markdown_url":"https://mubeitech.com/p/mb-20260827-d0ae18/markdown"}]}