{"source":{"id":"mb-20260827-46d0c4","title":"从 A100 到 B200，显卡的张量计算吞吐暴涨了 7.2 倍","url":"https://mubeitech.com/p/mb-20260827-46d0c4"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260827-c46740","account":"mubei","brand":"","title":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","summary":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算","body":"训一个几千亿参数的大模型，上万张最顶级的显卡，有一大半时间根本没在算。\n算力租金按秒扣费，电表飞速打转，机房风扇震耳欲聋。\n但芯片的浮点运算单元，却在成片成片地熄火发呆。\n业界的真实数字冷冰冰摆在那里。\n哪怕是顶尖实验室，模型算力利用率通常也只有 35% 到 43%。\n剩下的六成算力，蒸发去了哪里？\n是算法写得太慢，还是代码逻辑不够优化？\n为什么在 Python 里写得整整齐齐的线性代码，扔进上万张显卡之后，会碎成一地残渣？\n这台让万亿资本买来的算力大面积瘫痪的机器，叫通信重叠与关键路径气泡。\n要看懂这台机器，先看单张显卡和集群的本质区别。\n单张显卡训练很简单：数据喂进显存，核心埋头计算。\n但千亿参数的大模型，根本塞不进任何单张显卡的显存。\n工程师必须把模型生生切碎，分摊到几千甚至上万张显卡上。\n张量并行把每一层的矩阵乘法横竖切开。\n全分片数据并行把模型参数、梯度和优化器状态彻底剥离。\n专家并行和上下文并行把海量参数和数十万字的序列切散。\n这种切分带来了一个致命代价。\n任何一张显卡想要算下一层网络，必须先等别的显卡把中间结果传过来。\n在硬件底层，显卡从来不是按代码顺序单线推进的。\n它跑在两条平行的硬件轨道上。\n一条是负责矩阵乘法的高速计算流。\n一条是负责跨卡数据搬运的通信流。\n这两条轨道在时间线上贴身肉搏。\n最理想的状态，是当前层在计算流里疯狂运转时，下一层要用的参数已经在通信流里提前搬运完毕。\n这在工程上叫计算与通信重叠。\n只要算力跑完的瞬间数据刚好到位，跨卡通信的耗时就被彻底藏在计算背后。\n但物理现实没有这么仁慈。\n跨机柜的光纤只要有一丝抖动，或者层与层之间的依赖拓扑解不开，通信就会慢上几个微秒。\n一旦计算流算完了，而通信流的数据还没送达，硬件同步机制会瞬间踩下急刹车。\n在底层的执行轨迹图上，显卡会留下一大片空白。\n工程上把这片空白叫气泡。\n只要这个气泡落在了决定整体速度的关键路径上，几万张每小时烧掉几万美元的显卡，就必须集体陪着它原地发呆。\nAI 研究者 Vlad Savinov 拆解过 PyTorch 官方分布式训练框架 torchtitan 的真实底层轨迹。\n把掩盖在代码背后的底层事件拉平在时间轴上，才能看清真相。\n算力根本不是平铺直叙的流水线，是一张充满阻塞、等待与抢跑的有向无环图。\nMeta 训练 4050 亿参数的 Llama 3.1 时，动用了 1.6 万张 H100 显卡。\n即便用尽了交错流水线调度、异步张量并行与微块切分，把能重叠的通信全部塞进计算缝隙，整体算力利用率依然被锁在 40% 左右。\n这就是为什么 AI 军备竞赛的底层法则正在发生质变。\n很多人看算力竞争，习惯盯着谁买了十万张显卡，以为算力是简单的乘法累加。\n在超大规模分布式系统里，算力遵循的是残酷的拓扑规律。\n芯片堆得越多，通信复杂度的爆炸速度就越快，时间轴上的气泡就越难被压平。\n真正拉开顶尖实验室差距的，从来不是买显卡的支票厚度。\n是在微秒级的时间轴上，把跨卡通信死死压进计算缝隙里的工程编排能力。\n谁能把通信完全藏进阴影里，谁就能用一半的芯片跑出对手两倍的速度。\n藏不住通信的，买再多显卡，也不过是在高昂的电费账单里，养了一大堆在网线面前排队发呆的昂贵发热器。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 11:28:33","created_at":"2026-08-27 11:28:33","url":"https://mubeitech.com/p/mb-20260827-c46740","markdown_url":"https://mubeitech.com/p/mb-20260827-c46740/markdown"},{"rank":2,"id":"mb-20260825-bb71f5","account":"mubei","brand":"","title":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","summary":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","body":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩。\n在开源微基准测试 KernelBench 上，AI 智能体写出来的算子不仅全部通过单元测试，还能比官方库快出两三倍。\n但只要把这些在沙盒里跑赢的算子，真正塞进一个完整的大模型推理脚本里，车祸立刻发生。\n原本在单点测试里快如闪电的代码，一进真实业务毫无起色，甚至直接引发显存溢出和隐性崩溃。\n为什么在孤立测试台上跑分的顶级算子，一进真实生产环境就失灵？\n是基准测试的题目太假，还是我们在测量代码性能的时候，从一开始就看错了物理现实？\n拆开现代 GPU 的算力黑箱，会看到一条横亘在实验室跑分和真实系统之间的冰冷断层。\n基准测试与部署断层（Benchmark-to-Deployment Gap）。\narXiv 最新发表的一篇论文（arXiv:2608.21836，已被 EMNLP 2026 主会录用），由学者 Hui Zeng 等人把这个行业痛点彻底扒开了。\n过去大家优化算子，习惯把注意力集中在单点上：把一个注意力机制、矩阵乘法或者激活函数单独抽出来，扔进一个无菌的测试台里。\n在孤立的测试台里，算子吃的是形状固定、连续规整的干净张量，缓存被预热到最佳状态，完全没有其他任务来抢资源。\n但在一个真实运转的大模型推理工作流里，根本不存在这种理想无菌的环境。\n大模型推理由两个物理特性完全不同的阶段咬合而成。\n第一个阶段是首字预填充（Prefill）。\n几十上百个提示词词元同时涌入，算力被瞬间拉满，GPU 处于计算受限状态。\n第二个阶段是逐字生成（Decode）。\n模型一个词元一个词元往外吐，每吐一个词都要去显存里读取一次庞大的键值缓存（KV Cache），GPU 瞬间切换到显存带宽受限状态。\n一个在孤立测试台上被调优到极速的算子，对这两个截然不同的动态阶段一无所知。\n它为了在单点测试里刷出高分，可能会贪婪地霸占所有的寄存器和共享显存。\n一旦回到真实的多层神经网络里，这种贪婪会直接破坏上下文的显存布局，导致相邻算子发生寄存器溢出，把整条流水线的吞吐量拖入泥潭。\n单次测试里看似微小的数值误差，在自回归生成的几百轮循环中，还会迅速滚成雪崩式的精度偏离。\n这就是孤岛微基准测试给整个行业制造的局部最优幻觉。\n单点算子没有问题。\n问题是它脱离了系统上下文。\n为了打破这道断层，研究团队提出了一个闭环优化框架 LLM4LLM。\n它不再把算子关在孤立的沙盒里调优。\n它的起点直接扎在真实的目标推理脚本里。\n接着做阶段感知拆解：在首字预填充和逐字生成两个阶段，分别抓取真实的显存压力和延迟瓶颈。\n随后由经验引导的幕式智能体探索 Triton 和 CUDA 代码空间。\n最后接入最关键的一道闭环：模型内验证（In-Model Validation）。\n每一个生成的代码补丁，不跑虚假的单点跑分，必须直接插入完整的十多层模型权重中，带上真实的键值缓存跑完端到端全流程。\n只有端到端总延迟真正下降、精度完全合规的代码，才会被系统接收。\n这套把优化拉回真实生产环境的系统，跑出了硬碰硬的实测数据。\n在 A100 和 H100 GPU 上针对 10 个主流大模型推理工作流进行测试，每一个模型的端到端延迟全部实现大幅改善。\n在 A100 上取得 3.91 倍的几何平均加速。\n在 H100 上取得 6.98 倍的几何平均加速。\n作为底层算子能力的交叉印证，在 KernelBench 第二级别测试上也同时斩获 2.745 倍的几何平均提速。\n把代码优化从无菌沙盒搬进真实的系统骨架，换来的是近 7 倍的真实性能跃迁。\n在高度复杂的现代计算堆栈里，脱离系统上下文的局部最优，往往只是测量工具给出的纸面富贵。\n一行真正高效的底层代码，从来不是孤立的数学公式。\n它是咬合在整台机器动态齿轮里的精密零件。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39","url":"https://mubeitech.com/p/mb-20260825-bb71f5","markdown_url":"https://mubeitech.com/p/mb-20260825-bb71f5/markdown"},{"rank":3,"id":"mb-20260827-a4a65d","account":"mubei","brand":"","title":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了","summary":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了","body":"70% 的年增速预期摆在面前，华尔街第一反应是 AI 周期见顶了。\n真实情况恰恰相反。\n70% 只是工厂交货的物理极限，买家开出的真实订单其实早就翻倍了。\n为什么订单多到接不完，营收指引却只能停在七成？\n算力这门狂飙突进的生意，到底在哪道关卡被死死卡住了？\n这台机器叫物理供给约束。\n过去二十年，软件和互联网的扩张规律是零边际成本。\n只要用户点击下载，机房加点带宽，服务就能无限复制。\n但实体硬件世界从来不吃这套虚拟法则。\n一套顶尖的算力集群，不仅需要晶圆制造，还需要高带宽内存堆叠、微米级先进封装、液冷机柜，以及以十万千瓦计的电网配电。\n当大模型对参数和训练算力的需求每年翻倍暴涨，下游的物理供应链根本变不出凭空落地的产线。\nNvidia 首席财务官 Colette Kress 在财报电话里挑明了底牌：客户的实际需求增速冲到了 100%，但受限于高带宽内存等产能瓶颈，公司只能给出约 70% 的交付预期。\n市场的核心矛盾变了。\n增长的上限与买家的钱包无关，死死受制于物理世界一年究竟能交付多少计算设备。\n但这还只是整台机器的表层。\n真正凶狠的飞轮藏在资产负债表里。\n很多人看不懂，为什么一家芯片巨头要掏出几百亿美元，直接砸向前沿 AI 实验室？\n投资机构 Wealth Enhancement Group 的投资主管 Doug Huber 指出了底层的青训农场逻辑。\n顶尖的 AI 实验室在诞生第一天，最稀缺的资源就是极致的算力。\n巨头把资本注入这些初创团队，换来的从来不只是一纸股权凭证。\n真正的杀招，是把自己的通信协议、网络互连架构和底层软件环境，在实验室写第一行代码时就焊死在模型架构里。\n前沿实验室就是整套算力帝国的青训营。\n一旦其中某家实验室跑通了前沿模型、迎来商业化爆发，它后续数以百亿计的算力扩张需求，没有任何改换门庭的余地，全都会原路流回给投资它的硬件母体。\n左手把资金投出去变成初创公司的股权，右手把订单收回来变成源源不断的高毛利硬件销售。\n这是一台自我造血、自我制造需求的确定性闭环。\n超大规模云厂商想靠自研芯片摆脱掌控？\n战场的维度早就变了。\n当其他人还在比拼单颗芯片的跑分高低，新的竞争已经升级为整座算力工厂的系统级交付。\n从处理器、通信网络到机柜级液冷与软件调度，全都打包成了不可拆分的整体。\n换掉一颗芯片代价很小。\n但要拆掉整座已经深度适配了底层协议的算力工厂，成本高到没人承担得起。\n决定这场科技竞逐上限的，根本不是资本市场的短期情绪。\n真正的天花板，是物理世界的工程交付速度与底层的生态锁定。\n当一家公司不仅锁死了下一代硬件的交付产能，还顺手包揽了未来所有核心买家的孵化底座。\n这场竞争，到底是在比谁的算法更聪明，还是在比谁能把物理现实更快地焊进自己的商业闭环里？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:42","created_at":"2026-08-27 22:36:42","url":"https://mubeitech.com/p/mb-20260827-a4a65d","markdown_url":"https://mubeitech.com/p/mb-20260827-a4a65d/markdown"},{"rank":4,"id":"mb-20260822-805442","account":"mubei","brand":"","title":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","summary":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","body":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度。\n开发者写完测试脚本，兴奋地把跑分数据直接发给了几位顶尖的 AI 圈内专家。\n可就在消息发出去不久，他自己抓到了致命的破绽。\n这个让他狂喜的 135 tok/s，从头到尾只是一场自建基准测试的测量幻觉。\n代码没有造假，显卡确实在全力运转，屏幕上的字符也确实在一秒内喷出上百个标记。\n为什么这个跑分数字在真实世界里毫无意义？\n自己写脚本给大模型测速，到底踩中了哪台看不见的幽灵机器？\n把这行测试代码拆开，会看到大模型推理底层最残酷的物理约束。\n低熵复制陷阱。\n在常规的大模型自回归解码中，显卡每生成一个标记，都必须把全部 27B 参数从显存里完整读取一遍。\n两张显卡做 TP2 张量并行，显存带宽直接定死了输出速度的物理天花板。\n在常规文本生成下，每秒输出三四十个标记就已经是显存吞吐的极限。\n为了打破这道显存墙，2023 年 Google 研究员 Yaniv Leviathan 提出了投机解码机制。\n像 DFlash2 这样的扩散草稿模型，会在前台一次性预猜出一整串候选标记。\n再由 Qwen3.8-27B 这样的主模型在单次前向传播中，同时并行验证这批猜测。\n只要猜对了，就能一次性接受多个标记，把显存读取次数成倍压缩。\n整套加速系统的生死线，全系在草稿标记的接受率上。\n这位开发者自己编写的测试用例，恰好选了一个重度代码编辑场景。\n在这种场景下，模型输出的绝大部分内容，都是对提示词既有代码的原样复制。\n文本的信息熵极低，语义完全被上下文锁定。\n草稿模型几乎是在明牌抄答案，标记接受率直接飙到了 90% 以上。\n135 tok/s 的狂飙，不是模型真正的生成算力。\n它只是把高命中率的低熵搬运，错当成了系统的真实性能。\n一旦把场景换成复杂的逻辑推理、全新代码生成或者开放式长文本创作。\n语义分支瞬间爆发，文本熵值急剧升高。\n草稿模型的猜测开始大面积落空，接受率断崖式跌落到 30% 以下。\n这时候，反复猜测与验证带来的额外计算开销，不仅无法加速，甚至会让生成速度比单步解码还要慢。\n这也是为什么工业级推理工程从不依赖手写的简陋测速脚本。\n自建的测试脚本往往只粗暴地记录首尾总耗时，把前缀缓存命中、提示词预填充和真正的解码生成全部搅在一起。\n而像 vLLM 和 SGLang 这样的标准基准测试套件，在底层把首字延迟 TTFT、标记间延迟 ITL、有效产出率 Goodput 以及不同熵值分布下的接受率拆得清清楚楚。\n自建跑分测出来的从来不是引擎的真实上限。\n它测出来的只是测试者自己无意识挑选的狭窄测试集。\n大模型基准测试的门槛，从来不在于写几行代码去数一秒钟跳出多少个词。\n任何忽视了任务熵值分布与计算瓶颈转移的测速，本质上都只是在特定场景里制造测量伪影。\n速度从来不是模型单方面的属性。\n它是一套推理架构与特定任务的信息复杂度，在显存带宽和算力极限之间达成的脆弱平衡。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:22","created_at":"2026-08-22 17:07:22","url":"https://mubeitech.com/p/mb-20260822-805442","markdown_url":"https://mubeitech.com/p/mb-20260822-805442/markdown"},{"rank":5,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":6,"id":"2090932881119981686","account":"mubei","brand":"@mubei","title":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。 现在呢？ xAI 联合创始人吉米·巴（Jimmy Ba）透露了一个…","summary":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。 现在呢？ xAI 联合创始人吉米·巴（Jimmy Ba）透露了一个关键细节。 他们内部每个工程师手里，正同时跑着 10 到 20 个 AI 代码代理。 软件工程的最小单位，正在发生质变。 以前写代码，基本单位是“一个人”。 一…","body":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。\n现在呢？\nxAI 联合创始人吉米·巴（Jimmy Ba）透露了一个关键细节。\n他们内部每个工程师手里，正同时跑着 10 到 20 个 AI 代码代理。\n\n软件工程的最小单位，正在发生质变。\n以前写代码，基本单位是“一个人”。\n一个人对着一块屏幕，一行一行手敲。\n吉米·巴称，现在 xAI 有 90% 的工程师都在使用 AI 代理循环。\n这让他们的日常开发交付速度直接提升了 10 倍。\n\n十多年前，他跟着机器学习先驱辛顿做研究。\n熬一整个夏天写底层算子，只为了把模型塞进单张显卡里跑起来。\n后来成功把两张显卡连通，就成了轰动行业的技术跃迁。\n而今天，xAI 已经在用 11 万张英伟达 GB200 芯片协同训练下一代模型。\n\n但比算力膨胀更剧烈的，是人机协作方式的颠覆。\n按照吉米·巴的说法，日常琐碎的开发流程已经全部自动化。\n工程师不再是单兵作战的码农，而是同时指挥 10 到 20 个代码代理的现场调度官。\n软件工程的核心能力，变成了如何驾驭一支 AI 代理军团。\n\n既然算法和数据优化让模型效率提升了 10 倍，为什么还要疯狂堆 11 万张顶级芯片？\n吉米·巴给出的答案很直接。\n既然能做出聪明 10 倍的模型，为什么不去做？\n人类组织超过三层汇报就会产生严重的信息损耗，但指挥一组代理不会。\n软件工程的度量衡，彻底从“手写代码”变成了“调度代理”。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2091260490403983806","translated_status_id":"2091260490403983806","published_at":"2026-08-22 11:23:43","created_at":"2026-08-22T12:56:55+02:00","url":"https://mubeitech.com/p/2090932881119981686","markdown_url":"https://mubeitech.com/p/2090932881119981686/markdown"}]}