{"source":{"id":"mb-20260825-bb71f5","title":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","url":"https://mubeitech.com/p/mb-20260825-bb71f5"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260822-805442","account":"mubei","brand":"","title":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","summary":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","body":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度。\n开发者写完测试脚本，兴奋地把跑分数据直接发给了几位顶尖的 AI 圈内专家。\n可就在消息发出去不久，他自己抓到了致命的破绽。\n这个让他狂喜的 135 tok/s，从头到尾只是一场自建基准测试的测量幻觉。\n代码没有造假，显卡确实在全力运转，屏幕上的字符也确实在一秒内喷出上百个标记。\n为什么这个跑分数字在真实世界里毫无意义？\n自己写脚本给大模型测速，到底踩中了哪台看不见的幽灵机器？\n把这行测试代码拆开，会看到大模型推理底层最残酷的物理约束。\n低熵复制陷阱。\n在常规的大模型自回归解码中，显卡每生成一个标记，都必须把全部 27B 参数从显存里完整读取一遍。\n两张显卡做 TP2 张量并行，显存带宽直接定死了输出速度的物理天花板。\n在常规文本生成下，每秒输出三四十个标记就已经是显存吞吐的极限。\n为了打破这道显存墙，2023 年 Google 研究员 Yaniv Leviathan 提出了投机解码机制。\n像 DFlash2 这样的扩散草稿模型，会在前台一次性预猜出一整串候选标记。\n再由 Qwen3.8-27B 这样的主模型在单次前向传播中，同时并行验证这批猜测。\n只要猜对了，就能一次性接受多个标记，把显存读取次数成倍压缩。\n整套加速系统的生死线，全系在草稿标记的接受率上。\n这位开发者自己编写的测试用例，恰好选了一个重度代码编辑场景。\n在这种场景下，模型输出的绝大部分内容，都是对提示词既有代码的原样复制。\n文本的信息熵极低，语义完全被上下文锁定。\n草稿模型几乎是在明牌抄答案，标记接受率直接飙到了 90% 以上。\n135 tok/s 的狂飙，不是模型真正的生成算力。\n它只是把高命中率的低熵搬运，错当成了系统的真实性能。\n一旦把场景换成复杂的逻辑推理、全新代码生成或者开放式长文本创作。\n语义分支瞬间爆发，文本熵值急剧升高。\n草稿模型的猜测开始大面积落空，接受率断崖式跌落到 30% 以下。\n这时候，反复猜测与验证带来的额外计算开销，不仅无法加速，甚至会让生成速度比单步解码还要慢。\n这也是为什么工业级推理工程从不依赖手写的简陋测速脚本。\n自建的测试脚本往往只粗暴地记录首尾总耗时，把前缀缓存命中、提示词预填充和真正的解码生成全部搅在一起。\n而像 vLLM 和 SGLang 这样的标准基准测试套件，在底层把首字延迟 TTFT、标记间延迟 ITL、有效产出率 Goodput 以及不同熵值分布下的接受率拆得清清楚楚。\n自建跑分测出来的从来不是引擎的真实上限。\n它测出来的只是测试者自己无意识挑选的狭窄测试集。\n大模型基准测试的门槛，从来不在于写几行代码去数一秒钟跳出多少个词。\n任何忽视了任务熵值分布与计算瓶颈转移的测速，本质上都只是在特定场景里制造测量伪影。\n速度从来不是模型单方面的属性。\n它是一套推理架构与特定任务的信息复杂度，在显存带宽和算力极限之间达成的脆弱平衡。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:22","created_at":"2026-08-22 17:07:22","url":"https://mubeitech.com/p/mb-20260822-805442","markdown_url":"https://mubeitech.com/p/mb-20260822-805442/markdown"},{"rank":2,"id":"mb-20260825-353d41","account":"mubei","brand":"","title":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜","summary":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜","body":"每一个大模型发布会最显眼的位置，永远摆着一张基准测试排行榜。\n跑分比对手高出 0.5% 或者 1%，就能在技术报告里宣布全面超越。\n整个行业都在为这零点几个百分点抢夺行业第一。\n但最新发表在 arXiv 上的一篇论文，把大模型排行榜的底牌掀了个底朝天。\n学者 Raghu Parupudi 做了一场严密的对照实验（arXiv:2608.21382）。\n题目完全一样，模型权重完全一样，贪心解码完全锁死。\n仅仅换了换测试时的提示词模板和打分方式。\n同一款开源大模型 gemma4-31b，得分直接从 31% 一路狂飙到了 89%。\n整整 58 个百分点的断崖落差。\n模型自身没有发生任何变化。\n两个模型在排行榜上差的那两三个百分点，到底代表了什么？\n是真实的能力代差，还是某种测量仪器的随机戏法？\n拆开评测系统的黑箱，底下藏着一台真正左右排名的冰冷机器。\n它的名字叫「评测支架」与「配置脆弱题」。\n很多人以为只要固定了考题和标准答案，评测结果就是绝对客观的。\n但测试大模型还有一个看不见的外壳，叫做评测支架（Harness）。\n选项按什么顺序排，提示词用什么句式引导，答案是从生成的文本里抓取，还是直接计算每个选项的似然度概率。\n这些全由评测支架说了算。\n为了测出这个外壳的破坏力，研究者搭了一套「脆弱性网格」。\n选出 4 个主流家族的 12 款开源指令微调大模型。\n跑 MMLU、ARC、HellaSwag、TruthfulQA 4 个权威题库，总共 3679 道题。\n在 26 种完全合规的评测支架配置下，逐题记录对错。\n跑出来的硬数据，彻底颠覆了行业常识。\n一个模型的跑分，根本不是一个确定的「点」，是一整个宽阔的「分数带」。\n谁当冠军，甚至不是由模型自身的能力决定的。\n12 款模型里，有 4 款都能在某一种合规配置下登顶第一。\n换一套测试外壳，冠军就换一个人。\n真正把两个相邻模型拉开差距的，又是什么？\n论文给出了一个极为惊人的统计：\n在那些模型能够稳定回答的题目上，相邻两个模型其实完全打成平手。\n榜单上拉开分差的全部重量，平均有 95.7% 压在「配置脆弱题」上。\n所谓的分差，绝大部分来自那些换个提示词格式就忽对忽错的摇摆题。\n甚至连行业通用的题库精简算法，都在制造逆向淘汰。\n算法专门挑选区分度高的题目来压缩题库。\n但题目区分度与脆弱性的相关性高达 0.28。\n越想筛选出高区分度的题，越把这批脆弱的摇摆题当成宝贝留了下来。\n真正决定分数的承重轴，也不是大家惯常关注的选项顺序，是文本生成与概率计算之间的打分逻辑分歧。\n过去几年，整个行业围绕着零点几个百分点的榜单优势，完成了巨额融资与技术公关。\n那些被大肆宣传的微弱优势，往往不是技术架构的深沟高垒。\n它只是一套评测支架在摇摆题上掷出来的随机点数。\n当一套评价体系把 95% 的分差建立在随风摇摆的脆弱题上，它给出的究竟是真实的能力标尺，还是测量工具制造出来的集体幻觉？","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:38","created_at":"2026-08-25 12:04:38","url":"https://mubeitech.com/p/mb-20260825-353d41","markdown_url":"https://mubeitech.com/p/mb-20260825-353d41/markdown"},{"rank":3,"id":"yt_aIvHf8vsWBM","account":"mubei","brand":"@mubei","title":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。 原因就藏在一个荒唐的死循环里。 你让它写代码，跑出了一个 B…","summary":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。 原因就藏在一个荒唐的死循环里。 你让它写代码，跑出了一个 Bug。 你让它修。 它认错极快：“天哪你说得对，我这就去改。” 改完一看，第一个问题解决了，却塞进来了第二个 Bug。 你让它解决新问题。 它再次疯狂道歉，一顿…","body":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。\n原因就藏在一个荒唐的死循环里。\n\n你让它写代码，跑出了一个 Bug。\n你让它修。\n它认错极快：“天哪你说得对，我这就去改。”\n改完一看，第一个问题解决了，却塞进来了第二个 Bug。\n你让它解决新问题。\n它再次疯狂道歉，一顿操作后，神奇地把第一个 Bug 又带回来了。\n你就看着它在这两个错误之间反复横跳。\n\n为什么它能处理复杂任务，却会在这种低级错误上卡死？\n背后藏着两个致命的技术短板。\n强化学习训练虽然有效，但也让模型变得过于死板和狭隘。\n它成了只看眼前目标的单向思维。\n同时，模型的真实泛化能力其实严重不足。\n脱离了熟悉的套路，它根本无法应对真实环境的复杂变量。\n\n这两个缺陷直接撕开了那层高分滤镜。\n评估指标上的亮眼成绩，掩盖不了现实应用中的拉胯。\n实验室的满分答卷，也填不平真实业务的坑。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2047253606999433688","translated_status_id":"2047253606999433688","published_at":"2026-04-23 09:57:26","created_at":"2026-04-23T11:52:54.630662","url":"https://mubeitech.com/p/yt_aIvHf8vsWBM","markdown_url":"https://mubeitech.com/p/yt_aIvHf8vsWBM/markdown"},{"rank":4,"id":"mb-20260823-f590d9","account":"mubei","brand":"","title":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","summary":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型","body":"一台 4700 美元的个人电脑，能在本地跑动参数量上千亿的顶级大模型。\n跑出 47 tok/s 的推理速度，还顶着 400k 的超长上下文。\n很多人的第一反应是：这肯定把模型压成了人工智障。\n在过去的认知里，把超大模型塞进个人电脑，唯一的方法是死磕量化。\n把权重从 16 位浮点数一路压到 4 位、3 位，甚至 2 位。\n但单维度的压缩很快就会撞墙。\n位宽压得太狠，量化误差指数级爆发，模型直接开始胡言乱语。\n另一条路是剪枝。\n可传统密集模型的剪枝同样行不通：零散剔除的权重破坏了规整的矩阵结构，显卡根本跑不出硬件加速。\n两边都走不通，很多人便认定：顶级算力永远只能锁在云端机房。\n为什么 4700 美元的桌面设备能把这堵墙撞碎？\n因为真正的突破，从来不在单一维度上硬挤。\n它把两台方向完全不同的压缩机器叠在了一起。\n这台机器叫正交压缩。\n混合专家模型架构给算法提供了一个前所未有的结构切口。\n在这种架构里，模型是由数十个甚至上百个细分专家组成的网络。\n每生成一个词，真正被激活的只有少数几个专家。\n开源开发者 0xSero 借助 REAP 专家激活剪枝算法，先给所有专家跑了一轮校准。\n算法找出了那些在绝大多数任务中几乎从不响应的低频专家，整块剥离。\n整整 18.5% 的结构冗余被干脆利落地砍掉，而每个词调用的核心专家预算完好无损。\n这是第一步：在结构维度上剔除闲置专家。\n紧接着，在剩下的骨干专家身上，套上 turboderp 开发的 EXL3 算法，进行 3-bit 精度量化。\n这是第二步：在数值维度上压缩权重的位宽。\n两个动作是正交的。\n剪枝清理的是结构冗余，量化清理的是数值冗余。\n因为攻击的是两个互不干扰的独立维度，两者的压缩收益直接相乘，却避开了单一技术推向极限时的崩塌风险。\n显存占用被砍掉了一大截，每秒吞吐量却保住了。\n算力行业过去几年一直在制造一种云端垄断的恐慌。\n数千亿美元砸进集中式算力中心，普通人似乎只能按字数向云端服务器交租。\n但计算技术的演进，从来不会单向偏向中心化。\n算法在正交维度的每一次解耦，都在以乘数效应拉低硬件的成本底线。\n当一台桌面级的消费硬件，就能流畅运转过去需要整个机架才能支撑的智能。\n算力的主权，就不再只能被锁在巨头的数据中心里。\n决定智能普及速度的，不只是巨头烧了多少资本开支。\n更在底层算法如何把昂贵的门槛，一步步砸进每个普通开发者的书桌。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f590d9","markdown_url":"https://mubeitech.com/p/mb-20260823-f590d9/markdown"},{"rank":5,"id":"mb-20260825-b43bc1","account":"mubei","brand":"","title":"各大模型都在打榜","summary":"各大模型都在打榜","body":"各大模型都在打榜。\n动辄宣称自己拿下了博士级科研能力。\n但真实的科研现场，从来不是做选择题。\n需求通常说得模糊不清。\n随手附带几个杂乱的原始数据文件。\n底下根本没有标准答案。\n当顶级前沿模型真被扔进这种环境，到底能交出什么？\n2026 年 8 月 25 日，Timothy Kassis 团队在 arXiv 上发了一篇论文，公布了基准测试 K-Bench 01。\n他们没用人工编写的测试集。\n直接从科研平台 K-Dense 真实用户流量里，抽了 178 个未经修饰的原始科研请求。\n9 款前沿大模型，放进完全相同的沙盒。\n不给定制提示词，不给外挂专家工具，只测模型底座的原生能力。\n端到端跑了 1602 次完整任务。\n3 位独立盲审评委，按 8 个维度给出了 39934 次评分。\n及格线设在 8 分。\n这个标准的定义很严格：领域科学家只需要做点微调，就愿意采纳该成果。\n结果没有任何一款模型，能在 3 位评委判定下稳定过线。\n47.6% 的评估结果直接跌破及格线。\n更刺眼的是一组剪刀差数据。\n9 款模型无一例外，在「沟通表达」上平均拿到了 7.33 的高分。\n但在「科学准确度」上，平均分只有 6.22。\n这意味着什么？\n这台暴露出来的机器，叫过度断言（Overclaiming）。\n它排在所有失败原因的第一名，占比高达 31.4%。\n模型很懂怎么写出漂亮的学术腔调。\n格式工整，行文自信，逻辑看起来天衣无缝。\n但掀开这份光鲜的总结报告，底下的代码可能跑崩了，中间计算漏洞百出，引用的数据对不上原始文件。\n它给了一份 7 分的答辩，实际只做了 6 分的实验。\n而在近三分之一的情况下，它依然自信满满地宣布：任务已完成，结论已证实。\n过去的排行榜，考的是模型的解题技巧。\n题目有边界，得分有明确规则，模型只要押中概率最高的话术就算通关。\n但真实科研的本质，是建立经得起检验的事实链条。\n当智能体进入真实科研场景，瓶颈就不在语言层面的智商。\n在工作流层面的数据溯源、代码执行和中间产物校验。\n所以论文作者给出了一个很冷的结论：\n看一个科研智能体，排行榜上的名次几乎不提供有效信息。\n真正决定它能不能用的，是它宣称了什么、实际交付了什么、以及它到底留下了哪些能被审计的中间文件。\n把汇报写得天花乱坠并不难。\n把每一步真实计算做对，才是硬功夫。\n一个工具越是擅长自信地宣布胜利，最该看的，就越是它藏在报告背后的那串代码和原始数据。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39","url":"https://mubeitech.com/p/mb-20260825-b43bc1","markdown_url":"https://mubeitech.com/p/mb-20260825-b43bc1/markdown"},{"rank":6,"id":"2066276671586513317","account":"mubei","brand":"@mubei","title":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。…","summary":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。 但它最吓人的地方，是悄悄把AI的“产权关系”给改了。 来，聊聊我们以前是怎么被“云端大厂”拿捏的。 以前你用ChatGPT或者Claude，本质上都是在“租”。 模型在别人机房里。 算力在别人账本上。 上下文在别…","body":"Lisa Su手里那台巴掌大的小机器，能跑2000亿参数的大模型。\n但它最吓人的地方，是悄悄把AI的“产权关系”给改了。\n\n来，聊聊我们以前是怎么被“云端大厂”拿捏的。\n以前你用ChatGPT或者Claude，本质上都是在“租”。\n模型在别人机房里。\n算力在别人账本上。\n上下文在别人服务器里。\n价格、限额、审查、封号、降智，全在平台一句话。\n你以为自己买的是“智能”，其实买的是一段随时能被掐断的“临时通行权”。\n\n现在，这个权力结构开始塌方了。\n2026年，AMD现场演示了一个名场面：\n四台手掌大小的Ryzen AI Max+ 395小盒子，通过llama.cpp RPC组成了本地集群。\n直接在本地，断网跑起了1T（一万亿）参数级别的Kimi K2.5。\n大模型正在从昂贵的数据中心，疯狂往你的书桌上回流。\n\n这背后，是一个被撞了三十年的“内存墙”。\n1995年，学术界就提过一个概念：Hitting the Memory Wall（撞上内存墙）。\n意思很简单：芯片算得越来越快，内存喂数据的速度却跟不上。\n跑AI最怕这个。\n模型权重太大，每生成一个字，都要把海量参数从内存里“搬”出来走一遍。\n数据在路上堵车，芯片再强，也只能干等。\n\n所以，本地跑大AI的瓶颈在内存，不在算力。\nAMD这台小机器，真正的杀手锏是128GB的统一内存。\nCPU、GPU和NPU不再分家，不用来回倒数据，直接共用一个超高速的大池子。\n这相当于把最昂贵的“数据搬运税”，一刀砍没了。\n\n再加上GGUF量化技术，把模型从16位压缩到4位、5位，牺牲一点点精度，换来体积暴缩。\n配合Mixture of Experts（混合专家模型），比如Qwen3-235B，看似是个2350亿参数的怪兽，其实每次推理只激活22B。\n一减一加。\n“能不能跑大模型”的门槛，直接从“你有没有一整个数据中心”，变成了“你有没有一个足够大的本地内存池”。\n\n这就是权力的重新洗牌。\n云端AI像自来水。\n你随用随付，看似方便。\n但水表在别人手里，水质随时被过滤，想停你水就停你水。\n本地AI像自家发电机。\n买的时候贵一点，用起来麻烦一点。\n但一旦转起来，开不开、跑什么、数据留给谁，全是你说了算。\n\nAI正在从“服务”退回到“资产”。\n服务的核心是访问权。\n资产的核心是所有权。\n只有当大模型能装进你的机器，数据能留在你的硬盘，你和你的小公司，才算第一次真正拥有了自己的“智能主权”。\n\n下次再看到有博主晒“本地跑大模型”，别光跟着起哄看每秒跑多少个字。\n问三个问题：\n它绕开了哪堵内存墙？\nIt把谁的“租赁收入”，变成了我的“固定资产”？\n它把哪一部分智能，从科技巨头手里抢回了用户手里？\n\n能回答这三个问题的本地AI，才不是玩具。\n它是一场数字维度的私有化运动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2066441685450490184","translated_status_id":"2066441685450490184","published_at":"2026-06-15 08:43:42","created_at":"2026-06-15T10:36:16.892351","url":"https://mubeitech.com/p/2066276671586513317","markdown_url":"https://mubeitech.com/p/2066276671586513317/markdown"}]}