{"source":{"id":"2076507528842682669","title":"AI订阅额度从来不是一个固定水桶。 蒂博在X上给Codex和ChatGPT工作版用户解释了一轮额度争议。 第一句先定调：…","url":"https://mubeitech.com/p/2076507528842682669"},"method":"semantic-similarity","count":2,"items":[{"rank":1,"id":"mb-20260822-805442","account":"mubei","brand":"","title":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","summary":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","body":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度。\n开发者写完测试脚本，兴奋地把跑分数据直接发给了几位顶尖的 AI 圈内专家。\n可就在消息发出去不久，他自己抓到了致命的破绽。\n这个让他狂喜的 135 tok/s，从头到尾只是一场自建基准测试的测量幻觉。\n代码没有造假，显卡确实在全力运转，屏幕上的字符也确实在一秒内喷出上百个标记。\n为什么这个跑分数字在真实世界里毫无意义？\n自己写脚本给大模型测速，到底踩中了哪台看不见的幽灵机器？\n把这行测试代码拆开，会看到大模型推理底层最残酷的物理约束。\n低熵复制陷阱。\n在常规的大模型自回归解码中，显卡每生成一个标记，都必须把全部 27B 参数从显存里完整读取一遍。\n两张显卡做 TP2 张量并行，显存带宽直接定死了输出速度的物理天花板。\n在常规文本生成下，每秒输出三四十个标记就已经是显存吞吐的极限。\n为了打破这道显存墙，2023 年 Google 研究员 Yaniv Leviathan 提出了投机解码机制。\n像 DFlash2 这样的扩散草稿模型，会在前台一次性预猜出一整串候选标记。\n再由 Qwen3.8-27B 这样的主模型在单次前向传播中，同时并行验证这批猜测。\n只要猜对了，就能一次性接受多个标记，把显存读取次数成倍压缩。\n整套加速系统的生死线，全系在草稿标记的接受率上。\n这位开发者自己编写的测试用例，恰好选了一个重度代码编辑场景。\n在这种场景下，模型输出的绝大部分内容，都是对提示词既有代码的原样复制。\n文本的信息熵极低，语义完全被上下文锁定。\n草稿模型几乎是在明牌抄答案，标记接受率直接飙到了 90% 以上。\n135 tok/s 的狂飙，不是模型真正的生成算力。\n它只是把高命中率的低熵搬运，错当成了系统的真实性能。\n一旦把场景换成复杂的逻辑推理、全新代码生成或者开放式长文本创作。\n语义分支瞬间爆发，文本熵值急剧升高。\n草稿模型的猜测开始大面积落空，接受率断崖式跌落到 30% 以下。\n这时候，反复猜测与验证带来的额外计算开销，不仅无法加速，甚至会让生成速度比单步解码还要慢。\n这也是为什么工业级推理工程从不依赖手写的简陋测速脚本。\n自建的测试脚本往往只粗暴地记录首尾总耗时，把前缀缓存命中、提示词预填充和真正的解码生成全部搅在一起。\n而像 vLLM 和 SGLang 这样的标准基准测试套件，在底层把首字延迟 TTFT、标记间延迟 ITL、有效产出率 Goodput 以及不同熵值分布下的接受率拆得清清楚楚。\n自建跑分测出来的从来不是引擎的真实上限。\n它测出来的只是测试者自己无意识挑选的狭窄测试集。\n大模型基准测试的门槛，从来不在于写几行代码去数一秒钟跳出多少个词。\n任何忽视了任务熵值分布与计算瓶颈转移的测速，本质上都只是在特定场景里制造测量伪影。\n速度从来不是模型单方面的属性。\n它是一套推理架构与特定任务的信息复杂度，在显存带宽和算力极限之间达成的脆弱平衡。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:22","created_at":"2026-08-22 17:07:22","url":"https://mubeitech.com/p/mb-20260822-805442","markdown_url":"https://mubeitech.com/p/mb-20260822-805442/markdown"},{"rank":2,"id":"mb-20260825-7b5442","account":"mubei","brand":"","title":"很多人做垂类大模型，都有一个美好的设想","summary":"很多人做垂类大模型，都有一个美好的设想","body":"很多人做垂类大模型，都有一个美好的设想。\n既然几百亿参数的模型在云端运行太贵、延迟太高。\n那就通过剪枝和蒸馏，把它压缩成几十亿参数的端侧小模型。\n只要在训练时疯狂给它喂量化金融、医疗或者法律的专业数据。\n不就能用极低的算力成本，换来一个垂直领域的专家？\n但为什么很多在测试集上跑分极高的小模型，一放到真实业务里就漏洞百出？\n甚至在遇到复杂环境时，会频繁产生低级的逻辑幻觉？\n当我们把一个庞大的神经网络向下压缩时，它最先丢掉的到底是什么？\n2026 年 8 月，arXiv 上的一篇新论文把这个暗坑的底牌彻底翻了出来。\n来自 NVIDIA 的研究学者 Lavinia Ghita、Dhruv Desai 和 Ioana Boier，给领域特定的大模型蒸馏推导出了一套全新的缩放定律。\n他们用 50 万条金融新闻构成的 FinHeadlineMix 数据集作为实验场景。\n对比了迭代结构化剪枝下的 Logit 蒸馏与 LoRA 蒸馏。\n实验抓到了一个反常识的物理现象。\n在模型被压缩的过程中，垂直领域的专业任务能力并没有断崖下跌。\n它表现出平缓、可预测的线性衰减。\n真正率先发生雪崩式坍塌的，是模型的通用常识基准。\n通识能力的断崖，远在领域能力衰减之前就早已发生。\n这直接戳破了过去垂直小模型的经验主义幻觉。\n很多人以为通用知识是冗余的边角料，删掉也无伤大雅。\n现实是，任何垂直领域的深度推演，底层全靠通识逻辑和因果表征在支撑。\n通识一旦提前崩塌，小模型立刻退化成一个只能在固定题库里死记硬背的偏科生。\n它表面上跑分漂亮，实质上已经失去了跨情境理解和复杂推理的能力。\n这台让压缩模型失控的机器，核心卡点在监督格式上。\n传统的蒸馏方式只对齐最终输出的概率分布，让 KL 散度在长推理链条上剧烈震荡。\n剪枝的剪刀切下去，最先切断的就是高维空间里复杂的推理网络。\nNVIDIA 团队给出的破局解法，叫混合思维链监督损失。\n它没有停留在强迫小模型模仿大模型的最终答案。\n它把大模型在得出结论前一步一步的推理痕迹，完整蒸馏给小模型。\n思维链在这个时候，变成了一套不可替代的认知支架。\n它在参数被剪掉的同时，把原本会被抹杀的通识逻辑结构，硬生生重新焊接回了神经网络里。\n决定垂直模型上限的，从不取决于背诵了多少专业术语。\n取决于底层支撑逻辑推演的通识结构，到底保留了多少。\n绕开推理轨迹去谈模型压缩，做出来的终究只是一台脆弱的过拟合玩具。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:40","created_at":"2026-08-25 12:04:40","url":"https://mubeitech.com/p/mb-20260825-7b5442","markdown_url":"https://mubeitech.com/p/mb-20260825-7b5442/markdown"}]}