{"source":{"id":"2038515317841035622","title":"都在拼命卷大模型的上下文窗口？ 谷歌核心人物 Jeff Dean 刚刚泼了一盆冷水。 盲目追求一万亿 token 的吞吐…","url":"https://mubeitech.com/p/2038515317841035622"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260822-805442","account":"mubei","brand":"","title":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","summary":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","body":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度。\n开发者写完测试脚本，兴奋地把跑分数据直接发给了几位顶尖的 AI 圈内专家。\n可就在消息发出去不久，他自己抓到了致命的破绽。\n这个让他狂喜的 135 tok/s，从头到尾只是一场自建基准测试的测量幻觉。\n代码没有造假，显卡确实在全力运转，屏幕上的字符也确实在一秒内喷出上百个标记。\n为什么这个跑分数字在真实世界里毫无意义？\n自己写脚本给大模型测速，到底踩中了哪台看不见的幽灵机器？\n把这行测试代码拆开，会看到大模型推理底层最残酷的物理约束。\n低熵复制陷阱。\n在常规的大模型自回归解码中，显卡每生成一个标记，都必须把全部 27B 参数从显存里完整读取一遍。\n两张显卡做 TP2 张量并行，显存带宽直接定死了输出速度的物理天花板。\n在常规文本生成下，每秒输出三四十个标记就已经是显存吞吐的极限。\n为了打破这道显存墙，2023 年 Google 研究员 Yaniv Leviathan 提出了投机解码机制。\n像 DFlash2 这样的扩散草稿模型，会在前台一次性预猜出一整串候选标记。\n再由 Qwen3.8-27B 这样的主模型在单次前向传播中，同时并行验证这批猜测。\n只要猜对了，就能一次性接受多个标记，把显存读取次数成倍压缩。\n整套加速系统的生死线，全系在草稿标记的接受率上。\n这位开发者自己编写的测试用例，恰好选了一个重度代码编辑场景。\n在这种场景下，模型输出的绝大部分内容，都是对提示词既有代码的原样复制。\n文本的信息熵极低，语义完全被上下文锁定。\n草稿模型几乎是在明牌抄答案，标记接受率直接飙到了 90% 以上。\n135 tok/s 的狂飙，不是模型真正的生成算力。\n它只是把高命中率的低熵搬运，错当成了系统的真实性能。\n一旦把场景换成复杂的逻辑推理、全新代码生成或者开放式长文本创作。\n语义分支瞬间爆发，文本熵值急剧升高。\n草稿模型的猜测开始大面积落空，接受率断崖式跌落到 30% 以下。\n这时候，反复猜测与验证带来的额外计算开销，不仅无法加速，甚至会让生成速度比单步解码还要慢。\n这也是为什么工业级推理工程从不依赖手写的简陋测速脚本。\n自建的测试脚本往往只粗暴地记录首尾总耗时，把前缀缓存命中、提示词预填充和真正的解码生成全部搅在一起。\n而像 vLLM 和 SGLang 这样的标准基准测试套件，在底层把首字延迟 TTFT、标记间延迟 ITL、有效产出率 Goodput 以及不同熵值分布下的接受率拆得清清楚楚。\n自建跑分测出来的从来不是引擎的真实上限。\n它测出来的只是测试者自己无意识挑选的狭窄测试集。\n大模型基准测试的门槛，从来不在于写几行代码去数一秒钟跳出多少个词。\n任何忽视了任务熵值分布与计算瓶颈转移的测速，本质上都只是在特定场景里制造测量伪影。\n速度从来不是模型单方面的属性。\n它是一套推理架构与特定任务的信息复杂度，在显存带宽和算力极限之间达成的脆弱平衡。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:22","created_at":"2026-08-22 17:07:22","url":"https://mubeitech.com/p/mb-20260822-805442","markdown_url":"https://mubeitech.com/p/mb-20260822-805442/markdown"},{"rank":2,"id":"16426914","account":"mubei","brand":"@mubei","title":"100万token的上下文窗口，听起来很唬人。 但把资料全塞进去，只会让AI变笨。 上下文窗口从来不是仓库，而是一笔注意…","summary":"100万token的上下文窗口，听起来很唬人。 但把资料全塞进去，只会让AI变笨。 上下文窗口从来不是仓库，而是一笔注意力预算。 模型不仅要记住你输入的每个词。 它还要计算这个词和之前所有词的关系。 5个词，产生10个关系。 1万个词，就是100万个注意力关系。 资料越塞越多，它…","body":"100万token的上下文窗口，听起来很唬人。\n但把资料全塞进去，只会让AI变笨。\n\n上下文窗口从来不是仓库，而是一笔注意力预算。\n模型不仅要记住你输入的每个词。\n它还要计算这个词和之前所有词的关系。\n5个词，产生10个关系。\n1万个词，就是100万个注意力关系。\n\n资料越塞越多，它的注意力就被稀释得越厉害。\n结果就是性能下滑。\n找不准信息，写出的代码变烂。\n如果你发现它开始胡说八道、产生幻觉。\n那多半是塞得太满了。\n\n在实际使用中，上下文可以划成两个区间。\n前面是“聪明区”，后面是“笨蛋区”。\n一旦跨进笨蛋区，它的智商就开始缓慢滑坡。\n\n这条分界线在哪？\n争议很大，每个模型和任务都不一样。\n但一个靠谱的经验法则是：目前大约在15万token左右。\n半年前，这个门槛还只有10万。\n技术在进步，界限还在往上爬。\n\n怎么用好它？\n遇到笨蛋区的信号，就得动手干预。\n清理聊天记录，压缩上下文。\n最好的办法是把大任务拆碎。\n开一个新的窗口，分批喂给它。\n\n少花一点token，让它永远留在聪明区。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2079540875546235219","translated_status_id":"2079540875546235219","published_at":"2026-07-21 11:38:47","created_at":"2026-07-21T13:21:09+02:00","url":"https://mubeitech.com/p/16426914","markdown_url":"https://mubeitech.com/p/16426914/markdown"},{"rank":3,"id":"2045484064585728489","account":"mubei","brand":"@mubei","title":"Andrej Karpathy揭开了一个反直觉的行业真相。 现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。…","summary":"Andrej Karpathy揭开了一个反直觉的行业真相。 现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。 撑大体积的罪魁祸首，是劣质的训练数据。 你以为模型每天在贪婪地阅读《华尔街日报》和严谨的学术文章？ 现实极其惨淡。 前沿实验室随机抽查的预训练语料，全是残破的…","body":"Andrej Karpathy揭开了一个反直觉的行业真相。\n现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。\n撑大体积的罪魁祸首，是劣质的训练数据。\n\n你以为模型每天在贪婪地阅读《华尔街日报》和严谨的学术文章？\n现实极其惨淡。\n前沿实验室随机抽查的预训练语料，全是残破的HTML代码、股票代码和杂乱无章的乱码。\n人类积累的高质量文本在互联网海洋里极其稀缺。\n\n巨大的信息噪音带来了灾难性的压缩效率。\nLlama 3对训练数据的压缩率低到只有0.07比特每token。\n这意味着模型对自己啃过的大部分内容，仅仅留存了极度模糊的印象。\n庞大的万亿参数，绝大部分并没有参与“认知推理”。\n它们变成了臃肿的记忆库，被迫死记硬背互联网倾泻而下的赛博垃圾。\n\nKarpathy开出的解法极其干脆。\n彻底分离思考与记忆。\n剥离百科全书式的死记硬背，只留下纯粹负责推理和解题的算法逻辑。\n这就是真正的“认知核心”。\n一旦遇到事实盲区，让模型主动去调用外部数据库。\n\n如果只喂极其干净的高质量数据，这个“认知核心”需要多大体积？\n十亿参数。\n回看今天的主流旗舰模型，参数规模在2000亿到1.8万亿之间摇摆。\n超高比例的算力都在替数据的脏乱差买单。\n\n现实数据正在印证这条新路径。\n仅仅两千亿参数的GPT-4o，早就全方位碾压了1.8万亿参数的初代GPT-4。\n过去两年间，跑通GPT-3.5性能的推理成本暴降了足足280倍。\n推动这一切的核心引擎，全部来自更小、更干净、更精巧的模型架构。\n\n当前挡在AI面前的那堵墙，早就不是算力。\n算力匮乏不过是替低劣数据背锅的挡箭牌。\n下一轮大洗牌的唯一筹码是高纯度的数据源。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2045726431263515003","translated_status_id":"2045726431263515003","published_at":"2026-04-19 04:36:24","created_at":"2026-04-19T06:31:10.029346","url":"https://mubeitech.com/p/2045484064585728489","markdown_url":"https://mubeitech.com/p/2045484064585728489/markdown"},{"rank":4,"id":"2068767074663690502","account":"mubei","brand":"@mubei","title":"“模型，已经不再是产品了。” 说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexi…","summary":"“模型，已经不再是产品了。” 说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexity 的老板 Aravind Srinivas。 按理说，最希望“模型就是产品”的，应该是这些头部大模型厂商。 但现在，大家都回过神来了。 如果你只是个转售大模…","body":"“模型，已经不再是产品了。”\n\n说这话的，是 OpenAI 的联合创始人 Greg Brockman，和 Perplexity 的老板 Aravind Srinivas。\n按理说，最希望“模型就是产品”的，应该是这些头部大模型厂商。\n但现在，大家都回过神来了。\n如果你只是个转售大模型 Token 的二道贩子，你根本没有壁垒，因为模型终究会沦为便宜的“大宗商品”。\n\n现在真正的产品，叫“编排系统”（Orchestration System）。\n说白了，就是把一个大模型，装进一套“智能体马鞍”（Agent Harness）里。\n\n什么是 Agent Harness？\n\n就是一套运转规则。\n决定这个智能体怎么跑循环、怎么拆解任务、什么时候调用工具、什么时候召唤子智能体。\n光有聪明的脑子（模型）没用，你得有手、有脚、有工作流，才能把脑力变现。\n\n这里面，还藏着一个杀手级的行业竞争差。\n为什么独立编排系统（比如 Perplexity）能跟大厂抗衡？\n因为门户之见。\n你绝不可能在 Anthropic 的 Claude Code 里，看到 OpenAI 的 GPT-5；\n你也绝不可能在 OpenAI 的产品里，调用 Claude 3.5。\n但第三方的编排系统可以。\n它可以在不同的任务节点，调用最合适、最便宜的模型，把效率压榨到极致。\n\n所以，未来的 AI 竞争，拼的是一个终极指标：\nToken Value Per Watt Per User（单用户、单瓦特功耗下，所产出的 Token 价值）。\n\n算力的底层是电力，电力是不可逾越的物理限制。\n谁能用最少的电，帮用户跑出最值钱的输出，谁就握着终极定价权。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2068992951938585041","translated_status_id":"2068992951938585041","published_at":"2026-06-22 09:11:51","created_at":"2026-06-22T11:10:45.506141","url":"https://mubeitech.com/p/2068767074663690502","markdown_url":"https://mubeitech.com/p/2068767074663690502/markdown"},{"rank":5,"id":"2078442192457420892","account":"mubei","brand":"@mubei","title":"未来的AI护城河可能不在模型。 能让几十亿人天天用、还不会崩溃的底层基础设施，才是关键。 谷歌DeepMind首席执行官…","summary":"未来的AI护城河可能不在模型。 能让几十亿人天天用、还不会崩溃的底层基础设施，才是关键。 谷歌DeepMind首席执行官德米斯（Demis Hassabis）透露，过去一年谷歌在底层干了个大工程。 现在大多数公司搞AI，走的是省事路线。 给以前的旧软件，硬套上一个智能体（Agen…","body":"未来的AI护城河可能不在模型。\n能让几十亿人天天用、还不会崩溃的底层基础设施，才是关键。\n\n谷歌DeepMind首席执行官德米斯（Demis Hassabis）透露，过去一年谷歌在底层干了个大工程。\n现在大多数公司搞AI，走的是省事路线。\n给以前的旧软件，硬套上一个智能体（Agent）的外壳。\n但这种办法，根本接不住几十亿用户的日常并发。\n\n谷歌的做法直接得多。\n他们把整个底层技术栈掀了，从头重写。\n逻辑演进很清晰：AI优先，模型优先，到现在全面转向“智能体优先”。\n这跟传统软件开发的逻辑完全不一样。\n\n为什么要费这么大劲？\n因为谷歌每天要以闪电般的速度，服务几十亿用户。\n在这么庞大的运转体系里，只要底层没理顺，强加新功能系统就会崩。\n现在底层打通了。\nAI模型的各种新能力，就能像水一样快速流进谷歌的各种产品里。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2078467707788239346","translated_status_id":"2078467707788239346","published_at":"2026-07-18 12:33:58","created_at":"2026-07-18T14:25:27.117471","url":"https://mubeitech.com/p/2078442192457420892","markdown_url":"https://mubeitech.com/p/2078442192457420892/markdown"},{"rank":6,"id":"2047310540113076683","account":"mubei","brand":"@mubei","title":"谷歌一口气点亮了 96 万张 Rubin GPU 的跨站点集群。 AI 算力牌桌上的筹码规模被强行拉升。 先盘点一下对手…","summary":"谷歌一口气点亮了 96 万张 Rubin GPU 的跨站点集群。 AI 算力牌桌上的筹码规模被强行拉升。 先盘点一下对手的家底。 马斯克的 xAI Colossus 1 跑着 20 万张卡。 正在孟菲斯建的 Colossus 2 规划了 55.5 万张。 微软的星际之门项目是 4…","body":"谷歌一口气点亮了 96 万张 Rubin GPU 的跨站点集群。\nAI 算力牌桌上的筹码规模被强行拉升。\n\n先盘点一下对手的家底。\n马斯克的 xAI Colossus 1 跑着 20 万张卡。\n正在孟菲斯建的 Colossus 2 规划了 55.5 万张。\n微软的星际之门项目是 40 万张 GB200。\n谷歌直接把天花板捅穿，96 万张的规模是星际之门的两倍多。\n\n不仅堆数量，单卡性能也是断层碾压。\n曾经让全行业抢破头的 H100 只有 2 PF 算力。\n主流的 B200 提到了 9 PF。\n而谷歌这批 R100 算力狂飙到 50 PF，显存高达 288GB。\n一张卡顶过去 25 张。\n\n把 96 万张 50 PF 的计算怪兽连在一起。\n算法层面的小修小补已经失去意义。\n算力霸权只能靠绝对的暴力来建立。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2047419321966559339","translated_status_id":"2047419321966559339","published_at":"2026-04-23 20:44:07","created_at":"2026-04-23T22:43:05.824064","url":"https://mubeitech.com/p/2047310540113076683","markdown_url":"https://mubeitech.com/p/2047310540113076683/markdown"}]}