{"source":{"id":"mb-20260826-dd5418","title":"ChatGPT 拥有超过 10 亿月度活跃用户","url":"https://mubeitech.com/p/mb-20260826-dd5418"},"method":"semantic-similarity","count":5,"items":[{"rank":1,"id":"mb-20260825-d5bcd5","account":"mubei","brand":"","title":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水","summary":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水","body":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水。\n这位公认的强化学习之父直言：大语言模型充其量只展现了四分之一的智能。\n当整个硅谷都在疯狂烧钱买算力、用合成数据给模型填坑的时候，\n萨顿认为头部实验室已经集体陷入了局部最优。\n2019 年写下《苦涩的教训》、教会所有人用通用算力碾压规则的祖师爷，\n为什么会在大模型最辉煌的时刻泼出这盆冷水？\n大模型漏掉的那大半心智，到底卡在了哪里？\n萨顿把矛头指向了一个被行业刻意绕开的底层命题。\n大世界假说。\n真实世界的复杂度与动态变化，永远呈指数级大于任何模型参数，也大于任何人工建造的模拟器。\n智能体永远无法把整个世界一次性装进肚子里。\n如今主流 AI 走的是一条两阶段的截流路线：\n先抓取互联网上的所有公开历史数据，花数亿美元做一次性离线预训练。\n随后把几千亿参数的权重彻底冻结，打包交付。\n这种模型没有此时此刻的环境感知，没有与物理世界的实时博弈。\n它是一座博学的静态历史档案馆，对下一秒发生的新变量毫无招架之力。\n当人类存量文本被消耗殆尽，巨头们转头用模型自产的合成数据来训练下一代模型。\n在大世界假说面前，这无异于一种封闭系统里的近亲繁殖。\n一个有限参数的容器，无论怎么自我演练，也无法凭空生成真实世界源源不断的未知熵增。\n既然离线冷冻有天花板，为什么各大实验室不让大模型在现实交互中持续更新权重？\n因为深度学习底层埋着一道几十年来没人跨过去的暗礁。\n可塑性丧失。\n2024 年 8 月，萨顿团队在《自然》（Nature）杂志发表了一篇重磅论文。\n他们证实：传统的反向传播算法在面对持续流动的非平稳现实时，存在致命缺陷。\n随着时间推移，深层网络里的大量神经元会逐步饱和、休眠或被旧任务焊死。\n模型会迅速丧失吸收新信息的可塑性，最终性能甚至跌落到最简单的线性模型水平。\n强行喂入新知识，又会引发灾难性遗忘，把过去掌握的常识全部冲垮。\n现有的万卡集群之所以把权重死死冻结，并非技术圆满，纯粹是对网络退化的被迫妥协。\n萨顿团队在论文中给出的解法，叫持续反向传播。\n它在梯度计算的同时，给网络装上了一套动态代谢系统。\n算法持续追踪神经元的活性与效用，定期将低贡献的休眠单元随机重置。\n这种机制如同生物大脑的突触修剪，源源不断地为网络注入新的多样性。\n深度网络终于能在不遗忘旧经验的前提下，永久维持学习新事物的可塑性。\n人类大脑包含约 100 万亿个突触，每天 24 小时在未知世界中感知、预测、行动并实时进化。\n它的一生从未冻结过权重。\n维持这套心智终身自主学习的功耗，只有区区 20 瓦。\n靠数十兆瓦电力冷冻参数堆出来的数字图书馆，终究只是通往真正智能的局部切片。\n萨顿与贾维德创立 Oak Lab，将《阿尔伯塔计划》推向产业落地，\n目标就是在 5 到 10 年内造出万亿参数、20 瓦功耗、在真实世界中终身学习的心智模型。\n真正的技术分水岭，从来不在于谁在旧胡同里堆了更多芯片、跑了更多合成数据。\n在于谁能率先打破冷冻参数的枷锁，让机器真正走向永远学习的无限世界。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:37","created_at":"2026-08-25 12:04:37","url":"https://mubeitech.com/p/mb-20260825-d5bcd5","markdown_url":"https://mubeitech.com/p/mb-20260825-d5bcd5/markdown"},{"rank":2,"id":"2090932881119981686","account":"mubei","brand":"@mubei","title":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。 现在呢？ xAI 联合创始人吉米·巴（Jimmy Ba）透露了一个…","summary":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。 现在呢？ xAI 联合创始人吉米·巴（Jimmy Ba）透露了一个关键细节。 他们内部每个工程师手里，正同时跑着 10 到 20 个 AI 代码代理。 软件工程的最小单位，正在发生质变。 以前写代码，基本单位是“一个人”。 一…","body":"十年前，把两张显卡连起来跑模型，就算巨大的技术突破。\n现在呢？\nxAI 联合创始人吉米·巴（Jimmy Ba）透露了一个关键细节。\n他们内部每个工程师手里，正同时跑着 10 到 20 个 AI 代码代理。\n\n软件工程的最小单位，正在发生质变。\n以前写代码，基本单位是“一个人”。\n一个人对着一块屏幕，一行一行手敲。\n吉米·巴称，现在 xAI 有 90% 的工程师都在使用 AI 代理循环。\n这让他们的日常开发交付速度直接提升了 10 倍。\n\n十多年前，他跟着机器学习先驱辛顿做研究。\n熬一整个夏天写底层算子，只为了把模型塞进单张显卡里跑起来。\n后来成功把两张显卡连通，就成了轰动行业的技术跃迁。\n而今天，xAI 已经在用 11 万张英伟达 GB200 芯片协同训练下一代模型。\n\n但比算力膨胀更剧烈的，是人机协作方式的颠覆。\n按照吉米·巴的说法，日常琐碎的开发流程已经全部自动化。\n工程师不再是单兵作战的码农，而是同时指挥 10 到 20 个代码代理的现场调度官。\n软件工程的核心能力，变成了如何驾驭一支 AI 代理军团。\n\n既然算法和数据优化让模型效率提升了 10 倍，为什么还要疯狂堆 11 万张顶级芯片？\n吉米·巴给出的答案很直接。\n既然能做出聪明 10 倍的模型，为什么不去做？\n人类组织超过三层汇报就会产生严重的信息损耗，但指挥一组代理不会。\n软件工程的度量衡，彻底从“手写代码”变成了“调度代理”。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2091260490403983806","translated_status_id":"2091260490403983806","published_at":"2026-08-22 11:23:43","created_at":"2026-08-22T12:56:55+02:00","url":"https://mubeitech.com/p/2090932881119981686","markdown_url":"https://mubeitech.com/p/2090932881119981686/markdown"},{"rank":3,"id":"mb-20260826-a16ede","account":"mubei","brand":"","title":"月之暗面把 2.8 万亿参数的 Kimi K3 开源了","summary":"月之暗面把 2.8 万亿参数的 Kimi K3 开源了","body":"月之暗面把 2.8 万亿参数的 Kimi K3 开源了。\n随后它去找微软、亚马逊和谷歌，开出了一个前所未有的条件。\n美国三大云巨头在自己平台上分发 Kimi K3，月之暗面要抽走 30% 的收入。\n消息一出，整个科技界都在看这桩谈判。\n\n过去二十年，向来是平台向下抽税。\n苹果从应用商店里抽走 30%。\n亚马逊把开源软件打包成云服务，拿走 100% 的商业收益。\n为什么一家中国模型公司，敢反过来去收美国云巨头的过路费？\n\n这背后是一套正在被颠覆的商业机器。\n第一道齿轮，叫算力重力。\n如果一个模型只有 70 亿参数，你可以在个人电脑上随便跑。\n算力高度分散，没有谁能垄断分发。\nKimi K3 的体量达到了 2.8 万亿参数。\n这种庞然大物，需要成百上千张高端显卡组成集群才能跑起来。\n普通企业根本建不起这样的基础设施。\n全球只有微软 Azure、亚马逊 AWS 和谷歌云，拥有承载它的物理机房。\n权重虽然公开了，但能把它变成商业服务的入口，被死死锁在几家云厂商手里。\n\n这就触发了第二道齿轮：开源搭便车的死局。\n2021 年，数据库公司 Elastic 愤而修改开源协议，向亚马逊开战。\n因为亚马逊直接把开源代码打包成托管服务，年入数亿，开源团队分不到一分钱。\n传统软件时代，开源开发者只能被动防守。\n但在大模型时代，训练一个千亿、万亿参数的模型，前期要烧掉几千万甚至上亿美元。\n如果云厂商继续零成本拉走权重、转手卖调用量变现，模型公司就会被迅速吸干。\n月之暗面要这 30%，是在尝试建立一种逆向平台税。\n它试图把开源模型从免费公共品，重构为类似芯片架构的知识产权许可。\n硬件是你的，但智能核心是我的。\n你想用我的模型赚钱，就得为前期的研发成本付版税。\n\n谈判最难跨过的坎，甚至还不在分成比例。\n真正的死结在代币审计。\n企业到底调用了多少次模型，消耗了多少输入和输出，向来是云厂商内部的黑箱。\n一旦签下三成收入分成，云巨头就必须向一家外部初创公司开放真实的计费日志。\n从高高在上的基础设施房东，变成被模型厂商查账的管道。\n这是传统云巨头从未让渡过的权力。\n\n大模型正在重构软件与硬件的权力天平。\n过去拥有机房的人统治一切。\n当模型规模大到只有超级机房才能承载，而超级机房又需要顶尖模型来留住客户时，收税的人和交税的人，开始换了位置。\n真正的技术壁垒，从来不仅是代码是否开源。\n谁能把智力资产变成别人硬件上拔不掉的收费站，谁才握住了真正的议价权。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-26 18:33:04","created_at":"2026-08-26 18:33:04","url":"https://mubeitech.com/p/mb-20260826-a16ede","markdown_url":"https://mubeitech.com/p/mb-20260826-a16ede/markdown"},{"rank":4,"id":"mb-20260822-805442","account":"mubei","brand":"","title":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","summary":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度","body":"在两张显卡上跑一个 27B 参数的大模型，跑出了每秒 135 个标记的惊人速度。\n开发者写完测试脚本，兴奋地把跑分数据直接发给了几位顶尖的 AI 圈内专家。\n可就在消息发出去不久，他自己抓到了致命的破绽。\n这个让他狂喜的 135 tok/s，从头到尾只是一场自建基准测试的测量幻觉。\n代码没有造假，显卡确实在全力运转，屏幕上的字符也确实在一秒内喷出上百个标记。\n为什么这个跑分数字在真实世界里毫无意义？\n自己写脚本给大模型测速，到底踩中了哪台看不见的幽灵机器？\n把这行测试代码拆开，会看到大模型推理底层最残酷的物理约束。\n低熵复制陷阱。\n在常规的大模型自回归解码中，显卡每生成一个标记，都必须把全部 27B 参数从显存里完整读取一遍。\n两张显卡做 TP2 张量并行，显存带宽直接定死了输出速度的物理天花板。\n在常规文本生成下，每秒输出三四十个标记就已经是显存吞吐的极限。\n为了打破这道显存墙，2023 年 Google 研究员 Yaniv Leviathan 提出了投机解码机制。\n像 DFlash2 这样的扩散草稿模型，会在前台一次性预猜出一整串候选标记。\n再由 Qwen3.8-27B 这样的主模型在单次前向传播中，同时并行验证这批猜测。\n只要猜对了，就能一次性接受多个标记，把显存读取次数成倍压缩。\n整套加速系统的生死线，全系在草稿标记的接受率上。\n这位开发者自己编写的测试用例，恰好选了一个重度代码编辑场景。\n在这种场景下，模型输出的绝大部分内容，都是对提示词既有代码的原样复制。\n文本的信息熵极低，语义完全被上下文锁定。\n草稿模型几乎是在明牌抄答案，标记接受率直接飙到了 90% 以上。\n135 tok/s 的狂飙，不是模型真正的生成算力。\n它只是把高命中率的低熵搬运，错当成了系统的真实性能。\n一旦把场景换成复杂的逻辑推理、全新代码生成或者开放式长文本创作。\n语义分支瞬间爆发，文本熵值急剧升高。\n草稿模型的猜测开始大面积落空，接受率断崖式跌落到 30% 以下。\n这时候，反复猜测与验证带来的额外计算开销，不仅无法加速，甚至会让生成速度比单步解码还要慢。\n这也是为什么工业级推理工程从不依赖手写的简陋测速脚本。\n自建的测试脚本往往只粗暴地记录首尾总耗时，把前缀缓存命中、提示词预填充和真正的解码生成全部搅在一起。\n而像 vLLM 和 SGLang 这样的标准基准测试套件，在底层把首字延迟 TTFT、标记间延迟 ITL、有效产出率 Goodput 以及不同熵值分布下的接受率拆得清清楚楚。\n自建跑分测出来的从来不是引擎的真实上限。\n它测出来的只是测试者自己无意识挑选的狭窄测试集。\n大模型基准测试的门槛，从来不在于写几行代码去数一秒钟跳出多少个词。\n任何忽视了任务熵值分布与计算瓶颈转移的测速，本质上都只是在特定场景里制造测量伪影。\n速度从来不是模型单方面的属性。\n它是一套推理架构与特定任务的信息复杂度，在显存带宽和算力极限之间达成的脆弱平衡。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:07:22","created_at":"2026-08-22 17:07:22","url":"https://mubeitech.com/p/mb-20260822-805442","markdown_url":"https://mubeitech.com/p/mb-20260822-805442/markdown"},{"rank":5,"id":"mb-20260825-bb71f5","account":"mubei","brand":"","title":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","summary":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","body":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩。\n在开源微基准测试 KernelBench 上，AI 智能体写出来的算子不仅全部通过单元测试，还能比官方库快出两三倍。\n但只要把这些在沙盒里跑赢的算子，真正塞进一个完整的大模型推理脚本里，车祸立刻发生。\n原本在单点测试里快如闪电的代码，一进真实业务毫无起色，甚至直接引发显存溢出和隐性崩溃。\n为什么在孤立测试台上跑分的顶级算子，一进真实生产环境就失灵？\n是基准测试的题目太假，还是我们在测量代码性能的时候，从一开始就看错了物理现实？\n拆开现代 GPU 的算力黑箱，会看到一条横亘在实验室跑分和真实系统之间的冰冷断层。\n基准测试与部署断层（Benchmark-to-Deployment Gap）。\narXiv 最新发表的一篇论文（arXiv:2608.21836，已被 EMNLP 2026 主会录用），由学者 Hui Zeng 等人把这个行业痛点彻底扒开了。\n过去大家优化算子，习惯把注意力集中在单点上：把一个注意力机制、矩阵乘法或者激活函数单独抽出来，扔进一个无菌的测试台里。\n在孤立的测试台里，算子吃的是形状固定、连续规整的干净张量，缓存被预热到最佳状态，完全没有其他任务来抢资源。\n但在一个真实运转的大模型推理工作流里，根本不存在这种理想无菌的环境。\n大模型推理由两个物理特性完全不同的阶段咬合而成。\n第一个阶段是首字预填充（Prefill）。\n几十上百个提示词词元同时涌入，算力被瞬间拉满，GPU 处于计算受限状态。\n第二个阶段是逐字生成（Decode）。\n模型一个词元一个词元往外吐，每吐一个词都要去显存里读取一次庞大的键值缓存（KV Cache），GPU 瞬间切换到显存带宽受限状态。\n一个在孤立测试台上被调优到极速的算子，对这两个截然不同的动态阶段一无所知。\n它为了在单点测试里刷出高分，可能会贪婪地霸占所有的寄存器和共享显存。\n一旦回到真实的多层神经网络里，这种贪婪会直接破坏上下文的显存布局，导致相邻算子发生寄存器溢出，把整条流水线的吞吐量拖入泥潭。\n单次测试里看似微小的数值误差，在自回归生成的几百轮循环中，还会迅速滚成雪崩式的精度偏离。\n这就是孤岛微基准测试给整个行业制造的局部最优幻觉。\n单点算子没有问题。\n问题是它脱离了系统上下文。\n为了打破这道断层，研究团队提出了一个闭环优化框架 LLM4LLM。\n它不再把算子关在孤立的沙盒里调优。\n它的起点直接扎在真实的目标推理脚本里。\n接着做阶段感知拆解：在首字预填充和逐字生成两个阶段，分别抓取真实的显存压力和延迟瓶颈。\n随后由经验引导的幕式智能体探索 Triton 和 CUDA 代码空间。\n最后接入最关键的一道闭环：模型内验证（In-Model Validation）。\n每一个生成的代码补丁，不跑虚假的单点跑分，必须直接插入完整的十多层模型权重中，带上真实的键值缓存跑完端到端全流程。\n只有端到端总延迟真正下降、精度完全合规的代码，才会被系统接收。\n这套把优化拉回真实生产环境的系统，跑出了硬碰硬的实测数据。\n在 A100 和 H100 GPU 上针对 10 个主流大模型推理工作流进行测试，每一个模型的端到端延迟全部实现大幅改善。\n在 A100 上取得 3.91 倍的几何平均加速。\n在 H100 上取得 6.98 倍的几何平均加速。\n作为底层算子能力的交叉印证，在 KernelBench 第二级别测试上也同时斩获 2.745 倍的几何平均提速。\n把代码优化从无菌沙盒搬进真实的系统骨架，换来的是近 7 倍的真实性能跃迁。\n在高度复杂的现代计算堆栈里，脱离系统上下文的局部最优，往往只是测量工具给出的纸面富贵。\n一行真正高效的底层代码，从来不是孤立的数学公式。\n它是咬合在整台机器动态齿轮里的精密零件。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39","url":"https://mubeitech.com/p/mb-20260825-bb71f5","markdown_url":"https://mubeitech.com/p/mb-20260825-bb71f5/markdown"}]}