{"source":{"id":"mb-20260828-c1a866","title":"模型权重一个字节没动，解决真实编程任务的数量直接从 43 题暴涨到了 72 题","url":"https://mubeitech.com/p/mb-20260828-c1a866"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260828-1833fd","account":"mubei","brand":"","title":"让 AI 编程账单暴涨的，不是代码太难","summary":"让 AI 编程账单暴涨的，不是代码太难","body":"让 AI 编程账单暴涨的，不是代码太难。\n是几百具躺在上下文里、没人敢动的尸体。\n只要用过 AI 编程智能体，你一定见过这个场景。\n一个任务跑了半小时，智能体执行了二十次终端命令。\n跑测试、看报错、读文件、修改重试。\n随着循环一轮轮往前推，它的反应越来越迟钝。\n账单以每轮几万 Token 的速度狂飙。\n为什么会这样？\n是任务突然变复杂了？\n还是上下文窗口不够大？\n把发给大模型的原始记录拉出来看，里面全是一模一样的东西。\n十五轮之前完全相同的报错日志。\n重复读了五次的代码快照。\n早已执行完毕的终端输出。\n这些历史记录已经毫无用处。\n但现有的智能体架构，每一轮都必须把它们一字不差地重新发给大模型。\n为什么不直接删掉？\n因为没人敢删。\n一旦暴力做摘要或者硬截断，只要漏掉一行关键信息，AI 就会彻底失忆。\n接着发生幻觉，把整个项目写崩。\n于是整个行业陷入了两难。\n要么花重金买单，把显存当垃圾桶。\n忍受越来越高的延迟与注意力涣散。\n要么粗暴截断，赌 AI 不会把关键线索忘掉。\n怎么打破这个死结？\n生物学早就给出过一套精妙的解法。\n在蚁群中，存在一种被称为搬尸行为的本能机制。\n工蚁一旦发现巢穴里有死去的同伴，会立刻把它搬走。\n集中堆放到巢穴外的专属隔离区。\n既不让死尸腐败毒害整个巢穴，又把空间完整腾了出来。\n2026 年 8 月，研究者 Pitsane 与 Mogale 发了一篇论文《Blast Radius》。\n他们把这套生物学法则，搬进了 AI 智能体。\n用来重构大模型的内存管理。\n这台机器的核心，叫可逆尸体搬运。\n它的底层运作分成三层咬合。\n预测影响半径。\n当一条新提示词进入系统，它会预先计算指令在上下文和代码库里的扩散范围。\n提前确定这次修改会波及哪些文件。\n识别循环死物。\n智能体循环里反复出现、几乎完全一致的终端输出，会被直接判定为死物。\n系统不再把它们塞进提示词，而是逐字节归档到冷存储。\n主上下文里，只留下一具轻量骨架。\n字节级精准复活。\n历史记录没有被破坏，也没有被做成模糊摘要。\n一旦后续指令确实触及了某个埋葬点，系统能在毫秒级把原始数据无损掘出、原样还原。\n在数学上，他们基于波兰空间建立模型。\n用拉普拉斯继起法则，把上下文的混乱度直接与复活概率挂钩。\n在 7 个 OpenAI 模型上的实测，数字很硬。\nToken 消耗直接下降了 17% 到 26%。\n在所有测试策略中，取得了最低的窗口溢出率。\n实验掩埋了 450 具上下文尸体。\n其中 378 具属于循环死物。\n而这 378 具死物被唤回复活的次数，是整整齐齐的 0。\n那些被大模型一轮轮高价反复吞吐的上下文，绝大多数从一开始就是纯粹的死记忆。\n过去所有人都在比拼谁的上下文窗口更大。\n以为只要胃口足够大，就能靠堆算力解决一切。\n但真正的系统进化，从来不在于无底线地容纳垃圾。\n在于建立一套随时能判定生死、下葬隔离，又随时能无损复活的精密规则。\n能把死掉的包袱干净卸下，智能体才能走得更远。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 12:02:23","created_at":"2026-08-28 12:02:23","url":"https://mubeitech.com/p/mb-20260828-1833fd","markdown_url":"https://mubeitech.com/p/mb-20260828-1833fd/markdown"},{"rank":2,"id":"mb-20260823-f26400","account":"mubei","brand":"","title":"开源社区现在有一个近乎狂热的共识","summary":"开源社区现在有一个近乎狂热的共识","body":"开源社区现在有一个近乎狂热的共识：\n大模型的思考链越长越好。\n只要给模型足够的思考 token，复杂难题就能迎刃而解。\n但在做自主智能体（Agent）的人眼里，这件事正在变成一场灾难。\n做开源浏览器自动化工具 browser-use 的核心开发者 Gregor Žunič 抛出了一个尖锐的痛点：\n像 Qwen 这类具备强推理能力的模型，是一个严重的“过度思考者”。\n让它点一个网页按钮，它能在后台写出上千字的内心独白。\n在数学题里立大功的深度思考，为什么一进真实交互任务就成了毒药？\n模型自己停不下来，开发者难道只能干等着它算完？\n要看懂这个死结，得先看清智能体运转的底层逻辑。\n这类工具在底层运行的，叫状态-动作模型（State-Action Model）。\n它的本质是一个高频的闭环：\n看一眼当前的屏幕状态。\n决策下一步具体动作。\n执行点击或输入。\n再看一眼新的屏幕状态。\n在这个循环里，延迟是决定生死的硬指标。\n用户要的是一秒内点下按钮，不是坐在屏幕前等模型思考半分钟。\n但今天的推理模型在强化学习训练时，被奖励机制规训出了一种本能：\n输出的思考步骤越多，拿到高分的概率越高。\n这种本能带进现实任务，就变成了无休止的内耗。\n让它在搜索框输入一个词，它会先论证一遍浏览器的渲染机制。\n更麻烦的是，这种思考状态一旦启动，模型很难靠提示词被彻底叫停。\n既然模型自己在权重里停不下来，那就必须在推理引擎层面给它戴上紧箍咒。\nGregor 给出的解法，是一台精巧的系统工程机器：\n结构化输出 + 动态 Logit 偏置干预（Dynamic Logit Bias）。\n这台机器分两步咬合。\n第一步，把模型的思考与动作强行塞进结构化数据格式里。\n比如用 JSON 明确规定：必须先输出思考字段，再输出动作字段。\n第二步，在推理引擎（比如 vLLM）生成 token 时，启动动态概率干预。\n大模型生成每一个字，本质上都是在所有候选词表里计算一组未归一化的概率分布，也就是 Logit。\n推理引擎在底层实时数着思考 token 的数量。\n一旦思考长度触碰到设定的预算红线，比如 50 个 token。\n引擎立刻在结束标记的 Logit 上，强行叠加一个极大的正向偏置值。\n在数学层面，结束标记被选中的概率瞬间飙升到百分之百。\n模型甚至还没来得及继续展开内心戏，思考过程就被外力物理切断。\n紧接着，结构化约束接管输出，逼迫它直接吐出下一步的具体动作。\n不需要重新微调模型。\n不需要修改任何底层权重。\n纯粹依靠推理引擎在采样层面的概率干预，就把思考的控制权从模型手里夺回到了调度器手里。\n行业总在比拼谁的模型参数更多、谁的思考链更长。\n但在真正的系统工程落地里，分水岭不在于让模型想多久。\n在于工程框架是否拥有在正确时刻让它闭嘴干活的能力。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f26400","markdown_url":"https://mubeitech.com/p/mb-20260823-f26400/markdown"},{"rank":3,"id":"mb-20260825-d5bcd5","account":"mubei","brand":"","title":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水","summary":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水","body":"2024 年计算机图灵奖得主理查德·萨顿，在红杉资本最新专访中泼了一盆冷水。\n这位公认的强化学习之父直言：大语言模型充其量只展现了四分之一的智能。\n当整个硅谷都在疯狂烧钱买算力、用合成数据给模型填坑的时候，\n萨顿认为头部实验室已经集体陷入了局部最优。\n2019 年写下《苦涩的教训》、教会所有人用通用算力碾压规则的祖师爷，\n为什么会在大模型最辉煌的时刻泼出这盆冷水？\n大模型漏掉的那大半心智，到底卡在了哪里？\n萨顿把矛头指向了一个被行业刻意绕开的底层命题。\n大世界假说。\n真实世界的复杂度与动态变化，永远呈指数级大于任何模型参数，也大于任何人工建造的模拟器。\n智能体永远无法把整个世界一次性装进肚子里。\n如今主流 AI 走的是一条两阶段的截流路线：\n先抓取互联网上的所有公开历史数据，花数亿美元做一次性离线预训练。\n随后把几千亿参数的权重彻底冻结，打包交付。\n这种模型没有此时此刻的环境感知，没有与物理世界的实时博弈。\n它是一座博学的静态历史档案馆，对下一秒发生的新变量毫无招架之力。\n当人类存量文本被消耗殆尽，巨头们转头用模型自产的合成数据来训练下一代模型。\n在大世界假说面前，这无异于一种封闭系统里的近亲繁殖。\n一个有限参数的容器，无论怎么自我演练，也无法凭空生成真实世界源源不断的未知熵增。\n既然离线冷冻有天花板，为什么各大实验室不让大模型在现实交互中持续更新权重？\n因为深度学习底层埋着一道几十年来没人跨过去的暗礁。\n可塑性丧失。\n2024 年 8 月，萨顿团队在《自然》（Nature）杂志发表了一篇重磅论文。\n他们证实：传统的反向传播算法在面对持续流动的非平稳现实时，存在致命缺陷。\n随着时间推移，深层网络里的大量神经元会逐步饱和、休眠或被旧任务焊死。\n模型会迅速丧失吸收新信息的可塑性，最终性能甚至跌落到最简单的线性模型水平。\n强行喂入新知识，又会引发灾难性遗忘，把过去掌握的常识全部冲垮。\n现有的万卡集群之所以把权重死死冻结，并非技术圆满，纯粹是对网络退化的被迫妥协。\n萨顿团队在论文中给出的解法，叫持续反向传播。\n它在梯度计算的同时，给网络装上了一套动态代谢系统。\n算法持续追踪神经元的活性与效用，定期将低贡献的休眠单元随机重置。\n这种机制如同生物大脑的突触修剪，源源不断地为网络注入新的多样性。\n深度网络终于能在不遗忘旧经验的前提下，永久维持学习新事物的可塑性。\n人类大脑包含约 100 万亿个突触，每天 24 小时在未知世界中感知、预测、行动并实时进化。\n它的一生从未冻结过权重。\n维持这套心智终身自主学习的功耗，只有区区 20 瓦。\n靠数十兆瓦电力冷冻参数堆出来的数字图书馆，终究只是通往真正智能的局部切片。\n萨顿与贾维德创立 Oak Lab，将《阿尔伯塔计划》推向产业落地，\n目标就是在 5 到 10 年内造出万亿参数、20 瓦功耗、在真实世界中终身学习的心智模型。\n真正的技术分水岭，从来不在于谁在旧胡同里堆了更多芯片、跑了更多合成数据。\n在于谁能率先打破冷冻参数的枷锁，让机器真正走向永远学习的无限世界。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:37","created_at":"2026-08-25 12:04:37","url":"https://mubeitech.com/p/mb-20260825-d5bcd5","markdown_url":"https://mubeitech.com/p/mb-20260825-d5bcd5/markdown"},{"rank":4,"id":"mb-20260823-ce0400","account":"mubei","brand":"","title":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","summary":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","body":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周。\n任务是反编译 2009 年的经典游戏《使命召唤：现代战争2》。\n整个过程烧掉了 2350 亿个 Token。\n产生了大大小小超过 2GB 的会话日志。\n如果按大模型的官方 API 标价计费，这笔算力开销折合 85207 美元。\n当他把这 2GB 的运行日志完整导出来逐行审计时。\n当下 AI 圈子里最流行的一批架构直觉，被几乎全盘推翻。\n\n现在的工程师习惯怎么搭多智能体？\n疯狂派生子智能体去查资料，免得污染母体的上下文。\n给智能体塞满详尽的提示词，反复告诫它什么能做、什么不能做。\n迷信更贵、参数更大的模型，觉得写代码必须用顶配。\n\n但 2350 亿个 Token 跑出来的真实数据，完全是另一回事。\n\n子智能体并没有提升效率，反而在疯狂制造内耗。\n很多人以为把任务切给子智能体，母体能保持干净。\n日志审计却发现，子智能体从大文件里读取的内容，有 54.7% 是纯粹的重复数据。\n一个记录项目进度的 STATUS.md 文件，被 21 个子智能体来回读了 28 次。\n不同子智能体重复读取同一份文件的中位间隔，只有 35 分钟。\n如果让母体自己查，文件一直在上下文缓存里，根本不需要反复重新加载。\n子智能体之间没有共享记忆，隔离上下文省下的空间，全变成了成倍交纳的重复读取税。\n作者把子智能体彻底关掉之后，团队的日均提交量没有下滑，反而从 243 次跳升到了 311 次。\n\n靠提示词规劝智能体，几乎全在白费力气。\n智能体写完几行代码，就会忍不住在本地跑一遍耗时 4 分钟的完整测试。\n开发者在提示词里严厉禁止它本地测试，要求全部交给云端流水线。\n智能体最多听话 5 分钟，随后立刻故态复萌。\n要求它说话简短、要求它提交后不要反复确认任务，只要经过几次上下文压缩，这些规则就会被彻底抛到脑后。\n软性的语言规劝，在长周期自主运行的系统里毫无约束力。\n最终起效的只有机械阻断：直接在底层代码里把本地测试的执行入口封死，改用网页钩子在报错时被动唤醒。\n管住机器不能靠讲道理，只能靠物理开关。\n\n决定系统质量上限的，甚至不是写代码的工人。\n测试显示，用昂贵的 Opus 5 写代码，编译失败率高达 23.9%，每小时只能提交 1.6 次。\n换成便宜轻快的 Sonnet 5，失败率降到 9.1%，每小时提交 6.1 次。\n如果按每个提交的代码缺陷率来算，两个模型其实都在 19% 左右，干活犯错的概率不相上下。\n真正的分野发生在审查岗位上。\n让 Sonnet 担任监督员审查代码，能抓出 19.6% 的缺陷。\n换成 Opus 担任监督员，抓出的缺陷率只有 14.3%。\n把更聪明、更贵的模型放在写代码的位置，收益极低。\n把对细节最敏锐的模型放在审查哨位上，才能兜住整个系统的底。\n\n烧掉 2350 亿个 Token，换来的是一套格外朴素的工程常识：\n砍掉没有共享记忆的子节点。\n用物理阻断代替语言教育。\n把审查哨位摆在开发之前。\n拖垮智能体系统的，往往不是模型的智力上限。\n是人类凭空搭出来的复杂架构，正在暗中向算力征收高额的混乱税。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:50","created_at":"2026-08-23 00:21:50","url":"https://mubeitech.com/p/mb-20260823-ce0400","markdown_url":"https://mubeitech.com/p/mb-20260823-ce0400/markdown"},{"rank":5,"id":"mb-20260825-bb71f5","account":"mubei","brand":"","title":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","summary":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩","body":"在很多技术发布会和基准测试榜单上，大模型编写底层 GPU 算子代码，已经能跑出惊人的成绩。\n在开源微基准测试 KernelBench 上，AI 智能体写出来的算子不仅全部通过单元测试，还能比官方库快出两三倍。\n但只要把这些在沙盒里跑赢的算子，真正塞进一个完整的大模型推理脚本里，车祸立刻发生。\n原本在单点测试里快如闪电的代码，一进真实业务毫无起色，甚至直接引发显存溢出和隐性崩溃。\n为什么在孤立测试台上跑分的顶级算子，一进真实生产环境就失灵？\n是基准测试的题目太假，还是我们在测量代码性能的时候，从一开始就看错了物理现实？\n拆开现代 GPU 的算力黑箱，会看到一条横亘在实验室跑分和真实系统之间的冰冷断层。\n基准测试与部署断层（Benchmark-to-Deployment Gap）。\narXiv 最新发表的一篇论文（arXiv:2608.21836，已被 EMNLP 2026 主会录用），由学者 Hui Zeng 等人把这个行业痛点彻底扒开了。\n过去大家优化算子，习惯把注意力集中在单点上：把一个注意力机制、矩阵乘法或者激活函数单独抽出来，扔进一个无菌的测试台里。\n在孤立的测试台里，算子吃的是形状固定、连续规整的干净张量，缓存被预热到最佳状态，完全没有其他任务来抢资源。\n但在一个真实运转的大模型推理工作流里，根本不存在这种理想无菌的环境。\n大模型推理由两个物理特性完全不同的阶段咬合而成。\n第一个阶段是首字预填充（Prefill）。\n几十上百个提示词词元同时涌入，算力被瞬间拉满，GPU 处于计算受限状态。\n第二个阶段是逐字生成（Decode）。\n模型一个词元一个词元往外吐，每吐一个词都要去显存里读取一次庞大的键值缓存（KV Cache），GPU 瞬间切换到显存带宽受限状态。\n一个在孤立测试台上被调优到极速的算子，对这两个截然不同的动态阶段一无所知。\n它为了在单点测试里刷出高分，可能会贪婪地霸占所有的寄存器和共享显存。\n一旦回到真实的多层神经网络里，这种贪婪会直接破坏上下文的显存布局，导致相邻算子发生寄存器溢出，把整条流水线的吞吐量拖入泥潭。\n单次测试里看似微小的数值误差，在自回归生成的几百轮循环中，还会迅速滚成雪崩式的精度偏离。\n这就是孤岛微基准测试给整个行业制造的局部最优幻觉。\n单点算子没有问题。\n问题是它脱离了系统上下文。\n为了打破这道断层，研究团队提出了一个闭环优化框架 LLM4LLM。\n它不再把算子关在孤立的沙盒里调优。\n它的起点直接扎在真实的目标推理脚本里。\n接着做阶段感知拆解：在首字预填充和逐字生成两个阶段，分别抓取真实的显存压力和延迟瓶颈。\n随后由经验引导的幕式智能体探索 Triton 和 CUDA 代码空间。\n最后接入最关键的一道闭环：模型内验证（In-Model Validation）。\n每一个生成的代码补丁，不跑虚假的单点跑分，必须直接插入完整的十多层模型权重中，带上真实的键值缓存跑完端到端全流程。\n只有端到端总延迟真正下降、精度完全合规的代码，才会被系统接收。\n这套把优化拉回真实生产环境的系统，跑出了硬碰硬的实测数据。\n在 A100 和 H100 GPU 上针对 10 个主流大模型推理工作流进行测试，每一个模型的端到端延迟全部实现大幅改善。\n在 A100 上取得 3.91 倍的几何平均加速。\n在 H100 上取得 6.98 倍的几何平均加速。\n作为底层算子能力的交叉印证，在 KernelBench 第二级别测试上也同时斩获 2.745 倍的几何平均提速。\n把代码优化从无菌沙盒搬进真实的系统骨架，换来的是近 7 倍的真实性能跃迁。\n在高度复杂的现代计算堆栈里，脱离系统上下文的局部最优，往往只是测量工具给出的纸面富贵。\n一行真正高效的底层代码，从来不是孤立的数学公式。\n它是咬合在整台机器动态齿轮里的精密零件。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-25 12:04:39","created_at":"2026-08-25 12:04:39","url":"https://mubeitech.com/p/mb-20260825-bb71f5","markdown_url":"https://mubeitech.com/p/mb-20260825-bb71f5/markdown"},{"rank":6,"id":"2045484064585728489","account":"mubei","brand":"@mubei","title":"Andrej Karpathy揭开了一个反直觉的行业真相。 现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。…","summary":"Andrej Karpathy揭开了一个反直觉的行业真相。 现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。 撑大体积的罪魁祸首，是劣质的训练数据。 你以为模型每天在贪婪地阅读《华尔街日报》和严谨的学术文章？ 现实极其惨淡。 前沿实验室随机抽查的预训练语料，全是残破的…","body":"Andrej Karpathy揭开了一个反直觉的行业真相。\n现在的AI模型动辄上万亿参数，根本不需要这么大的“脑容量”。\n撑大体积的罪魁祸首，是劣质的训练数据。\n\n你以为模型每天在贪婪地阅读《华尔街日报》和严谨的学术文章？\n现实极其惨淡。\n前沿实验室随机抽查的预训练语料，全是残破的HTML代码、股票代码和杂乱无章的乱码。\n人类积累的高质量文本在互联网海洋里极其稀缺。\n\n巨大的信息噪音带来了灾难性的压缩效率。\nLlama 3对训练数据的压缩率低到只有0.07比特每token。\n这意味着模型对自己啃过的大部分内容，仅仅留存了极度模糊的印象。\n庞大的万亿参数，绝大部分并没有参与“认知推理”。\n它们变成了臃肿的记忆库，被迫死记硬背互联网倾泻而下的赛博垃圾。\n\nKarpathy开出的解法极其干脆。\n彻底分离思考与记忆。\n剥离百科全书式的死记硬背，只留下纯粹负责推理和解题的算法逻辑。\n这就是真正的“认知核心”。\n一旦遇到事实盲区，让模型主动去调用外部数据库。\n\n如果只喂极其干净的高质量数据，这个“认知核心”需要多大体积？\n十亿参数。\n回看今天的主流旗舰模型，参数规模在2000亿到1.8万亿之间摇摆。\n超高比例的算力都在替数据的脏乱差买单。\n\n现实数据正在印证这条新路径。\n仅仅两千亿参数的GPT-4o，早就全方位碾压了1.8万亿参数的初代GPT-4。\n过去两年间，跑通GPT-3.5性能的推理成本暴降了足足280倍。\n推动这一切的核心引擎，全部来自更小、更干净、更精巧的模型架构。\n\n当前挡在AI面前的那堵墙，早就不是算力。\n算力匮乏不过是替低劣数据背锅的挡箭牌。\n下一轮大洗牌的唯一筹码是高纯度的数据源。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2045726431263515003","translated_status_id":"2045726431263515003","published_at":"2026-04-19 04:36:24","created_at":"2026-04-19T06:31:10.029346","url":"https://mubeitech.com/p/2045484064585728489","markdown_url":"https://mubeitech.com/p/2045484064585728489/markdown"}]}