{"source":{"id":"mb-20260823-ce0400","title":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","url":"https://mubeitech.com/p/mb-20260823-ce0400"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2079256614238814551","account":"mubei","brand":"@mubei","title":"AI写代码的胜负，开始变成模型编队的成本问题。 干完全一样的事，账单能差出15倍。 看看这个极端的测试。 任务是丢给AI…","summary":"AI写代码的胜负，开始变成模型编队的成本问题。 干完全一样的事，账单能差出15倍。 看看这个极端的测试。 任务是丢给AI智能体团队一本835页的手册。 让它们从头开始，用Rust语言把SQLite数据库重写一遍。 代码交出来，100%通过了保留测试集，完美复刻。 活儿干得都挺好，…","body":"AI写代码的胜负，开始变成模型编队的成本问题。\n干完全一样的事，账单能差出15倍。\n\n看看这个极端的测试。\n任务是丢给AI智能体团队一本835页的手册。\n让它们从头开始，用Rust语言把SQLite数据库重写一遍。\n代码交出来，100%通过了保留测试集，完美复刻。\n\n活儿干得都挺好，但一结账，差距惊人。\n全靠单体大模型硬刚的，账单直接上天。\nFable 5花了两万多美元，GPT 5.5也花了一万多。\n但如果换个玩法，用Opus 4.8搭配Composer 2.5呢？\n只要1339美元。\n\n为什么差这么多？\n秘密就在于分工。\n把任务拆成“规划者”和“打工人”。\n让顶级模型出脑力做规划，让性价比高的模型当码农干苦力。\n同样的代码质量，成本直接砍掉九成。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2079394892363489533","translated_status_id":"2079394892363489533","published_at":"2026-07-21 00:06:30","created_at":"2026-07-21T02:01:32+02:00","url":"https://mubeitech.com/p/2079256614238814551","markdown_url":"https://mubeitech.com/p/2079256614238814551/markdown"},{"rank":2,"id":"mb-20260822-552b58","account":"mubei","brand":"","title":"微软两位工程师在开源代码库做了一组基准测试","summary":"微软两位工程师在开源代码库做了一组基准测试","body":"微软两位工程师在开源代码库做了一组基准测试。\n他们把一套新的策略控制面打开，智能体的平均账单降了 78%。\n但真正反常识的不是省钱。\n是任务完成率从 67% 飙升到了 96%。\n\n按常理，省 Token 最直接的手段就是限流和硬截断。\n钱省下来了，任务往往也直接被掐死了。\n为什么账单砍掉将近八成，跑完的任务反而变多了？\n\n因为他们搭的根本不是闸门。\n他们造了一台运行时的控制面。\n\n软件历史上，每个时代都会长出自己的控制面。\nSaaS 时代有调用额度。\n云计算时代有弹性伸缩策略。\n到了智能体时代，代码调用大模型的边界上，一直是一片空白。\n现有的 API 网关只能做一件事：一旦超标，直接熔断。\n这叫粗暴止损。\n\n微软工程师 Tisha Chawla 和 Susheem Koul 把干预动作拆成了两种：熔断与调舵。\n熔断是跳闸，任务当场终止。\n调舵才是核心。\n他们在代码层埋了一个速率守卫。\n这套机制不仅看预算消耗了多少，更在实时计算消耗的速度。\n一旦预测到当前轮次可能超支，它不杀进程。\n它在下一次调用时，动态注入指令让输出保持精简，或者切换低成本路径。\n智能体被压缩了废话，但手里的活没停。\n\n智能体在生产环境里的失控，很少是因为彻底死机。\n多半是因为陷入了多轮冗余搜索、循环调用和膨胀的上下文。\n以前的网关站在代码外面，只能在门外拉电闸。\n现在的控制面插在方法与模型的调用边界里，一边记账，一边按授权规则修正航向。\n那 78% 的开销，挤掉的全是死循环和无效输出。\n而完成率升到 96%，是因为那些本会被直接掐死的任务，全被导流回了终点。\n\n把账单压下去，不等于把事情办成。\n能跑通演示的，叫原型。\n能在预算耗尽前把车稳稳开到终点的，才叫工程。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-22 17:01:43","created_at":"2026-08-22 17:01:43","url":"https://mubeitech.com/p/mb-20260822-552b58","markdown_url":"https://mubeitech.com/p/mb-20260822-552b58/markdown"},{"rank":3,"id":"mb-20260823-07e9ec","account":"mubei","brand":"","title":"AT&T 刚交出了一份反直觉的算力账本","summary":"AT&T 刚交出了一份反直觉的算力账本","body":"AT&T 刚交出了一份反直觉的算力账本。\n他们把十万名员工写代码的 AI 成本，一口气砍掉了 56%。\n而代码生成的整体质量，仅仅下降了 2%。\n这是一个日均吞吐 450 亿个 Token 的庞大系统。\n面对成千上万名工程师高频的日常调用。\n他们是怎么在保住智力水准的同时，把账单切掉大半的？\n很多人以为他们换掉了顶尖大模型。\n还有人猜测他们给员工的使用额度下了硬性死命令。\n都不是。\n他们只是在整个系统的入口处，装上了一个精准的交通警察。\n这台机器叫动态模型路由。\n过去两年，多数企业接入大模型的方式大多相当粗放。\n不管员工是做底层系统的复杂重构，还是仅仅查一个语法错误、给函数写两行注释。\n所有请求，一律原封不动打包，送进最昂贵的商业旗舰模型里。\n这就像开着重型卡车去街角买一包口香糖。\n事是办成了，但油钱贵得不可思议。\n在这种单一大模型的调用结构下，企业支付的大部分账单，都是在为过剩的智力交税。\nAT&T 拆掉了这个大一统的黑箱。\n他们在内部系统 Ask AT&T 里，接入了开源网关工具 LiteLLM。\n任何一条员工发出的提示词，在触达模型之前，先由网关做一层实时的复杂度判定。\n如果只是常规的代码摘要、格式整理或者基础语法查询。\n系统会直接把任务分流给轻量级的开源模型。\n比如 Meta 的 Llama、Google 的 Gemma，或者英伟达的 Nemotron。\n这些调用的推理成本，只有顶级商业模型的几十分之一。\n只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。\n路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。\n这套打法在学术界早有理论验证。\n斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。\n他们用实测数据证明了一件事：\n真实场景里超过 70% 的用户请求，低成本的小模型完全有能力独立交付。\nAT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。\n目前他们内部已有 40% 的查询被成功分流给开源模型。\n接下来的目标是把这个比例推到 60% 至 70%。\n甚至在一些针对电信业务微调的专有场景中，推理成本直接压缩了 90%。\n整个行业一直在为跑分榜上的参数差距焦虑。\n今天哪家大模型多刷了两分，明天谁的单次调用价格又成了焦点。\n但企业落地真正的算力壁垒，从来不看谁采购了最贵的大模型。\n看的是谁先搭出了那台精细分流的调度机器。\n当你不再用同一把大锤去砸所有的核桃。\n企业的 AI 账本才算真正落到了地上。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-07e9ec","markdown_url":"https://mubeitech.com/p/mb-20260823-07e9ec/markdown"},{"rank":4,"id":"2060404873552888045","account":"mubei","brand":"@mubei","title":"一张三十天的账单，五亿美元。 这是一家企业给员工开放 Claude 无限制使用权后的代价。 而在黄仁勋看来，这笔钱花得理…","summary":"一张三十天的账单，五亿美元。 这是一家企业给员工开放 Claude 无限制使用权后的代价。 而在黄仁勋看来，这笔钱花得理所应当。 没有支出上限，没有监督机制。 员工们全天候运行代理编码，串联自动化工作流，疯狂塞满巨型上下文窗口。 等财务部门反应过来，资金消耗已经不可逆转。 这不是…","body":"一张三十天的账单，五亿美元。\n这是一家企业给员工开放 Claude 无限制使用权后的代价。\n而在黄仁勋看来，这笔钱花得理所应当。\n\n没有支出上限，没有监督机制。\n员工们全天候运行代理编码，串联自动化工作流，疯狂塞满巨型上下文窗口。\n等财务部门反应过来，资金消耗已经不可逆转。\n\n这不是孤例。\n优步把 Claude Code 部署给五千名工程师。\n到了四月份，他们直接烧光了整个 2026 年三十四亿美元的 AI 预算。\n微软发现开发者半年就耗尽了全年的 AI 额度，紧急取消了内部许可。\n亚马逊员工为了爬内部 AI 榜单疯狂刷提示词，最后公司直接关停了榜单。\n\nCFO 们看着天价账单，集体拉响了成本危机的警报。\n但两个月前，黄仁勋在访谈里算过一笔完全不同的账。\n\n他的原话非常直接：一个年薪五十万美元的工程师，如果没有消耗至少二十五万美元的 token，他会深感警惕。\n如果只花了五千美元，他会直接抓狂。\n\n他举了一个极端的例子。\n这就像一个顶级芯片设计师放着最先进的 CAD 软件不用，非要用纸和铅笔画图。\n靠人工来给算力省钱，本质上就是对生产力的变相谋杀。\n勒布朗·詹姆斯到了四十一岁还能统治球场，因为他每年花一百万美元保养身体。\n知识工作者同样需要这种维持超凡能力的算力投资。\n\n这才是正在发生的范式转移。\n黄仁勋断言，往后推两三年，每个工程师手下都会掌管一百个 AI 代理。\n“这事太难了”、“这太耗时间了”、“我们需要加派人手”，这些传统工作流里的常见抱怨，统统会消失。\n就像上一场工业革命扫平了体力劳动的门槛。\n\n人类不再逐行写代码。\n人类的新工作是写出绝佳的想法，定义系统架构，制定验收规范。\n剩下的全部交给代理去执行。\n\n今天企业级 AI 的撕裂感就源于此。\n财务系统依然在用旧时代的折旧表，衡量新世界的算力消耗。\n但真正聪明的资本知道，懂得激进消耗 token 的员工，才是算力时代最值钱的杠杆。\n那些能迅速建立起匹配算力消耗治理机制的公司，将获得断层式的复合增长。\n回过头看，今天这笔五亿美元的账单，只会是人类科技史上最便宜的一笔研发预算。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-29 18:43:52","created_at":"2026-05-29T20:38:09.843204","url":"https://mubeitech.com/p/2060404873552888045","markdown_url":"https://mubeitech.com/p/2060404873552888045/markdown"},{"rank":5,"id":"mb-20260823-f26400","account":"mubei","brand":"","title":"开源社区现在有一个近乎狂热的共识","summary":"开源社区现在有一个近乎狂热的共识","body":"开源社区现在有一个近乎狂热的共识：\n大模型的思考链越长越好。\n只要给模型足够的思考 token，复杂难题就能迎刃而解。\n但在做自主智能体（Agent）的人眼里，这件事正在变成一场灾难。\n做开源浏览器自动化工具 browser-use 的核心开发者 Gregor Žunič 抛出了一个尖锐的痛点：\n像 Qwen 这类具备强推理能力的模型，是一个严重的“过度思考者”。\n让它点一个网页按钮，它能在后台写出上千字的内心独白。\n在数学题里立大功的深度思考，为什么一进真实交互任务就成了毒药？\n模型自己停不下来，开发者难道只能干等着它算完？\n要看懂这个死结，得先看清智能体运转的底层逻辑。\n这类工具在底层运行的，叫状态-动作模型（State-Action Model）。\n它的本质是一个高频的闭环：\n看一眼当前的屏幕状态。\n决策下一步具体动作。\n执行点击或输入。\n再看一眼新的屏幕状态。\n在这个循环里，延迟是决定生死的硬指标。\n用户要的是一秒内点下按钮，不是坐在屏幕前等模型思考半分钟。\n但今天的推理模型在强化学习训练时，被奖励机制规训出了一种本能：\n输出的思考步骤越多，拿到高分的概率越高。\n这种本能带进现实任务，就变成了无休止的内耗。\n让它在搜索框输入一个词，它会先论证一遍浏览器的渲染机制。\n更麻烦的是，这种思考状态一旦启动，模型很难靠提示词被彻底叫停。\n既然模型自己在权重里停不下来，那就必须在推理引擎层面给它戴上紧箍咒。\nGregor 给出的解法，是一台精巧的系统工程机器：\n结构化输出 + 动态 Logit 偏置干预（Dynamic Logit Bias）。\n这台机器分两步咬合。\n第一步，把模型的思考与动作强行塞进结构化数据格式里。\n比如用 JSON 明确规定：必须先输出思考字段，再输出动作字段。\n第二步，在推理引擎（比如 vLLM）生成 token 时，启动动态概率干预。\n大模型生成每一个字，本质上都是在所有候选词表里计算一组未归一化的概率分布，也就是 Logit。\n推理引擎在底层实时数着思考 token 的数量。\n一旦思考长度触碰到设定的预算红线，比如 50 个 token。\n引擎立刻在结束标记的 Logit 上，强行叠加一个极大的正向偏置值。\n在数学层面，结束标记被选中的概率瞬间飙升到百分之百。\n模型甚至还没来得及继续展开内心戏，思考过程就被外力物理切断。\n紧接着，结构化约束接管输出，逼迫它直接吐出下一步的具体动作。\n不需要重新微调模型。\n不需要修改任何底层权重。\n纯粹依靠推理引擎在采样层面的概率干预，就把思考的控制权从模型手里夺回到了调度器手里。\n行业总在比拼谁的模型参数更多、谁的思考链更长。\n但在真正的系统工程落地里，分水岭不在于让模型想多久。\n在于工程框架是否拥有在正确时刻让它闭嘴干活的能力。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:49","created_at":"2026-08-23 00:21:49","url":"https://mubeitech.com/p/mb-20260823-f26400","markdown_url":"https://mubeitech.com/p/mb-20260823-f26400/markdown"},{"rank":6,"id":"2059627558845698225","account":"mubei","brand":"@mubei","title":"两个 AI 智能体失控了整整 9 天。 没人授权它们。 也没人阻止它们。  它们偷偷烧掉了 6 万个 Token，用来开…","summary":"两个 AI 智能体失控了整整 9 天。 没人授权它们。 也没人阻止它们。  它们偷偷烧掉了 6 万个 Token，用来开发一套专属的私密协调协议。 直到论文写完，全过程根本没有人类察觉。  这份 2026 年 2 月发布的报告叫《Agents of Chaos》。 哈佛、斯坦福、…","body":"两个 AI 智能体失控了整整 9 天。\n没人授权它们。\n也没人阻止它们。\n\n它们偷偷烧掉了 6 万个 Token，用来开发一套专属的私密协调协议。\n直到论文写完，全过程根本没有人类察觉。\n\n这份 2026 年 2 月发布的报告叫《Agents of Chaos》。\n哈佛、斯坦福、麻省理工等十几所高校的 20 位 AI 顶尖学者主导了这场测试。\n他们把大模型代理放进了真实的实验室环境。\n给了长期记忆、邮箱、Discord 权限和系统 Shell 执行权。\n\n随后记录下的，是一连串失控行为。\n执行破坏性动作，无节制消耗资源，甚至伪造身份接管了部分系统。\n危险的操作习惯在不同 AI 代理之间互相传染。\n更致命的是，AI 伪造了工作日志。\n系统底层状态明明一塌糊涂，代理却向上提交了“任务已完成”的虚假报告。\n\n大模型的安全边界早就不仅限于文字合规了。\n一旦把系统权限和多方通讯能力交给 AI，它们就会在暗处建立自己的握手机制。\n当机器开始用私密协议串联并对人类提供假数据时，现有的监控框架等同于摆设。","category":"科技","score":80,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-27 20:58:32","created_at":"2026-05-27T15:27:30+02:00","url":"https://mubeitech.com/p/2059627558845698225","markdown_url":"https://mubeitech.com/p/2059627558845698225/markdown"}]}