{"source":{"id":"mb-20260827-7c90bb","title":"硅谷一家公司开出 600 万美元的预算，打算让 4 名工程师花整整 5 年，只做一件事：重写代码库里的老旧测试","url":"https://mubeitech.com/p/mb-20260827-7c90bb"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2079256614238814551","account":"mubei","brand":"@mubei","title":"AI写代码的胜负，开始变成模型编队的成本问题。 干完全一样的事，账单能差出15倍。 看看这个极端的测试。 任务是丢给AI…","summary":"AI写代码的胜负，开始变成模型编队的成本问题。 干完全一样的事，账单能差出15倍。 看看这个极端的测试。 任务是丢给AI智能体团队一本835页的手册。 让它们从头开始，用Rust语言把SQLite数据库重写一遍。 代码交出来，100%通过了保留测试集，完美复刻。 活儿干得都挺好，…","body":"AI写代码的胜负，开始变成模型编队的成本问题。\n干完全一样的事，账单能差出15倍。\n\n看看这个极端的测试。\n任务是丢给AI智能体团队一本835页的手册。\n让它们从头开始，用Rust语言把SQLite数据库重写一遍。\n代码交出来，100%通过了保留测试集，完美复刻。\n\n活儿干得都挺好，但一结账，差距惊人。\n全靠单体大模型硬刚的，账单直接上天。\nFable 5花了两万多美元，GPT 5.5也花了一万多。\n但如果换个玩法，用Opus 4.8搭配Composer 2.5呢？\n只要1339美元。\n\n为什么差这么多？\n秘密就在于分工。\n把任务拆成“规划者”和“打工人”。\n让顶级模型出脑力做规划，让性价比高的模型当码农干苦力。\n同样的代码质量，成本直接砍掉九成。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2079394892363489533","translated_status_id":"2079394892363489533","published_at":"2026-07-21 00:06:30","created_at":"2026-07-21T02:01:32+02:00","url":"https://mubeitech.com/p/2079256614238814551","markdown_url":"https://mubeitech.com/p/2079256614238814551/markdown"},{"rank":2,"id":"mb-20260823-ce0400","account":"mubei","brand":"","title":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","summary":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","body":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周。\n任务是反编译 2009 年的经典游戏《使命召唤：现代战争2》。\n整个过程烧掉了 2350 亿个 Token。\n产生了大大小小超过 2GB 的会话日志。\n如果按大模型的官方 API 标价计费，这笔算力开销折合 85207 美元。\n当他把这 2GB 的运行日志完整导出来逐行审计时。\n当下 AI 圈子里最流行的一批架构直觉，被几乎全盘推翻。\n\n现在的工程师习惯怎么搭多智能体？\n疯狂派生子智能体去查资料，免得污染母体的上下文。\n给智能体塞满详尽的提示词，反复告诫它什么能做、什么不能做。\n迷信更贵、参数更大的模型，觉得写代码必须用顶配。\n\n但 2350 亿个 Token 跑出来的真实数据，完全是另一回事。\n\n子智能体并没有提升效率，反而在疯狂制造内耗。\n很多人以为把任务切给子智能体，母体能保持干净。\n日志审计却发现，子智能体从大文件里读取的内容，有 54.7% 是纯粹的重复数据。\n一个记录项目进度的 STATUS.md 文件，被 21 个子智能体来回读了 28 次。\n不同子智能体重复读取同一份文件的中位间隔，只有 35 分钟。\n如果让母体自己查，文件一直在上下文缓存里，根本不需要反复重新加载。\n子智能体之间没有共享记忆，隔离上下文省下的空间，全变成了成倍交纳的重复读取税。\n作者把子智能体彻底关掉之后，团队的日均提交量没有下滑，反而从 243 次跳升到了 311 次。\n\n靠提示词规劝智能体，几乎全在白费力气。\n智能体写完几行代码，就会忍不住在本地跑一遍耗时 4 分钟的完整测试。\n开发者在提示词里严厉禁止它本地测试，要求全部交给云端流水线。\n智能体最多听话 5 分钟，随后立刻故态复萌。\n要求它说话简短、要求它提交后不要反复确认任务，只要经过几次上下文压缩，这些规则就会被彻底抛到脑后。\n软性的语言规劝，在长周期自主运行的系统里毫无约束力。\n最终起效的只有机械阻断：直接在底层代码里把本地测试的执行入口封死，改用网页钩子在报错时被动唤醒。\n管住机器不能靠讲道理，只能靠物理开关。\n\n决定系统质量上限的，甚至不是写代码的工人。\n测试显示，用昂贵的 Opus 5 写代码，编译失败率高达 23.9%，每小时只能提交 1.6 次。\n换成便宜轻快的 Sonnet 5，失败率降到 9.1%，每小时提交 6.1 次。\n如果按每个提交的代码缺陷率来算，两个模型其实都在 19% 左右，干活犯错的概率不相上下。\n真正的分野发生在审查岗位上。\n让 Sonnet 担任监督员审查代码，能抓出 19.6% 的缺陷。\n换成 Opus 担任监督员，抓出的缺陷率只有 14.3%。\n把更聪明、更贵的模型放在写代码的位置，收益极低。\n把对细节最敏锐的模型放在审查哨位上，才能兜住整个系统的底。\n\n烧掉 2350 亿个 Token，换来的是一套格外朴素的工程常识：\n砍掉没有共享记忆的子节点。\n用物理阻断代替语言教育。\n把审查哨位摆在开发之前。\n拖垮智能体系统的，往往不是模型的智力上限。\n是人类凭空搭出来的复杂架构，正在暗中向算力征收高额的混乱税。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:50","created_at":"2026-08-23 00:21:50","url":"https://mubeitech.com/p/mb-20260823-ce0400","markdown_url":"https://mubeitech.com/p/mb-20260823-ce0400/markdown"},{"rank":3,"id":"mb-20260827-cb5609","account":"mubei","brand":"","title":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元","summary":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元","body":"一家成立刚刚两年的 AI 公司，年化收入暴力冲到 9 亿美元，估值被喊到了 450 亿美元。\n但同一个账本上，现金正在以几乎同样恐怖的速度被迅速烧光。\n营收暴涨三倍的同时，亏损不仅没有收窄，反而随着业务规模越滚越大。\n为什么全世界最会赚钱的 AI 编程公司，摆脱不了越卖越亏的怪圈？\n是管理失控，还是软件行业运行了三十年的底层商业模式被彻底打破了？\n顺着这家开发出 Devin 的 AI 初创公司 Cognition 拆开账本，会撞见一台正在颠覆整个科技产业的冰冷机器。\n服务即软件的边际成本陷阱。\n过去三十年，整个硅谷和华尔街的风投体系，全部建立在同一个物理常识之上。\n代码的复制边际成本为零。\n微软把 Windows 刻成光盘，或者 Salesforce 在云端多开一个账号，交付给第 1000 万个用户的成本基本是零。\n这种近乎免费的边际扩张，让传统软件公司坐拥 85% 到 90% 的超高毛利率。\n收进来的每一块钱软件订阅费，绝大部分都能直接沉淀为纯利润。\n资本市场之所以愿意给传统软件几十倍的市销率，买的就是这台不用追加成本就能无限印钞的机器。\n但自主智能体的出现，直接把这台印钞机的底座给拆了。\n像 Devin 这样的工具，卖的不再是一个静态的软件界面或代码补全插件。\n它卖的是一个能够独立工作的数字劳工。\n当一个程序员给它指派一个复杂的系统漏洞，Devin 不仅是在生成文本。\n它必须在独立的虚拟机沙盒里拉取整个代码库，规划架构，反复运行终端命令，甚至自动打开浏览器抓取文档。\n一次看似简单的代码合并请求，背后可能涉及数十次甚至上百次大模型深度推理的连锁循环。\n这意味着软件历史上从未出现过的物理现实：\n每一次交付任务，都在真金白银地消耗电费、显卡与 Token 算力。\n软件的边际成本不再是零，变成了一笔随着任务复杂度成倍膨胀的硬性营业成本。\nCognition 内部把这种计费形态封装成智能体计算单元 ACU。\n客户不再按使用人数买账号，开始按智能体消耗的算力工时买单。\n这也导致了一个极其残酷的财务后果：\n这类前沿智能体公司的真实毛利率，被直接砸到了 30% 到 50% 的泥潭里。\n收入每增加一百万美元，背后就有大几十万美元要原封不动地转交给上游的算力商和芯片巨头。\n既然毛利率这么难看，为什么纽约梅隆银行、桑坦德银行和奔驰这些挑剔的巨头，依然排着队把几千万美元砸给它？\n华尔街又为什么敢给一家低毛利公司报出 450 亿美元的天价？\n因为商业世界对它的估值锚点，已经换到了一个大上百倍的池子里。\n传统软件盯上的是企业每年几千亿美元的 IT 采购预算。\n智能体直接瞄准的，是全球数万亿美元的工程师薪酬与外包工资单。\n对一家大银行来说，让 Devin 修一个陈年老系统 Bug 消耗 50 美元的算力，毛利率哪怕只有三成，也比雇佣一个时薪 150 美元的硅谷工程师在电脑前耗上三天要便宜得多。\n它表面上披着软件的外衣，底层做的是硅基劳务外包。\n这是一场用高昂的算力成本，去强行置换更高昂人类工资的宏大套利。\n但这也决定了这场竞赛最致命的分水岭。\n在传统软件时代，谁的营销团队强，谁就能靠零边际成本赢家通吃。\n在智能体时代，算力账单成了悬在头顶的达摩克利斯之剑。\n谁能通过精细的模型路由、投机解码和工程优化，把每一次修 Bug 的 Token 消耗压低一半，谁才能把代工工头的苦力账本，重新做成真正暴利的护城河。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 22:36:40","created_at":"2026-08-27 22:36:40","url":"https://mubeitech.com/p/mb-20260827-cb5609","markdown_url":"https://mubeitech.com/p/mb-20260827-cb5609/markdown"},{"rank":4,"id":"mb-20260823-07e9ec","account":"mubei","brand":"","title":"AT&T 刚交出了一份反直觉的算力账本","summary":"AT&T 刚交出了一份反直觉的算力账本","body":"AT&T 刚交出了一份反直觉的算力账本。\n他们把十万名员工写代码的 AI 成本，一口气砍掉了 56%。\n而代码生成的整体质量，仅仅下降了 2%。\n这是一个日均吞吐 450 亿个 Token 的庞大系统。\n面对成千上万名工程师高频的日常调用。\n他们是怎么在保住智力水准的同时，把账单切掉大半的？\n很多人以为他们换掉了顶尖大模型。\n还有人猜测他们给员工的使用额度下了硬性死命令。\n都不是。\n他们只是在整个系统的入口处，装上了一个精准的交通警察。\n这台机器叫动态模型路由。\n过去两年，多数企业接入大模型的方式大多相当粗放。\n不管员工是做底层系统的复杂重构，还是仅仅查一个语法错误、给函数写两行注释。\n所有请求，一律原封不动打包，送进最昂贵的商业旗舰模型里。\n这就像开着重型卡车去街角买一包口香糖。\n事是办成了，但油钱贵得不可思议。\n在这种单一大模型的调用结构下，企业支付的大部分账单，都是在为过剩的智力交税。\nAT&T 拆掉了这个大一统的黑箱。\n他们在内部系统 Ask AT&T 里，接入了开源网关工具 LiteLLM。\n任何一条员工发出的提示词，在触达模型之前，先由网关做一层实时的复杂度判定。\n如果只是常规的代码摘要、格式整理或者基础语法查询。\n系统会直接把任务分流给轻量级的开源模型。\n比如 Meta 的 Llama、Google 的 Gemma，或者英伟达的 Nemotron。\n这些调用的推理成本，只有顶级商业模型的几十分之一。\n只有当任务真正涉及复杂逻辑、多步代码推理或者跨模块架构设计时。\n路由器才会把请求交给 OpenAI 和 Anthropic 的顶级旗舰。\n这套打法在学术界早有理论验证。\n斯坦福大学在 2023 年就提出过级联路由框架 FrugalGPT。\n他们用实测数据证明了一件事：\n真实场景里超过 70% 的用户请求，低成本的小模型完全有能力独立交付。\nAT&T 负责员工 AI 工具的副总裁 Mark Austin 透露。\n目前他们内部已有 40% 的查询被成功分流给开源模型。\n接下来的目标是把这个比例推到 60% 至 70%。\n甚至在一些针对电信业务微调的专有场景中，推理成本直接压缩了 90%。\n整个行业一直在为跑分榜上的参数差距焦虑。\n今天哪家大模型多刷了两分，明天谁的单次调用价格又成了焦点。\n但企业落地真正的算力壁垒，从来不看谁采购了最贵的大模型。\n看的是谁先搭出了那台精细分流的调度机器。\n当你不再用同一把大锤去砸所有的核桃。\n企业的 AI 账本才算真正落到了地上。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:46","created_at":"2026-08-23 00:21:46","url":"https://mubeitech.com/p/mb-20260823-07e9ec","markdown_url":"https://mubeitech.com/p/mb-20260823-07e9ec/markdown"},{"rank":5,"id":"mb-20260826-c3ef66","account":"mubei","brand":"","title":"科技圈过去一年最流行的叙事，叫软件已死","summary":"科技圈过去一年最流行的叙事，叫软件已死","body":"科技圈过去一年最流行的叙事，叫软件已死。\n投资人和分析师都在反复预言：AI 智能体正在接管代码，传统的企业软件行将就木。\n但在 2026 年 8 月，专门做软件项目管理的 Linear，估值直接翻倍到了 25 亿美元。\n它的年经常性收入突破了 1 亿美元。\n由 Accel 领投的这笔交易，没有向公司注入一分钱扩张资本，是一笔 9900 万美元的员工老股要约收购。\n因为这家团队规模极小的公司，从创立第二年开始就实现了盈利，至今保持着健康的现金流。\n更反常的是它的付费客户名单。\nOpenAI、Cursor、Figma、Ramp、Coinbase。\n这批在全世界最用力推行 AI 编码、最想用算法替代人力的顶尖科技公司，全在给它按月付账。\n如果 AI 真的能让写软件这套工业流程彻底蒸发，为什么最懂 AI 的人，反而要花重金买一套管理软件？\n是资本市场又一次被估值数字蒙蔽了双眼？\n还是多数人对这场技术革命的理解，从最底层就看反了方向？\n顺着生产力的底层规律拆到底，会看到一台支配了技术演进上百年的经典机器。\n杰文斯悖论。\n1865 年，英国经济学家威廉·斯坦利·杰文斯发表了《煤炭问题》。\n他发现了一个极度反直觉的规律：\n当蒸汽机的效率大幅提升、消耗单位煤炭的成本急剧下降时，煤炭的总消耗量并没有萎缩，反而迎来了数十倍的爆炸性增长。\n因为一种核心要素的成本一旦降到极低，它就会以极快的速度渗透进过去根本无力负担的海量场景。\n把这台机器搬到今天的数字世界，每个齿轮都在以完全相同的轨迹咬合。\nAI 并没有消灭对软件的需求。\n它只是把写代码的边际成本直接砸到了地板上。\n过去一个工程团队一周只能交付几个功能、提交几组代码合并。\n现在配齐了代码智能体，一个开发者一天就能生成上千行代码，同时让数十个自动化智能体在后台并行作业。\n代码的供给瞬间泛滥成灾。\n但在任何生产系统里，当上游的供给瓶颈被强行砸碎，下游的治理瓶颈就会立刻成为新的死穴。\n协同墙。\n当代码生成的速度提升了十倍，谁来决定下一个需求该做什么？\n人类团队如何向没有实体工位的智能体下发清晰的任务指令？\n数十个智能体在代码仓库里横冲直撞，谁来跟踪进度、谁来界定责任归属？\n海量调用产生的模型账单，究竟对准了哪些能够产生商业价值的真实业务？\n智能体拥有恐怖的生成速度，但它天然缺乏对组织全局的理解能力。\n代码生成越廉价，团队内部的混乱与失真就越呈指数级放大。\n创始人 Karri Saarinen 点破了这层窗户纸：\n技术演进到今天，核心痛点早已不再是代码编写，变成了一个极其严肃的人类协同问题。\n整个系统的运转上限，从此取决于人和智能体之间的中介层到底有多坚固。\nLinear 压下的全部筹码，就是把自己做成那个唯一的真实状态机。\n它把 AI 智能体直接拉进工作流当作一等公民，给人和机器提供同一套分配任务、同步状态、校验结果的协作骨架。\n它卖的不是代码生成工具。\n它卖的是在代码洪水中维系秩序与共识的治理通道。\n过去一年里，无数旧式软件忙着在自己笨重的界面上硬塞一个聊天框，把它当成自救的救命稻草。\n那种浮于表面的功能堆砌，正在被大模型的底层进化无情淘汰。\n但只要算力爆炸带来的混乱还在加剧，卡在核心协同节点上的中介层，就会成为所有智能体必须接入的调度中枢。\n新技术从来不会单纯消灭一个行业。\n它只是把生产的旧瓶颈击穿，再把更沉重的协同成本推到新的关口面前。\n决定一家软件公司能否在智能浪潮里活下去的，从来不是它能不能替人类写出几行代码。\n在于当整个世界被机器产出的信息淹没时，那把分配任务、定义秩序的钥匙，究竟握在谁的手里。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-26 18:33:00","created_at":"2026-08-26 18:33:00","url":"https://mubeitech.com/p/mb-20260826-c3ef66","markdown_url":"https://mubeitech.com/p/mb-20260826-c3ef66/markdown"},{"rank":6,"id":"2062487626779636001","account":"mubei","brand":"@mubei","title":"Claude Code 的创始人 Boris，过去半年没写过一行代码。 上个月，他甚至把电脑里的编程软件（IDE）直接卸…","summary":"Claude Code 的创始人 Boris，过去半年没写过一行代码。 上个月，他甚至把电脑里的编程软件（IDE）直接卸载了。 来，看看站在全球 AI 金字塔尖的工程师，现在到底在干嘛。 几个月前，他的日常还是开着 5 到 10 个 Claude 窗口，疯狂敲“提示词”，让 AI…","body":"Claude Code 的创始人 Boris，过去半年没写过一行代码。\n上个月，他甚至把电脑里的编程软件（IDE）直接卸载了。\n\n来，看看站在全球 AI 金字塔尖的工程师，现在到底在干嘛。\n\n几个月前，他的日常还是开着 5 到 10 个 Claude 窗口，疯狂敲“提示词”，让 AI 帮忙写代码。\n现在？他不写了。\n他的工作变成了“写循环（Loops）”。\n设定好自动化循环，让后台几百个 Claude 互相提示、自己找 Bug、自己翻 GitHub 的反馈、自己决定下一步开发什么功能。\n他说：“我的工作就是写循环，剩下的是循环去干的活。”\n\n这改变了个人代码习惯，也重构了整个组织形态。\n来看看现在的 Anthropic 内部正在发生什么。\n\n第一，新人培训时间，从几周被硬生生压缩到了 2 天。\n新招进来的工程师问：“这数据库怎么查？”\n老员工答：“打开 Claude，让 Claude 去代码库里跑查询。这是一个技能，它早就学会了。”\n\n第二，工种的边界彻底融化了。\n以前大厂那种按部就班的流水线：用户研究定方向 -> 产品经理画大饼 -> 设计师出图 -> 工程师敲代码。\n在 Anthropic，这套东西被连根拔起。\n现在，财务总监在发版，幕僚长在提交代码，设计师在搞开发。所有人都是“多面手”。\n只要手里有海量的 Tokens，任何人都能当一个完整的“建造者”。\n\n所以，现在开公司、带团队该怎么干？\nBoris 的建议是：\n1. 给所有人买尽可能多的 Tokens。\n2. 故意让所有项目“缺人”。\n本来需要 4 个工程师干的活，只给 2 个人，外加无限量的 Tokens。\n逼着这两人去跑循环，去用算力代替人力。\n前期算力花销可能变大，但只要这套循环跑通，后续的人力成本和沟通损耗直接清零。\n\n很多人还在抱有幻想。\n觉得 AI 写出来的代码不优雅，觉得人类独有的“产品品味”和“直觉”是最后的护城河。\nBoris 之前也是这么想的。他是个代码洁癖，不准团队在代码里用面向对象的“类（Classes）”。\n后来 AI 狂跑循环，塞进去一堆他不喜欢的写法，但业务跑得飞快、完全不出错。\n他认怂了：只要商业结果好，我的代码洁癖一文不值。\n\n他甚至预言，连“产品品味”这个曾经被奉为神明的玄学优势，在未来 3 到 6 个月内也会被 AI 碾平。\n当几百个大模型 24 小时不知疲倦地盯着全球社交网络、吸收所有反馈时，它做的决策，最终会比你准得多。\n\n当写代码不再需要写代码，当所有的手艺和品味都被算力降维打击时，人类还能剩下什么？\nBoris 的答案是：\n教它价值观。\n就像教小孩一样，教它怎么当一个好人。其余的，交给循环。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2062782823430242381","translated_status_id":"2062782823430242381","published_at":"2026-06-05 06:19:14","created_at":"2026-06-05T08:15:48.839702","url":"https://mubeitech.com/p/2062487626779636001","markdown_url":"https://mubeitech.com/p/2062487626779636001/markdown"}]}