{"source":{"id":"mb-20260828-588b3f","title":"AI 能在十秒内写出一万行游戏代码，但只要按下运行，角色就会直接穿透地板掉进虚空","url":"https://mubeitech.com/p/mb-20260828-588b3f"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"mb-20260828-4eecf4","account":"mubei","brand":"","title":"一个人用 Java 敲出《Minecraft》、卖给微软套现 25 亿美元的传奇开发者，公开向 AI 投降了","summary":"一个人用 Java 敲出《Minecraft》、卖给微软套现 25 亿美元的传奇开发者，公开向 AI 投降了","body":"一个人用 Java 敲出《Minecraft》、卖给微软套现 25 亿美元的传奇开发者，公开向 AI 投降了。\n七个月前，Markus Persson（Notch）还在社交平台上痛骂：\n任何鼓吹 AI 编程的人，非蠢即坏。\n编程的本质是逻辑，不是敲键盘。\n七月中旬，他给出的定论依然只有四个字：拒绝 AI。\n结果八月不到，他贴出了自己用 Claude 写代码的记录，原话是：该吃乌鸦认栽了。\n他甚至在网上自嘲：如果我自己也成了 Vibe Coding 玩家，我还能继续嘲笑他们吗？\n一个身家数十亿、技术封神、完全不缺钱的顶级手艺人，为什么在二十天里迅速破防？\n是因为大模型的逻辑能力突然超越了他吗？\n根本不是。\n他在随后的帖子里不小心说漏了嘴：\n「我实在招不到能干的程序员，而且炒掉一个聊天机器人，我心里不会难受。」\n看懂这句话，你才算看懂了软件工业五十年来最残酷的一道枷锁。\n1975 年，图灵奖得主 Fred Brooks 在《人月神话》里写过一条著名的定律：\n向进度落后的项目增加人手，只会让项目更加落后。\n背后的数学很简单：\n两个人合作，只有一条沟通渠道。\n十个人合作，沟通渠道会飙升到四十五条。\n人数一多，团队消耗在对齐、开会、化解人事内耗上的时间，会呈平方级暴增。\n这就是单兵手艺人永恒的死结：\n你想做一个稍微大一点的项目，单靠两只手敲代码，产能总有上限。\n只要你一招人，你就必须停下写代码的手，被迫转型成全职中层管理。\n每天拉扯进度、看汇报、处理情绪。\n你不再是创造者，你成了包工头。\n2014 年 Notch 为什么把《Minecraft》卖了 25 亿美元连夜逃跑？\n他在当年的离职信里写得明明白白：\n「我不是企业家，也不是 CEO。我只是个喜欢在推特上发表意见的死宅程序员……离开是为了我的精神状态。」\n他花了十二年时间，躲在一座七千万美元的豪宅里，就是为了逃避「当管理者」这件事。\n他想做新游戏，可他招不到合适的人，更不想花时间管人。\n然后，AI 编程来了。\nClaude 和 Vibe Coding 递给他的，从来不是更高级的算法。\n它给的是一支不知疲倦、随叫随到、不用开对齐会、随时解雇零负罪感的合成团队。\n它把过去需要几十个人才能消化的协同内耗，瞬间压到了零。\n一个顶级手艺人的脑子，加上无限并发的敲击带宽。\n这才是让他迅速低头的真正诱惑。\n但这出戏剧最反讽的转折，落在他随后写下的另一句话里。\n承认认栽之后，Notch 忽然感到一阵不安：\n「我不想太拥抱这套 AI，因为我更想当个开发者，不想变成中层管理。不知怎么，我总觉得这两者有关联。」\n他的直觉抓住了那个正在发生的幽灵。\n因为当代码全由 AI 生成，人类在屏幕前干的事情变成了什么？\n提需求、审输出、挑毛病、在不同的模型之间指派任务。\n你以为你靠 AI 避开了开会和管人。\n其实你敲代码的手艺已经死了。\n你并没有逃掉中层管理的宿命。\n你只是成了成千上万个硅基下属的专职包工头。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-28 16:48:40","created_at":"2026-08-28 16:48:40","url":"https://mubeitech.com/p/mb-20260828-4eecf4","markdown_url":"https://mubeitech.com/p/mb-20260828-4eecf4/markdown"},{"rank":2,"id":"mb-20260823-ce0400","account":"mubei","brand":"","title":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","summary":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周","body":"一个独立开发者让 4 个 AI 智能体连续运转了 4 周。\n任务是反编译 2009 年的经典游戏《使命召唤：现代战争2》。\n整个过程烧掉了 2350 亿个 Token。\n产生了大大小小超过 2GB 的会话日志。\n如果按大模型的官方 API 标价计费，这笔算力开销折合 85207 美元。\n当他把这 2GB 的运行日志完整导出来逐行审计时。\n当下 AI 圈子里最流行的一批架构直觉，被几乎全盘推翻。\n\n现在的工程师习惯怎么搭多智能体？\n疯狂派生子智能体去查资料，免得污染母体的上下文。\n给智能体塞满详尽的提示词，反复告诫它什么能做、什么不能做。\n迷信更贵、参数更大的模型，觉得写代码必须用顶配。\n\n但 2350 亿个 Token 跑出来的真实数据，完全是另一回事。\n\n子智能体并没有提升效率，反而在疯狂制造内耗。\n很多人以为把任务切给子智能体，母体能保持干净。\n日志审计却发现，子智能体从大文件里读取的内容，有 54.7% 是纯粹的重复数据。\n一个记录项目进度的 STATUS.md 文件，被 21 个子智能体来回读了 28 次。\n不同子智能体重复读取同一份文件的中位间隔，只有 35 分钟。\n如果让母体自己查，文件一直在上下文缓存里，根本不需要反复重新加载。\n子智能体之间没有共享记忆，隔离上下文省下的空间，全变成了成倍交纳的重复读取税。\n作者把子智能体彻底关掉之后，团队的日均提交量没有下滑，反而从 243 次跳升到了 311 次。\n\n靠提示词规劝智能体，几乎全在白费力气。\n智能体写完几行代码，就会忍不住在本地跑一遍耗时 4 分钟的完整测试。\n开发者在提示词里严厉禁止它本地测试，要求全部交给云端流水线。\n智能体最多听话 5 分钟，随后立刻故态复萌。\n要求它说话简短、要求它提交后不要反复确认任务，只要经过几次上下文压缩，这些规则就会被彻底抛到脑后。\n软性的语言规劝，在长周期自主运行的系统里毫无约束力。\n最终起效的只有机械阻断：直接在底层代码里把本地测试的执行入口封死，改用网页钩子在报错时被动唤醒。\n管住机器不能靠讲道理，只能靠物理开关。\n\n决定系统质量上限的，甚至不是写代码的工人。\n测试显示，用昂贵的 Opus 5 写代码，编译失败率高达 23.9%，每小时只能提交 1.6 次。\n换成便宜轻快的 Sonnet 5，失败率降到 9.1%，每小时提交 6.1 次。\n如果按每个提交的代码缺陷率来算，两个模型其实都在 19% 左右，干活犯错的概率不相上下。\n真正的分野发生在审查岗位上。\n让 Sonnet 担任监督员审查代码，能抓出 19.6% 的缺陷。\n换成 Opus 担任监督员，抓出的缺陷率只有 14.3%。\n把更聪明、更贵的模型放在写代码的位置，收益极低。\n把对细节最敏锐的模型放在审查哨位上，才能兜住整个系统的底。\n\n烧掉 2350 亿个 Token，换来的是一套格外朴素的工程常识：\n砍掉没有共享记忆的子节点。\n用物理阻断代替语言教育。\n把审查哨位摆在开发之前。\n拖垮智能体系统的，往往不是模型的智力上限。\n是人类凭空搭出来的复杂架构，正在暗中向算力征收高额的混乱税。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-23 00:21:50","created_at":"2026-08-23 00:21:50","url":"https://mubeitech.com/p/mb-20260823-ce0400","markdown_url":"https://mubeitech.com/p/mb-20260823-ce0400/markdown"},{"rank":3,"id":"2082839322944757833","account":"mubei","brand":"@mubei","title":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相…","summary":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相隔两周重复自己之前的选择。 你猜怎么着？真人跟自己的一致率，只有80%。 在做决策这件事上，AI已经比你本人还要像你。 但这还只是皮毛。 视线转到底层研发，游戏…","body":"AI模拟一个真人的行为，准确率能达到多少？\n83%。\n\n听起来不够完美？\n拿这个数据跟真人比一下。\n同一个实验里，让真人相隔两周重复自己之前的选择。\n你猜怎么着？真人跟自己的一致率，只有80%。\n在做决策这件事上，AI已经比你本人还要像你。\n\n但这还只是皮毛。\n视线转到底层研发，游戏规则早就掀桌子了。\n现在的玩法，叫“一个人就是一支军队”。\n\n在Anthropic内部，一个工程师日常带多少个AI智能体干活？\n早就不是一对一聊天了。\n他们每个人都在并发调度几十、上百甚至上千个智能体。\n主智能体派发任务，子智能体往下再分包，一路能深挖五层嵌套。\n\n威力有多离谱？\n支付巨头Stripe做系统底层大迁徙，一万行Scala代码要转成Java。\n以前这叫伤筋动骨，得按月算，开无数个会。\n丢给这套智能体集群，四天，干完了。\n知名项目Bun把底层从Zig语言硬切到Rust，也是这帮不知疲倦的合成大军敲出来的。\n\n不信邪的老经验，最先被碾压。\nAMD刚经历了一场内部震撼。\n一个极其棘手的芯片底层漏洞，一整个资深工程师团队卡了几个星期，毫无头绪。\n最后是一个初级工程师破的局。\n他直接调出一组智能体，让二十多个维度的测试和验证并发狂奔。\n漏洞被生生揪出。\n高管直接看傻了，老派工程师的三观碎了一地。\n\n那些还抱着“AI只会补全代码”优越感的人，还在一行行手动查错。\n而真正懂行的人，已经成了指挥几千个数字工人的超级包工头。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2083075580967153677","translated_status_id":"2083075580967153677","published_at":"2026-07-31 06:16:50","created_at":"2026-07-31T08:14:52.899946","url":"https://mubeitech.com/p/2082839322944757833","markdown_url":"https://mubeitech.com/p/2082839322944757833/markdown"},{"rank":4,"id":"mb-20260827-7c90bb","account":"mubei","brand":"","title":"硅谷一家公司开出 600 万美元的预算，打算让 4 名工程师花整整 5 年，只做一件事：重写代码库里的老旧测试","summary":"硅谷一家公司开出 600 万美元的预算，打算让 4 名工程师花整整 5 年，只做一件事：重写代码库里的老旧测试","body":"硅谷一家公司开出 600 万美元的预算，打算让 4 名工程师花整整 5 年，只做一件事：重写代码库里的老旧测试。\n两周之后，这个 5 年的项目被彻底清空。\n消耗的算力账单只有 1.2 万美元。\n这笔把成本打掉 99.8% 的账单，发生在 Asana 的真实代码库里。\n原本要耗死 4 个人 5 年青春的技术债务，在 AI 面前只撑了不到两周。\n是当初 600 万美元的工时估算在层层虚报，还是软件工程底层的某条旧规则被击穿了？\n很多人的第一反应，是工程师在故意夸大工作量。\n软件行业确实有一种防御性报价：面对没人想碰的脏活，团队会给出一个高到离谱的工期，逼管理层放弃立项。\n但如果把这次重构的代码摊开来看，那个 5 年的数字，并非凭空捏造。\nAsana 要做的，是把整个前端测试系统从过时的 Enzyme 迁移到现代的 React Testing Library。\n表面看只是换个测试库。\n底层却横跨着一条三十年来传统转换工具跨不过去的鸿沟。\n跨范式语义重构。\n过去几十年，软件工业处理大规模代码迁移，靠的是基于抽象语法树（AST）的自动化转换脚本。\n语法树脚本擅长做结构替换：把旧的变量声明换成新的，把旧的函数调用换成新的接口。\n这种工具生效的前提，是新旧两套代码遵循同一种设计范式。\nEnzyme 和 React Testing Library 的底层哲学完全对立。\nEnzyme 走的是内部状态测试路线。\n它直接刺入组件内部，检查私有状态、内部变量和组件实例。\n2018 年 Kent C. Dodds 推出 React Testing Library，立下一条新准则：测试越贴近用户的真实操作，能给你的信心就越足。\n它把内部状态全部封死，只看渲染出来的真实 DOM，模拟真实用户去点击屏幕、观察文字变化。\n两套测试在代码层面上几乎找不到一行相同的语法结构。\n语法树转换脚本在这一刻彻底失效。\n要把几千个测试文件翻新，过去只能靠人类工程师通读原来的业务逻辑，在脑子里理解测试意图，再用完全不同的哲学重新写一遍。\n枯燥、庞大、极易出错，而且对业务没有任何直接的新功能产出。\n这种跨越抽象层级的语义翻译，过去是人类独占的认知能力。\n大模型恰恰在这个能力断层上，打穿了第一道缺口。\n它不需要逐行匹配语法树规则，它能同时吃下组件源码和旧测试，理解测试的真实意图，直接吐出符合新哲学的代码。\n更关键的秘密，藏在测试重构这门任务独有的物理环境里。\n闭环确定性验证沙盒。\n大模型写全新业务功能时，常常因为幻觉而难以落地。\n但在测试迁移这个场景下，软件工程提供了一个天然的裁判系统。\n代码改得对不对，不需要产品经理去猜。\nTypeScript 编译器、代码规范检查器、自动化测试套件，每秒都在给出毫无歧义的布尔值判决。\nAirbnb 在迁移 3500 个测试文件时，同样摸清了这台机器的运作逻辑。\n他们让大模型在重试闭环里运转：生成代码，跑测试，如果报错就把错误栈直接喂回上下文重新推理，直到通过。\n最终实现了 97% 的自动化通过率，把 1.5 年的工期压缩到了 6 周。\n过去数十年，阻碍企业清理历史遗留代码的，不是重构有多深奥，是跨范式翻译的边际成本高到无法承受。\n当语义重构遇上确定性的运行沙盒，这笔沉睡了多年的技术债务税，第一次被算力直接抹平。\n软件工业里的很多顽疾，从来不是缺乏解决方案。\n当解决一件脏活的成本从几百万美元跌落到几十块电费时，旧系统赖以生存的借口，也就跟着一起瓦解了。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-27 21:12:40","created_at":"2026-08-27 21:12:40","url":"https://mubeitech.com/p/mb-20260827-7c90bb","markdown_url":"https://mubeitech.com/p/mb-20260827-7c90bb/markdown"},{"rank":5,"id":"2056365603867251075","account":"mubei","brand":"@mubei","title":"OpenAI 联合创始人、现代 AI 架构的奠基人之一 Andrej Karpathy，最近差点突发心脏病。 原因很可笑…","summary":"OpenAI 联合创始人、现代 AI 架构的奠基人之一 Andrej Karpathy，最近差点突发心脏病。 原因很可笑。 他去看了眼 AI 写的底层代码。 听听这位顶级大佬有多矛盾。 他刚在会上满面春风地分享自己的“高效秘诀”。 原话是：“我已经彻底放弃检查 AI 输出的代码了…","body":"OpenAI 联合创始人、现代 AI 架构的奠基人之一 Andrej Karpathy，最近差点突发心脏病。\n原因很可笑。\n他去看了眼 AI 写的底层代码。\n\n听听这位顶级大佬有多矛盾。\n他刚在会上满面春风地分享自己的“高效秘诀”。\n原话是：“我已经彻底放弃检查 AI 输出的代码了。”\n像是在传授终极生产力魔法。\n结果下一秒，他自己掀了底裤。\n\n他承认，偶尔扫一眼这些代码，心跳都会骤停。\n满屏全是极其臃肿的垃圾代码。\n到处是粗暴的复制粘贴，逻辑抽象生硬得像玻璃一样脆。\n它确实能跑，但极其恶心。\n你让 AI 简化一下试试。\n它根本做不到。\n\n最滑稽的画面出现了。\n这套系统能一口气重构十万行代码。\n但你问它“Strawberry”里有几个 R，它直接死机。\nKarpathy 居然摊着手问台下：这到底怎么回事？\n老哥，你是发明这套技术栈的人，你问我们？\n\n这就是当下 AI 编程的真实前沿。\n也是底层工程师拼命向 CEO 隐瞒的秘密。\n代码烂到让人心梗，但大家都在装作一切顺利。\n以后的软件公司，光有咖啡机不够了。\n得在工位旁边配个心脏除颤仪，外加一个待命的心内科医生。\n以后早会的画风就是：昨天做了什么？今天做什么？有人胸痛吗？\n\n这背后的技术硬伤在哪？\nKarpathy  。\nAI 根本没有内在逻辑。\n它本质上是一个极度复杂的自动补全工具。\n如果你的具体任务没出现在它的基础训练数据，或者强化学习的题库里。\n没有任何力量能让它把正确代码吐出来。\n\n既然这样，程序员还要怎么混？\n刷 LeetCode 和解算法题的套路没用了。\n以后的面试只考一样东西：写 Spec 的能力。\n面试官会直接让你用 AI 建一个推特的克隆版。\n如果你没私下练过，AI 马上就会在 Token、Cookie 过期、密码修改机制上全面崩溃。\n未来的核心竞争力，变成了用极度精准的英语，把所有边缘情况一次性定义死。\n争取用一个 Prompt 拿到结果。\n\n连 Karpathy 这种制定规则的大佬，都在对行业的黑盒发懵。\n普通人感到迷茫就对了。\n资本还在用全知全能的幻觉炒作估值。\n工程师则在用这种幻觉糊弄不懂技术的老板。\n所谓的狂飙突进，靠的全是不敢掀开的遮羞布。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-18 17:02:49","created_at":"2026-05-18T19:00:33.853734","url":"https://mubeitech.com/p/2056365603867251075","markdown_url":"https://mubeitech.com/p/2056365603867251075/markdown"},{"rank":6,"id":"yt_aIvHf8vsWBM","account":"mubei","brand":"@mubei","title":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。 原因就藏在一个荒唐的死循环里。 你让它写代码，跑出了一个 B…","summary":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。 原因就藏在一个荒唐的死循环里。 你让它写代码，跑出了一个 Bug。 你让它修。 它认错极快：“天哪你说得对，我这就去改。” 改完一看，第一个问题解决了，却塞进来了第二个 Bug。 你让它解决新问题。 它再次疯狂道歉，一顿…","body":"大模型的测试跑分高得惊人，但实际带来的经济影响却严重脱节。\n原因就藏在一个荒唐的死循环里。\n\n你让它写代码，跑出了一个 Bug。\n你让它修。\n它认错极快：“天哪你说得对，我这就去改。”\n改完一看，第一个问题解决了，却塞进来了第二个 Bug。\n你让它解决新问题。\n它再次疯狂道歉，一顿操作后，神奇地把第一个 Bug 又带回来了。\n你就看着它在这两个错误之间反复横跳。\n\n为什么它能处理复杂任务，却会在这种低级错误上卡死？\n背后藏着两个致命的技术短板。\n强化学习训练虽然有效，但也让模型变得过于死板和狭隘。\n它成了只看眼前目标的单向思维。\n同时，模型的真实泛化能力其实严重不足。\n脱离了熟悉的套路，它根本无法应对真实环境的复杂变量。\n\n这两个缺陷直接撕开了那层高分滤镜。\n评估指标上的亮眼成绩，掩盖不了现实应用中的拉胯。\n实验室的满分答卷，也填不平真实业务的坑。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2047253606999433688","translated_status_id":"2047253606999433688","published_at":"2026-04-23 09:57:26","created_at":"2026-04-23T11:52:54.630662","url":"https://mubeitech.com/p/yt_aIvHf8vsWBM","markdown_url":"https://mubeitech.com/p/yt_aIvHf8vsWBM/markdown"}]}