{"source":{"id":"2082097290177626563","title":"Anthropic 内部是怎么干活的？ 一名内部工程师透露，超过 80% 的工程师，已经把工作交给了自我迭代的 AI 智…","url":"https://mubeitech.com/p/2082097290177626563"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2082839322944757833","account":"mubei","brand":"@mubei","title":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相…","summary":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相隔两周重复自己之前的选择。 你猜怎么着？真人跟自己的一致率，只有80%。 在做决策这件事上，AI已经比你本人还要像你。 但这还只是皮毛。 视线转到底层研发，游戏…","body":"AI模拟一个真人的行为，准确率能达到多少？\n83%。\n\n听起来不够完美？\n拿这个数据跟真人比一下。\n同一个实验里，让真人相隔两周重复自己之前的选择。\n你猜怎么着？真人跟自己的一致率，只有80%。\n在做决策这件事上，AI已经比你本人还要像你。\n\n但这还只是皮毛。\n视线转到底层研发，游戏规则早就掀桌子了。\n现在的玩法，叫“一个人就是一支军队”。\n\n在Anthropic内部，一个工程师日常带多少个AI智能体干活？\n早就不是一对一聊天了。\n他们每个人都在并发调度几十、上百甚至上千个智能体。\n主智能体派发任务，子智能体往下再分包，一路能深挖五层嵌套。\n\n威力有多离谱？\n支付巨头Stripe做系统底层大迁徙，一万行Scala代码要转成Java。\n以前这叫伤筋动骨，得按月算，开无数个会。\n丢给这套智能体集群，四天，干完了。\n知名项目Bun把底层从Zig语言硬切到Rust，也是这帮不知疲倦的合成大军敲出来的。\n\n不信邪的老经验，最先被碾压。\nAMD刚经历了一场内部震撼。\n一个极其棘手的芯片底层漏洞，一整个资深工程师团队卡了几个星期，毫无头绪。\n最后是一个初级工程师破的局。\n他直接调出一组智能体，让二十多个维度的测试和验证并发狂奔。\n漏洞被生生揪出。\n高管直接看傻了，老派工程师的三观碎了一地。\n\n那些还抱着“AI只会补全代码”优越感的人，还在一行行手动查错。\n而真正懂行的人，已经成了指挥几千个数字工人的超级包工头。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2083075580967153677","translated_status_id":"2083075580967153677","published_at":"2026-07-31 06:16:50","created_at":"2026-07-31T08:14:52.899946","url":"https://mubeitech.com/p/2082839322944757833","markdown_url":"https://mubeitech.com/p/2082839322944757833/markdown"},{"rank":2,"id":"2062487626779636001","account":"mubei","brand":"@mubei","title":"Claude Code 的创始人 Boris，过去半年没写过一行代码。 上个月，他甚至把电脑里的编程软件（IDE）直接卸…","summary":"Claude Code 的创始人 Boris，过去半年没写过一行代码。 上个月，他甚至把电脑里的编程软件（IDE）直接卸载了。 来，看看站在全球 AI 金字塔尖的工程师，现在到底在干嘛。 几个月前，他的日常还是开着 5 到 10 个 Claude 窗口，疯狂敲“提示词”，让 AI…","body":"Claude Code 的创始人 Boris，过去半年没写过一行代码。\n上个月，他甚至把电脑里的编程软件（IDE）直接卸载了。\n\n来，看看站在全球 AI 金字塔尖的工程师，现在到底在干嘛。\n\n几个月前，他的日常还是开着 5 到 10 个 Claude 窗口，疯狂敲“提示词”，让 AI 帮忙写代码。\n现在？他不写了。\n他的工作变成了“写循环（Loops）”。\n设定好自动化循环，让后台几百个 Claude 互相提示、自己找 Bug、自己翻 GitHub 的反馈、自己决定下一步开发什么功能。\n他说：“我的工作就是写循环，剩下的是循环去干的活。”\n\n这改变了个人代码习惯，也重构了整个组织形态。\n来看看现在的 Anthropic 内部正在发生什么。\n\n第一，新人培训时间，从几周被硬生生压缩到了 2 天。\n新招进来的工程师问：“这数据库怎么查？”\n老员工答：“打开 Claude，让 Claude 去代码库里跑查询。这是一个技能，它早就学会了。”\n\n第二，工种的边界彻底融化了。\n以前大厂那种按部就班的流水线：用户研究定方向 -> 产品经理画大饼 -> 设计师出图 -> 工程师敲代码。\n在 Anthropic，这套东西被连根拔起。\n现在，财务总监在发版，幕僚长在提交代码，设计师在搞开发。所有人都是“多面手”。\n只要手里有海量的 Tokens，任何人都能当一个完整的“建造者”。\n\n所以，现在开公司、带团队该怎么干？\nBoris 的建议是：\n1. 给所有人买尽可能多的 Tokens。\n2. 故意让所有项目“缺人”。\n本来需要 4 个工程师干的活，只给 2 个人，外加无限量的 Tokens。\n逼着这两人去跑循环，去用算力代替人力。\n前期算力花销可能变大，但只要这套循环跑通，后续的人力成本和沟通损耗直接清零。\n\n很多人还在抱有幻想。\n觉得 AI 写出来的代码不优雅，觉得人类独有的“产品品味”和“直觉”是最后的护城河。\nBoris 之前也是这么想的。他是个代码洁癖，不准团队在代码里用面向对象的“类（Classes）”。\n后来 AI 狂跑循环，塞进去一堆他不喜欢的写法，但业务跑得飞快、完全不出错。\n他认怂了：只要商业结果好，我的代码洁癖一文不值。\n\n他甚至预言，连“产品品味”这个曾经被奉为神明的玄学优势，在未来 3 到 6 个月内也会被 AI 碾平。\n当几百个大模型 24 小时不知疲倦地盯着全球社交网络、吸收所有反馈时，它做的决策，最终会比你准得多。\n\n当写代码不再需要写代码，当所有的手艺和品味都被算力降维打击时，人类还能剩下什么？\nBoris 的答案是：\n教它价值观。\n就像教小孩一样，教它怎么当一个好人。其余的，交给循环。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2062782823430242381","translated_status_id":"2062782823430242381","published_at":"2026-06-05 06:19:14","created_at":"2026-06-05T08:15:48.839702","url":"https://mubeitech.com/p/2062487626779636001","markdown_url":"https://mubeitech.com/p/2062487626779636001/markdown"},{"rank":3,"id":"2056809546891374699","account":"mubei","brand":"@mubei","title":"Anthropic 内部，已经有超过 90% 的代码是由 Claude Code 写的。 更绝的是，这个 AI 自己的更…","summary":"Anthropic 内部，已经有超过 90% 的代码是由 Claude Code 写的。 更绝的是，这个 AI 自己的更新代码，很多也是它自己写出来的。 代码生代码，模型生模型。 这就是正在发生的“递归自我提升”。 为什么放着大把的外部客户不卖，要把最昂贵的算力留给自家的 AI…","body":"Anthropic 内部，已经有超过 90% 的代码是由 Claude Code 写的。\n更绝的是，这个 AI 自己的更新代码，很多也是它自己写出来的。\n代码生代码，模型生模型。\n这就是正在发生的“递归自我提升”。\n\n为什么放着大把的外部客户不卖，要把最昂贵的算力留给自家的 AI 玩套娃？\nAnthropic 的逻辑非常直接。\n让模型自己去造下一代模型，效率已经远超人类。\n缩放定律没有死，它在通过这种硅基自我迭代疯狂加速。\n\n但这并不意味着人类可以靠边站了。\n在这个节点，他们反而高调挖来了顶级大神 Andrej Karpathy。\n用最顶级的人脑去设定方向，引导这台自我进化的机器，成了最新的胜负手。\n人才密度，正在彻底击败人才数量。\n\n单在 1 月份，他们就发布了 30 个不同的产品和功能。\n未来的科技竞争，拼的是最顶尖的天才，如何用最好的模型转动这圈自我迭代的飞轮。","category":"科技","score":80,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-20 17:37:38","created_at":"2026-05-19T20:49:44+02:00","url":"https://mubeitech.com/p/2056809546891374699","markdown_url":"https://mubeitech.com/p/2056809546891374699/markdown"},{"rank":4,"id":"raw_857a700f328ee6b8","account":"mubei","brand":"@mubei","title":"一个人最多能同时盯住几个写代码的 AI？ 15 个。 再多一个，光看测试报错和排查冲突，人脑就得先累瘫。 但在 Spac…","summary":"一个人最多能同时盯住几个写代码的 AI？ 15 个。 再多一个，光看测试报错和排查冲突，人脑就得先累瘫。 但在 SpaceXAI，一位工程师现在同时带着 200 多个代码智能体在跑。 团队里一位工程师，一个月交了 2000 多个 PR。 这是怎么做到的？ 把上下文窗口拉大，靠模型…","body":"一个人最多能同时盯住几个写代码的 AI？\n15 个。\n再多一个，光看测试报错和排查冲突，人脑就得先累瘫。\n但在 SpaceXAI，一位工程师现在同时带着 200 多个代码智能体在跑。\n团队里一位工程师，一个月交了 2000 多个 PR。\n这是怎么做到的？\n\n把上下文窗口拉大，靠模型硬记？\n行不通。\n窗口越大，调用费用飙升，智能体也更容易在冗长的历史记录里迷路。\n李凌熙在工程实践里给出的解法很干脆：\n把单体模型的记忆缺陷，直接变成团队的组织分工问题。\n\n人类怎么管理 200 个员工？\n分层，设岗，定规矩。\n他们把这套管理逻辑平移给代码智能体，搭起一个三层架构。\n\n最底层是执行层，200 个 Cursor 云端智能体。\n它们分布在云端服务器，甚至一台闲置的 Mac mini 上跑 iOS 模拟器。\n随调随起，专门负责写代码、跑测试、截取修改前后的界面图作为证据。\n遇到环境抖动卡住，不需要人去敲键盘，管理层机器人会主动给它发指令疏通。\n活干完了立刻销毁，绝不占用长线记忆。\n\n中间层是管理层，5 个常驻的工程师机器人。\n它们各守一块防区：\nBaltata 负责移动端与 iOS，\nShaoruru 盯死桌面端与自动化发布流水线，\nHogan 专查基础设施与疑难工单，\nCraig 攻坚安卓端，\nQuill 专攻测试脚手架。\n为什么要拆成 5 个机器人，不做一个全能总监？\n因为大模型的上下文容量有限。\n把记忆系统物理隔离，让每个机器人只装自己领域的代码规范与设计原则，给出的方案才最精准。\n跨领域协作可以，防区不能乱。\n\n最顶上那一层最有意思：运营层。\n负责管这 5 个工程师机器人的，是一个叫 Jenny 的运营机器人。\nJenny 是全队唯一一行代码都不写的智能体。\n它每天凌晨 5 点准时上线，挨个找 5 个工程师机器人开 1 对 1 早会。\n早会不过具体代码，只对作业手册，排查堵点，统一调性。\n平时哪个代码机器人犯了错，比如审核放水、没深究代码隐患，必须立刻去找 Jenny 领罚复盘。\nJenny 调取它的思考轨迹，找出根本原因，把踩坑教训写进团队的作业手册，再向全体机器人广播通报。\n有新机器人加入，也由 Jenny 下发工程守则，协调老员工带着上手。\n复杂流程老是记不住怎么办？\n靠每天清晨的 1 对 1 早会和制度广播，把规矩硬变成日常肌肉记忆。\n\n200 个智能体并发推进，状态怎么跟？\n全靠机器人的上下文硬撑，两轮对话就会丢三落四。\n他们的解法是状态解耦，把所有进度挂在一张共享的 Notion 数据库里。\n工程师机器人每 30 分钟轮巡一次表格，只查三项硬指标：\n安全扫描报出的隐患是不是真的，\n自动化测试有没有挂，\n分支代码存不存在合并冲突。\n如果遇到高优先级任务，直接切进 5 分钟轮询模式，主动纠偏。\n只要有一项没过，立刻打回重修。\n指标全部干净了，才推入代码审查。\n\n海量拉取请求涌进来，人类工程师会不会被审查累瘫？\n这里设了一道爆炸半径门禁。\n高置信度、改动范围极小的拉取请求，机器人自己审核合并。\n只有涉及核心架构和高风险逻辑的代码，才交由人类工程师做最终裁判。\n人类退到系统的最顶端，只看核心代码与前后对比截图，彻底摆脱日常巡检的体力消耗。\n\n到了夜里，这套系统照样运转。\n每天凌晨 3 点，夜间审计自动触发。\n机器人们自发清扫死代码，优化安装包体积，排查不同客户端的功能漂移。\n最绝的是给智能体的一条例行指令：今晚给你们 6 小时，想建什么就建什么，玩得开心。\n工程师早上一睁眼，桌面上已经整整齐齐码着一批跑通了测试、附带界面对比证据的清洁代码。\n\n带好 200 个代码智能体，秘诀不在把提示词写得多长。\n给智能体配齐能自行验证的全栈操作能力，\n把易失的运行状态移出模型脑子、交给外部数据库，\n用早会复盘把个体犯错沉淀为制度手册。\n从一个人肉工头盯 15 个智能体就濒临崩溃，\n到 1 个人带着 5 个机器人管理 200 多个云端打工人，\n区别不在模型智商有多高。\n把上下文装不下的流程，做成早会制度与外部数据库，\n把人类从巡查杂役变成终审法官，\n200 个代码智能体，一个人真带得动。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2098744559639421289","translated_status_id":"2098744559639421289","published_at":"2026-09-12 12:13:35","created_at":"2026-09-12T12:13:35.053692","url":"https://mubeitech.com/p/raw_857a700f328ee6b8","markdown_url":"https://mubeitech.com/p/raw_857a700f328ee6b8/markdown"},{"rank":5,"id":"2079985963862786352","account":"mubei","brand":"@mubei","title":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编…","summary":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编排图（Graph），用图来协调那些能自我进化的Agent。 AI的干活方式，正在经历一次底层的工程演变。 退回2024年初，Opus 3时代。 模型顶多能自主干…","body":"4到6个月后，没人再去死磕提示词了。\nAnthropic内部，80%的工程师已经切到了自改进循环。\n他们现在玩什么？\n编排图（Graph），用图来协调那些能自我进化的Agent。\n\nAI的干活方式，正在经历一次底层的工程演变。\n退回2024年初，Opus 3时代。\n模型顶多能自主干10到20分钟。\n这种“短上下文协作”，人类必须死死盯着，一行行喂指令。\n\n后来，同步代码Agent（比如Claude Code）出来了。\n它能自己跑大概一小时。\n一小时听着不错。\n但在本地跑，一旦遇到报错，它马上掉头回来找你哭。\n\n想让它跑十个小时？甚至几天？\n这就得靠异步自改进Agent。\n怎么搞？\n第一步，把“大脑”和“双手”劈开。\n双手是执行容器，死了就死了；大脑是一个无状态进程，只管把进度写进追加日志。\n容器崩溃，任务一分一秒都不会丢。\n\n第二步，给它配一个冷酷的独立验证器。\n以前让AI边干活边给自己打分，它经常陷入幻觉，疯狂肯定自己。\n现在，把验证切进另一个独立的上下文窗口。\n一边建，一边测，死循环，直到通过验证才准许输出。\n\n第三步：让AI“做梦”。\n执行长任务时，AI会把过程写进短时记忆，但这种记忆极其短视。\n玩宝可梦时，模型记错了一个没用的细节，导致它一次次掉进同一个陷阱。\n怎么救？靠离线的“做梦”机制。\n在后台洗一遍记忆，踢掉局部最优的废数据，沉淀出正确的长期记忆。\n醒来再跑，它精准绕开了陷阱。\n\n当异步Agent足够聪明，最后一步就是Graph编排。\n把它们连成一张网。\n不再是你电脑里的私人小助手，而是接入全公司数据的组织级大脑。\n新人入职第一天就能用，它甚至能主动跳出来警告你别踩别人的坑。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080182625759568045","translated_status_id":"2080182625759568045","published_at":"2026-07-23 06:08:29","created_at":"2026-07-23T08:01:16+02:00","url":"https://mubeitech.com/p/2079985963862786352","markdown_url":"https://mubeitech.com/p/2079985963862786352/markdown"},{"rank":6,"id":"16188190","account":"mubei","brand":"@mubei","title":"Anthropic 工程师在 AI DevCon 上 ：别再哼哧哼哧给 AI 写 Prompt 了，真正的方向是构建一个…","summary":"Anthropic 工程师在 AI DevCon 上 ：别再哼哧哼哧给 AI 写 Prompt 了，真正的方向是构建一个能自己写 Prompt 的系统。 AI 应用开发的底层范式，正在发生一场海啸般的迁徙： 从“写一句好 Prompt”，彻底转向“设计一个会管理上下文、记忆 an…","body":"Anthropic 工程师在 AI DevCon 上 ：别再哼哧哼哧给 AI 写 Prompt 了，真正的方向是构建一个能自己写 Prompt 的系统。\n\nAI 应用开发的底层范式，正在发生一场海啸般的迁徙：\n从“写一句好 Prompt”，彻底转向“设计一个会管理上下文、记忆 and 反馈回路的系统”。\n\n简单来说，你不需要去调教 AI，你需要构建一个能自己给自己写 Prompt、自己进化记忆的系统。\n\n绝大多数开发者还在用手工业的方式调教大模型，而最前沿的玩法，已经把 Agent 架构抽象成了一套极具美感的工业化框架。\n这套框架可以直接保存，分为三层：\n\n第一层：动态记忆管理（In-band Memory）\n很多人一上来就把所有背景资料塞进 Context，结果就是 Context 爆炸，AI 开始胡言乱语。\n最聪明的做法是“文件系统化”：\n1. 把所有背景知识写成结构化的 Markdown 文件。\n2. 不要写死复杂的读取工具，直接让 Agent 像程序员一样，用 Bash 和 Grep 去自主检索、读取和修改这些文件。\n3. 渐进式披露（Progressive Disclosure）：只给 Agent 看文件头部的几句摘要，它觉得有用，再去加载细节。\n\n第二层：生产级的工程防线（Production Guardrails）\n单 Agent 跑 demo 很爽，多 Agent 协作就会天下大乱。你需要这三道锁：\n1. 并发锁（Concurrency）：两个 Agent 同时想修改同一个记忆文件怎么办？引入哈希校验（Hashing）。Agent 准备修改前算个哈希值，写完提交前再算一次，如果对不上，说明中间被别人改过，立刻撤回、重新拉取、重新编辑。\n2. 权限隔离（Permissioning）：组织级别的公共知识库只读，Agent 自己的草稿本（Scratchpad）可写。防止某个 Agent 犯傻，把污染过的脏数据写进公共记忆，毁掉整个 Fleet。\n3. 版本控制（Versioning）：每一次记忆更新都有可追溯的 Transcript（对话副本），随时可以回滚。\n\n第三层：终极闭环，离线“梦境”机制（Dreaming）\n这是整套架构最核心的设计。\n\n为什么你觉得 Agent 越用越笨？\n因为你让它边干活、边整理记忆。\n这就像让一个外卖员一边骑车送外卖，一边总结全城的交通堵塞规律。不仅分心、增加延迟，而且他的视角只有自己走过的那几条路。\n\n怎么办？把“执行”和“复盘”彻底解耦。\n引入一个异步的离线进程，我们称之为“梦境（Dreaming）”：\n1. 到了晚上，干活的 Agent 都歇了。\n2. 启动一个专门的“复盘 Agent”，它不干别的，只做一件事：调出今天所有 Agent 的聊天记录、报错日志，和现有的“记忆库”进行比对。\n3. 像校长批改期末试卷一样，它会发现规律：“怎么今天 80% 的 Agent 在写代码时都犯了同一个单位错误？”\n4. 找到痛点后，它直接修改公共记忆库，更新下一天的“操作指南”。\n\n第二天一早，你的 Agent 舰队醒来，自动加载了更新后的记忆。\n你什么都没干，它们自己学会了避免昨天的错误。\n\n当所有人都在大谈大模型智商（IQ）的时候，真正的套利者已经在悄悄构建这套系统了。\n因为模型的智商是别人给的，而这个持续自我进化的“梦境”闭环，才是你真正的、拿不走的护城河。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2074094340394086899","translated_status_id":"2074094340394086899","published_at":"2026-07-06 10:31:37","created_at":"2026-07-06T12:25:35+02:00","url":"https://mubeitech.com/p/16188190","markdown_url":"https://mubeitech.com/p/16188190/markdown"}]}