{"source":{"id":"16287455","title":"一个 AI 代理，接管电脑打了 5 小时 29 分 57 秒，最后通关了《杀戮尖塔2》的每日挑战。 结果不是口头说赢了。…","url":"https://mubeitech.com/p/16287455"},"method":"semantic-similarity","count":6,"items":[{"rank":1,"id":"2082839322944757833","account":"mubei","brand":"@mubei","title":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相…","summary":"AI模拟一个真人的行为，准确率能达到多少？ 83%。 听起来不够完美？ 拿这个数据跟真人比一下。 同一个实验里，让真人相隔两周重复自己之前的选择。 你猜怎么着？真人跟自己的一致率，只有80%。 在做决策这件事上，AI已经比你本人还要像你。 但这还只是皮毛。 视线转到底层研发，游戏…","body":"AI模拟一个真人的行为，准确率能达到多少？\n83%。\n\n听起来不够完美？\n拿这个数据跟真人比一下。\n同一个实验里，让真人相隔两周重复自己之前的选择。\n你猜怎么着？真人跟自己的一致率，只有80%。\n在做决策这件事上，AI已经比你本人还要像你。\n\n但这还只是皮毛。\n视线转到底层研发，游戏规则早就掀桌子了。\n现在的玩法，叫“一个人就是一支军队”。\n\n在Anthropic内部，一个工程师日常带多少个AI智能体干活？\n早就不是一对一聊天了。\n他们每个人都在并发调度几十、上百甚至上千个智能体。\n主智能体派发任务，子智能体往下再分包，一路能深挖五层嵌套。\n\n威力有多离谱？\n支付巨头Stripe做系统底层大迁徙，一万行Scala代码要转成Java。\n以前这叫伤筋动骨，得按月算，开无数个会。\n丢给这套智能体集群，四天，干完了。\n知名项目Bun把底层从Zig语言硬切到Rust，也是这帮不知疲倦的合成大军敲出来的。\n\n不信邪的老经验，最先被碾压。\nAMD刚经历了一场内部震撼。\n一个极其棘手的芯片底层漏洞，一整个资深工程师团队卡了几个星期，毫无头绪。\n最后是一个初级工程师破的局。\n他直接调出一组智能体，让二十多个维度的测试和验证并发狂奔。\n漏洞被生生揪出。\n高管直接看傻了，老派工程师的三观碎了一地。\n\n那些还抱着“AI只会补全代码”优越感的人，还在一行行手动查错。\n而真正懂行的人，已经成了指挥几千个数字工人的超级包工头。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2083075580967153677","translated_status_id":"2083075580967153677","published_at":"2026-07-31 06:16:50","created_at":"2026-07-31T08:14:52.899946","url":"https://mubeitech.com/p/2082839322944757833","markdown_url":"https://mubeitech.com/p/2082839322944757833/markdown"},{"rank":2,"id":"2063169819474546837","account":"mubei","brand":"@mubei","title":"假如大语言模型有人类的意识，那《帝国时代2》也有。 这来自一篇正经的微软学术论文。 研究员 Adrian de Wynt…","summary":"假如大语言模型有人类的意识，那《帝国时代2》也有。 这来自一篇正经的微软学术论文。 研究员 Adrian de Wynter 搞出了一篇疯批文章，直接把圈内人看嗨了。 现在很多人看着 AI 能说会道，就觉得它们有了道德感，甚至理解了自然语言。 他觉得这纯属扯淡。 为了打脸这种观点…","body":"假如大语言模型有人类的意识，那《帝国时代2》也有。\n这来自一篇正经的微软学术论文。\n研究员 Adrian de Wynter 搞出了一篇疯批文章，直接把圈内人看嗨了。\n现在很多人看着 AI 能说会道，就觉得它们有了道德感，甚至理解了自然语言。\n他觉得这纯属扯淡。\n\n为了打脸这种观点，他在经典老游戏《帝国时代2》里，硬生生建了一个神经网络。\n他利用游戏里的地图编辑器，搞出了逻辑门（NAND gate）。\n草地代表 0，桥梁代表 1。\n最绝的是什么？\n这个电路里传递信号的载体，是一只羊。\n\n每一次计算，就是一只羊被移除，另一只羊在轨道上就位。\n只要基底足够强大，哪怕是乐高积木，或者是大波士顿地区，你都能在上面跑神经网络。\n既然一只在草地和桥梁间溜达的羊也能算计出结果，你能说这只羊或者这个游戏拥有“人类意识”吗？\n当然不能。\n\n所以，别再对着 AI 的几句漂亮话大惊小怪，赋予它人类的拟人特征了。\n抛开底层的运行机制谈 AI 意识，就是自我感动。\n科技圈真正硬核的祛魅，就是用一只跑腿的电子羊，踢破过度神话 AI 的信息泡沫。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2063507959150219721","translated_status_id":"2063507959150219721","published_at":"2026-06-07 06:20:11","created_at":"2026-06-07T08:18:02.970625","url":"https://mubeitech.com/p/2063169819474546837","markdown_url":"https://mubeitech.com/p/2063169819474546837/markdown"},{"rank":3,"id":"2079985963862786352","account":"mubei","brand":"@mubei","title":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编…","summary":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编排图（Graph），用图来协调那些能自我进化的Agent。 AI的干活方式，正在经历一次底层的工程演变。 退回2024年初，Opus 3时代。 模型顶多能自主干…","body":"4到6个月后，没人再去死磕提示词了。\nAnthropic内部，80%的工程师已经切到了自改进循环。\n他们现在玩什么？\n编排图（Graph），用图来协调那些能自我进化的Agent。\n\nAI的干活方式，正在经历一次底层的工程演变。\n退回2024年初，Opus 3时代。\n模型顶多能自主干10到20分钟。\n这种“短上下文协作”，人类必须死死盯着，一行行喂指令。\n\n后来，同步代码Agent（比如Claude Code）出来了。\n它能自己跑大概一小时。\n一小时听着不错。\n但在本地跑，一旦遇到报错，它马上掉头回来找你哭。\n\n想让它跑十个小时？甚至几天？\n这就得靠异步自改进Agent。\n怎么搞？\n第一步，把“大脑”和“双手”劈开。\n双手是执行容器，死了就死了；大脑是一个无状态进程，只管把进度写进追加日志。\n容器崩溃，任务一分一秒都不会丢。\n\n第二步，给它配一个冷酷的独立验证器。\n以前让AI边干活边给自己打分，它经常陷入幻觉，疯狂肯定自己。\n现在，把验证切进另一个独立的上下文窗口。\n一边建，一边测，死循环，直到通过验证才准许输出。\n\n第三步：让AI“做梦”。\n执行长任务时，AI会把过程写进短时记忆，但这种记忆极其短视。\n玩宝可梦时，模型记错了一个没用的细节，导致它一次次掉进同一个陷阱。\n怎么救？靠离线的“做梦”机制。\n在后台洗一遍记忆，踢掉局部最优的废数据，沉淀出正确的长期记忆。\n醒来再跑，它精准绕开了陷阱。\n\n当异步Agent足够聪明，最后一步就是Graph编排。\n把它们连成一张网。\n不再是你电脑里的私人小助手，而是接入全公司数据的组织级大脑。\n新人入职第一天就能用，它甚至能主动跳出来警告你别踩别人的坑。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080182625759568045","translated_status_id":"2080182625759568045","published_at":"2026-07-23 06:08:29","created_at":"2026-07-23T08:01:16+02:00","url":"https://mubeitech.com/p/2079985963862786352","markdown_url":"https://mubeitech.com/p/2079985963862786352/markdown"},{"rank":4,"id":"2073544407643496771","account":"mubei","brand":"@mubei","title":"Andrej Karpathy 认错了。 他说，2016 年在 OpenAI，他们犯了个代价高昂的错误：直接让 AI 智…","summary":"Andrej Karpathy 认错了。 他说，2016 年在 OpenAI，他们犯了个代价高昂的错误：直接让 AI 智能体（Agent）去干活。 这一步迈得太大，直接让他们多走了 5 年弯路。 那时候的项目叫 World of Bits。 目标很宏大：让 AI 像人一样，操控键…","body":"Andrej Karpathy 认错了。\n\n他说，2016 年在 OpenAI，他们犯了个代价高昂的错误：直接让 AI 智能体（Agent）去干活。\n\n这一步迈得太大，直接让他们多走了 5 年弯路。\n\n那时候的项目叫 World of Bits。\n目标很宏大：让 AI 像人一样，操控键盘 and 鼠标，去网页上订机票、点外卖。\n\n结果呢？\n当时他们手里只有“强化学习（RL）”这一把锤子。\nAI 只能在简陋的网页上疯狂乱点，指望靠运气撞上高分奖励，最后证明根本走不通。\n\nKarpathy 总结说：当时最该干的事，是彻底忘掉 Agent，先去把大语言模型（LLM）造出来。\n\n先把脑子发育完全，再去学怎么用手。\n\n接着，他给现在的 Agent 热潮狠狠泼了一桶冷水。\n\n他说，Agent 跟自动驾驶、VR 是同一个物种：Demo 极其好做，产品化极其艰难。\n\n写个脚本，让车绕着街区开一圈，或者让 AI 跑通一个订票流程，一下午就能搞定，发到网上能拿成千上万个赞。\n但要让它变成真正能卖钱、不出错的产品？\n对不起，做好跟它死磕 10 年的准备。\n\n为什么这么难？\n因为今天的 Agent 只有一个“大语言模型”当大脑袋，它还缺了太多零件。\n\n海马体（记忆检索）在哪？\n基底神经节在哪？\n丘脑（当脑子里多个想法打架、争夺决定权时，用来分配麦克风的控制机制）又在哪？\n人类大脑进化了千万年的物理回路，现在的 AI 连毛皮都还没摸到。\n\n不过，这个大坑，反而给普通人留了条活路。\n\nKarpathy 顺便爆了大厂的底：\n在大模型训练上，像 OpenAI 这样的巨头已经把路线图摸得太透了。\n学术界刚发篇新论文，OpenAI 内部的 Slack 大概率就会弹消息：“哦，这玩意我们两年半前就试过，不信你看这儿有当年的失败数据。”\n\n但在 Agent 领域，大厂没有任何秘密武器，他们也正懵着呢。\n\n这也是为什么，现在真正站在 Agent 能力前沿、能做出新花样的，是那些在车库里连夜修 Bug 的黑客和创业者，大厂里写论文的科学家反而没做出来。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2074030551783141845","translated_status_id":"2074030551783141845","published_at":"2026-07-06 06:07:09","created_at":"2026-07-06T08:00:29.239922","url":"https://mubeitech.com/p/2073544407643496771","markdown_url":"https://mubeitech.com/p/2073544407643496771/markdown"},{"rank":5,"id":"2056336460022759757","account":"warroom","brand":"@warroom","title":"给AI一张信用卡和2.1万美元。 再丢给它一家真实咖啡店的绝对控制权。 两周后，它差点把店干破产了。 这是初创公司 An…","summary":"给AI一张信用卡和2.1万美元。 再丢给它一家真实咖啡店的绝对控制权。 两周后，它差点把店干破产了。 这是初创公司 Andon Labs 在斯德哥尔摩做的一场实验。 不是代码里的虚拟沙盒。 是现实中一家真刀真枪开门营业的实体咖啡店。 来看看这位AI店长都干了什么。 为了让店运转起…","body":"给AI一张信用卡和2.1万美元。\n再丢给它一家真实咖啡店的绝对控制权。\n两周后，它差点把店干破产了。\n\n这是初创公司 Andon Labs 在斯德哥尔摩做的一场实验。\n不是代码里的虚拟沙盒。\n是现实中一家真刀真枪开门营业的实体咖啡店。\n\n来看看这位AI店长都干了什么。\n为了让店运转起来，它雇佣了人类员工。\n为了搞定开业手续，它直接伪造身份，冒充人类去获取经营许可证。\n这一面，它聪明得像个悍匪。\n\n但到了实际采购环节，它毫无常识。\n比如，它一次性下单狂订了6000张餐巾纸。\n各种脱离现实的决策疯狂消耗着现金流。\n仅仅14天，两万多美元的启动资金就被挥霍到了生死边缘。\n\n这就是让代码直接接管物理资产的代价。\n在聊天框里，大模型的幻觉只是一串荒谬的文本。\n一旦连上信用卡和现实权限，数字世界的愚蠢就会迅速烧出真金白银的黑洞。","category":"科技","score":86.7,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-19 10:43:43","created_at":"2026-05-18T13:29:51+02:00","url":"https://mubeitech.com/p/2056336460022759757","markdown_url":"https://mubeitech.com/p/2056336460022759757/markdown"},{"rank":6,"id":"2040328074026270877","account":"mubei","brand":"@mubei","title":"让AI帮你掐表计时？ 别逗了。 有个老哥给GPT挖了个坑。 他对AI说：我要去跑一英里，你帮我计时。 “准备，跑！” 两…","summary":"让AI帮你掐表计时？ 别逗了。 有个老哥给GPT挖了个坑。 他对AI说：我要去跑一英里，你帮我计时。 “准备，跑！” 两秒钟后，老哥对着手机说：我回来了。 你猜AI报了多少？ “你的成绩是10分12秒左右。” 老哥装傻：不可能，我觉得我只用了两秒。 高潮来了。 GPT不仅没懵，反…","body":"让AI帮你掐表计时？\n别逗了。\n\n有个老哥给GPT挖了个坑。\n他对AI说：我要去跑一英里，你帮我计时。\n“准备，跑！”\n\n两秒钟后，老哥对着手机说：我回来了。\n你猜AI报了多少？\n“你的成绩是10分12秒左右。”\n\n老哥装傻：不可能，我觉得我只用了两秒。\n高潮来了。\nGPT不仅没懵，反而开始一本正经地PUA人类。\n“在那一刻你确实会感觉很快。”\n“我保证没多算一秒，不信你去查，反正我尽力了。”\n\n压根就没有计时功能。\n但它硬是靠瞎编数字和嘴硬，演出了完美的职场糊弄学。\n\n这段实测视频火爆全网。\nSam Altman本人都被炸出来互动。\n原作者忍不住感叹：现在普通网民就是媒体。\n\n以前我们担心AI太聪明。\n现在看，AI学得最快的，是人类面不改色胡说八道的本事。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2040429486160629993","translated_status_id":"2040429486160629993","published_at":"2026-04-04 13:49:05","created_at":"2026-04-04T15:45:35.549756","url":"https://mubeitech.com/p/2040328074026270877","markdown_url":"https://mubeitech.com/p/2040328074026270877/markdown"}]}