其它·via @mubei·100.0 分
AI模拟一个真人的行为,准确率能达到多少? 83%。 听起来不够完美? 拿这个数据跟真人比一下。 同一个实验里,让真人相…
AI模拟一个真人的行为,准确率能达到多少? 83%。
听起来不够完美? 拿这个数据跟真人比一下。 同一个实验里,让真人相隔两周重复自己之前的选择。 你猜怎么着?真人跟自己的一致率,只有80%。 在做决策这件事上,AI已经比你本人还要像你。
但这还只是皮毛。 视线转到底层研发,游戏规则早就掀桌子了。 现在的玩法,叫“一个人就是一支军队”。
在Anthropic内部,一个工程师日常带多少个AI智能体干活? 早就不是一对一聊天了。 他们每个人都在并发调度几十、上百甚至上千个智能体。 主智能体派发任务,子智能体往下再分包,一路能深挖五层嵌套。
威力有多离谱? 支付巨头Stripe做系统底层大迁徙,一万行Scala代码要转成Java。 以前这叫伤筋动骨,得按月算,开无数个会。 丢给这套智能体集群,四天,干完了。 知名项目Bun把底层从Zig语言硬切到Rust,也是这帮不知疲倦的合成大军敲出来的。
不信邪的老经验,最先被碾压。 AMD刚经历了一场内部震撼。 一个极其棘手的芯片底层漏洞,一整个资深工程师团队卡了几个星期,毫无头绪。 最后是一个初级工程师破的局。 他直接调出一组智能体,让二十多个维度的测试和验证并发狂奔。 漏洞被生生揪出。 高管直接看傻了,老派工程师的三观碎了一地。
那些还抱着“AI只会补全代码”优越感的人,还在一行行手动查错。 而真正懂行的人,已经成了指挥几千个数字工人的超级包工头。
翻译视频 / X
相关 / RELATED
JSON- W科技人类写了几十年的软件系统,在10万亿参数的AI面前,连几秒钟都撑不过去。 Anthropic 此前秘密测试了一个叫 My…
- MAI 公司过去是怎么安慰知识工人的? “别慌,AI 只是你的副驾驶。” 现在呢? 顶尖大模型公司自己把这层温情撕掉了。…
- W科技AI最让人不安的地方,是它已经开始帮自己长大。 Joe Allen的判断很简单:AI可能是历史上增长最快的行业,也是采用…
- M一个 AI 代理,接管电脑打了 5 小时 29 分 57 秒,最后通关了《杀戮尖塔2》的每日挑战。 结果不是口头说赢了。…
- M一个 AI 代理最可怕的能力,不是会写代码。 是它能连续干活一周,然后把一个错误命令执行到本地硬盘上。 马特·舒默先晒出…
导出 / EXPORT
订阅 · SUBSCRIBE
每周一封独立、不受审查的科技与 AI 深度评论与信号,周一发出。