{"source":{"id":"2080728910291959884","title":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…","url":"https://mubeitech.com/p/2080728910291959884"},"method":"semantic-similarity","count":5,"items":[{"rank":1,"id":"2054215545663144217","account":"mubei","brand":"@mubei","title":"GPT 5.5 破局了。 程序员最担心的事，还是发生了。 200个高难度任务，24.8万次高压测试。 在此之前，没人相信…","summary":"GPT 5.5 破局了。 程序员最担心的事，还是发生了。 200个高难度任务，24.8万次高压测试。 在此之前，没人相信 AI 能从零开始重构程序。 这是 ProgramBench 的最新数据。 GPT 5.5 xhigh 的完成率冲到了 13.5%。 而此前的霸主 Opus 4…","body":"GPT 5.5 破局了。\n\n程序员最担心的事，还是发生了。\n200个高难度任务，24.8万次高压测试。\n在此之前，没人相信 AI 能从零开始重构程序。\n\n这是 ProgramBench 的最新数据。\nGPT 5.5 xhigh 的完成率冲到了 13.5%。\n而此前的霸主 Opus 4.7 只有 4.5%。\n三倍的性能跨越，标志着 AI 正式接管复杂逻辑。\n\n更有意思的是 AI 的策略选择。\n面对同一任务，高级版选了 Python 追求效率。\n顶配版直接掏出 C 语言，挑战计算底层。\nAI 已经学会根据任务难度，自主选择最适合的武器。\n\n2026 年，算力即是国力。\n川普政府对 AI 监管的松绑，让研发速度彻底爆发。\n当某些模式还在忙着给模型套上各种复杂的审查枷锁时。\n硅谷已经在 24 万个测试用例中，拿到了重塑软件工业的钥匙。\n\n这种从零构建代码的能力，正在让传统程序员的护城河迅速干涸。\n软件生成的边际成本，正在无限趋近于零。","category":"科技","score":80,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-12 18:45:20","created_at":"2026-05-12T17:02:06+02:00","url":"https://mubeitech.com/p/2054215545663144217","markdown_url":"https://mubeitech.com/p/2054215545663144217/markdown"},{"rank":2,"id":"mb-20260830-a41049","account":"mubei","brand":"","title":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡","summary":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡","body":"把一个前沿大模型的调用成本砍掉 80%，不是打价格战，也不是买到了更便宜的显卡。\n是一台更强的模型，在生产环境里直接重写了它的底层 GPU 算子。\n为什么真实的自我进化，不是科幻小说里的超级大脑空转哲学，是它直接接管了人类工程师的编译器？\n这台机器叫架构级递归自我提升。\n过去优化一套大模型的推理栈，需要顶尖工程师对着硬件手册，花上几周时间一行一行调校 CUDA 内核。\n稍微改错一个显存地址，整个生产集群就会当场瘫痪。\n但在 OpenAI 内部，最前沿的 Sol 模型开始直接观测运行中的 Luna。\n它在毫秒级的运行轨迹里寻找指令冗余，自主重构数据流，把 GPU 的硬件利用率压榨到极限。\n短短三个月，整个推理速度提升了 60%，运行成本直接跳水 80%。\n最顶尖的智能，直接变成了下一代模型的算力折扣。\n这推导出了一条极其残酷的工业规律：六个月前沿通缩。\n今天坐在算力顶峰、调用一次贵得令人咋舌的前沿模型，六个月之后，就会被这套自我优化机制压缩成廉价甚至免费的基础设施。\nReplit 已经在免费模式里分发 Luna。\n为什么这种自我优化的飞轮，只有极少数团队转得起来？\n早在 ChatGPT 改变世界前整整一年，DeepMind 内部就已经跑着一个几乎一模一样的对话模型 LMChat。\n创意密度极高，模型已经能生成连贯且有用的文本，但它被死死锁在实验室里不敢发布。\n因为传统科技巨头把前沿技术的不稳定，当成了必须层层审批的合规风险与声誉坏账。\nOpenAI 走了一条完全相反的路。\nCodex 负责人 Tibo Sottiaux 桌上有一个实体的重置按钮。\n系统挂了、体验不达预期，产品负责人不需要找财务部开会，不需要找市场部审批，随时按下去，直接把使用额度全额赔给开发者。\n零摩擦的产品补偿，把本该招致愤怒的技术故障，变成了数千万开发者在生产环境里为模型纠错的默契。\n真实世界的海量代码反馈喂给模型，最强的模型反手重构底层的算力基础设施，更便宜高效的算力再吸引更庞大的调用。\n这三个齿轮咬合在一起，才把大模型推向了极速时代。\n当 Token 生成速度拔高 10 到 14 倍，当计算的延迟逼近人类大脑的单线程心流，单机笔记本电脑的性能上限被瞬间击穿。\n算力的瓶颈不再是模型生成得有多慢，变成了网络请求和工具调用的物理开销。\n真正的技术代差，从来不在谁在公关稿里宣布了多大的模型参数。\n在于谁先让模型学会了优化自己的身体，然后把省下来的每一个美分，以最快的速度变成砸向对手的白菜价智能。\n只有当智能开始自举，算力才会真正像水和电一样，漫进每一个普通人的生活里。","category":"科技","score":null,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-08-30 21:53:54","created_at":"2026-08-30 21:53:54","url":"https://mubeitech.com/p/mb-20260830-a41049","markdown_url":"https://mubeitech.com/p/mb-20260830-a41049/markdown"},{"rank":3,"id":"2041793699223322657","account":"mubei","brand":"@mubei","title":"你觉得手里的 ChatGPT 越来越笨。 恭喜，你的直觉是对的。 OpenAI、Google、Anthropic 正在共…","summary":"你觉得手里的 ChatGPT 越来越笨。 恭喜，你的直觉是对的。 OpenAI、Google、Anthropic 正在共用同一套剧本。 数据图表直接揭了底。 新模型发布的第一天，智力水平处于 100% 的绝对巅峰。 接着就是漫长的“放血”。 几个月内，感知能力曲线一路平滑下跌，掉…","body":"你觉得手里的 ChatGPT 越来越笨。\n恭喜，你的直觉是对的。\n\nOpenAI、Google、Anthropic 正在共用同一套剧本。\n数据图表直接揭了底。\n新模型发布的第一天，智力水平处于 100% 的绝对巅峰。\n接着就是漫长的“放血”。\n几个月内，感知能力曲线一路平滑下跌，掉到 60% 左右的谷底。\n\n为什么要悄悄给模型降智？\n为了给下一代新品垫脚。\n把现役模型拉胯，新模型发布时才能制造出“断崖式升级”的震撼。\n用 60 分的残血，衬托 100 分的惊艳。\n\n实验室里的跑分机器测不出这种缓慢的性能缩水。\n但天天拿它干活的人，根本骗不过去。\n科技巨头的挤牙膏玩法，已经进化成了先给满管，再偷偷往外抽。","category":"其它","score":100,"translated_x_url":"https://x.com/i/status/2042501480310075876","translated_status_id":"2042501480310075876","published_at":"2026-04-10 07:14:10","created_at":"2026-04-10T09:13:21.688341","url":"https://mubeitech.com/p/2041793699223322657","markdown_url":"https://mubeitech.com/p/2041793699223322657/markdown"},{"rank":4,"id":"2059986678262235405","account":"mubei","brand":"@mubei","title":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。 他…","summary":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。 他说，过去三年，底层技术大体按他的预期前进。 模型从聪明高中生，走到聪明大学生，再走到开始做 PhD 和专业工作的水平。 在代码领域，甚至已经越过这个线。 真正让…","body":"Anthropic CEO Dario Amodei 最意外的事，是公众还没意识到 AI 指数曲线快跑到最后一段了。\n\n他说，过去三年，底层技术大体按他的预期前进。\n模型从聪明高中生，走到聪明大学生，再走到开始做 PhD 和专业工作的水平。\n在代码领域，甚至已经越过这个线。\n\n真正让他惊讶的，是外面的人还在吵同一批旧政治议题。\n新剧集。\n新表情包。\n明星互撕。\n选举新闻。\n人类历史级别的生产力迁移，反而像背景噪音一样被滑过去。\n\n他的底层判断很朴素。\n早在 2017 年，GPT-1 刚出来时，他写过一个想法，叫 Big Blob of Compute Hypothesis。\n大意是，别太迷信聪明技巧。\n真正长期起作用的，是几件笨东西。\n\n原始算力有多少。\n数据量有多少。\n数据分布够不够广。\n训练时间够不够长。\n目标函数能不能一路扩展。\n数值稳定性能不能撑住那团巨大的计算流。\n\n这套逻辑，后来在预训练 scaling law 里跑通了。\n现在 Anthropic 看到，RL 也在走类似路线。\n先在数学竞赛题上训练。\n再扩到代码。\n再扩到更多任务。\n模型能力会随着训练时间呈现近似对数线性提升。\n\n有人质疑，这不像人类学习。\n人类不用看几万亿个 token，也不用烧掉几十亿美元算力，才会用 Excel、PowerPoint、浏览器。\n如果 AI 真有人的学习核心，为什么还要建这么多强化学习环境？\n\nDario 的回答有意思。\n这个谜题存在，但可能没那么致命。\n人脑出生时已经带着进化给的先验。\n语言模型从随机权重开始，像一张更空的白纸。\n\n所以预训练和 RL，更像夹在人类进化与人类学习之间的一层东西。\n模型先用天量数据长出先验。\n再靠长上下文，在具体任务里快速适应。\n当上下文长度到一百万级别时，推理成本成了主要阻碍，学习能力本身已经开始显形。\n\n这就是很多人低估 AI 的地方。\n他们以为差距在于知道哪个工具火。\n真正的差距在于，谁已经把工具嵌进工作流，谁还把它当搜索框、玩具、聊天窗口。\n\n大多数人只用了 10%。\n少数人正在把 100% 的工作方式重写一遍。\n\n下一轮阶层分化，未必先发生在公司估值表里。\n它会先发生在同一间办公室里，发生在两个看似职位相同的人之间。\n一个人在操作软件。\n另一个人在调度计算。","category":"其它","score":100,"translated_x_url":null,"translated_status_id":null,"published_at":"2026-05-28 16:01:27","created_at":"2026-05-28T17:58:23.017496","url":"https://mubeitech.com/p/2059986678262235405","markdown_url":"https://mubeitech.com/p/2059986678262235405/markdown"},{"rank":5,"id":"2079985963862786352","account":"mubei","brand":"@mubei","title":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编…","summary":"4到6个月后，没人再去死磕提示词了。 Anthropic内部，80%的工程师已经切到了自改进循环。 他们现在玩什么？ 编排图（Graph），用图来协调那些能自我进化的Agent。 AI的干活方式，正在经历一次底层的工程演变。 退回2024年初，Opus 3时代。 模型顶多能自主干…","body":"4到6个月后，没人再去死磕提示词了。\nAnthropic内部，80%的工程师已经切到了自改进循环。\n他们现在玩什么？\n编排图（Graph），用图来协调那些能自我进化的Agent。\n\nAI的干活方式，正在经历一次底层的工程演变。\n退回2024年初，Opus 3时代。\n模型顶多能自主干10到20分钟。\n这种“短上下文协作”，人类必须死死盯着，一行行喂指令。\n\n后来，同步代码Agent（比如Claude Code）出来了。\n它能自己跑大概一小时。\n一小时听着不错。\n但在本地跑，一旦遇到报错，它马上掉头回来找你哭。\n\n想让它跑十个小时？甚至几天？\n这就得靠异步自改进Agent。\n怎么搞？\n第一步，把“大脑”和“双手”劈开。\n双手是执行容器，死了就死了；大脑是一个无状态进程，只管把进度写进追加日志。\n容器崩溃，任务一分一秒都不会丢。\n\n第二步，给它配一个冷酷的独立验证器。\n以前让AI边干活边给自己打分，它经常陷入幻觉，疯狂肯定自己。\n现在，把验证切进另一个独立的上下文窗口。\n一边建，一边测，死循环，直到通过验证才准许输出。\n\n第三步：让AI“做梦”。\n执行长任务时，AI会把过程写进短时记忆，但这种记忆极其短视。\n玩宝可梦时，模型记错了一个没用的细节，导致它一次次掉进同一个陷阱。\n怎么救？靠离线的“做梦”机制。\n在后台洗一遍记忆，踢掉局部最优的废数据，沉淀出正确的长期记忆。\n醒来再跑，它精准绕开了陷阱。\n\n当异步Agent足够聪明，最后一步就是Graph编排。\n把它们连成一张网。\n不再是你电脑里的私人小助手，而是接入全公司数据的组织级大脑。\n新人入职第一天就能用，它甚至能主动跳出来警告你别踩别人的坑。","category":"其它","score":null,"translated_x_url":"https://x.com/i/status/2080182625759568045","translated_status_id":"2080182625759568045","published_at":"2026-07-23 06:08:29","created_at":"2026-07-23T08:01:16+02:00","url":"https://mubeitech.com/p/2079985963862786352","markdown_url":"https://mubeitech.com/p/2079985963862786352/markdown"}]}