其它·via @mubei·100.0

怎么让落后的 GPT-3.5 干翻最强的 GPT-4? 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…

怎么让落后的 GPT-3.5 干翻最强的 GPT-4? 搭个工作流。

看一组刺眼的测试数据。 在写代码的 HumanEval 测试里,GPT-4 直接裸跑,得分只有 67.0%。 上一代的 GPT-3.5 裸跑更惨,只有 48.1%。 但只要把 GPT-3.5 塞进多智能体工作流,得分直接飙到了 95.1%。

落后一代的模型,靠着架构,把最强模型按在地上摩擦。 系统设计,比选哪个模型更重要。

吴恩达把这套逻辑彻底拆开了。 逼大模型一次性给个完美答案,就像让人类一口气写完万字长文不改稿,违背常理。 解法就是让 AI 走四步:反思、用工具、做规划、多智能体协作。 翻译一下:让它打草稿、上网查、拆任务、拉个群开会。

到了 2026 年 7 月,这套系统又进化了。 多个 AI 员工一起干活,最大的痛点是状态和记忆不同步。 于是,知识图谱成了这个虚拟公司的底座。

这套新架构分工极其明确。 顶层是架构师 Agent,负责定计划。 中间是技术主管 Agent,负责分发和评估。 最底层是开发者 Agent,负责敲代码调用工具。 它们围着一个共享的知识图谱实时读写,不再单线传话。 事实能保存,跨任务能推理,连逻辑都能追溯。

吴恩达把话放这了: 今年智能体工作流带来的进步,可能比下一代基础模型的升级还要大。

翻译视频 / X

导出 / EXPORT