{"id":"2080728910291959884","account":"mubei","brand":"@mubei","title":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…","summary":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEval 测试里，GPT-4 直接裸跑，得分只有 67.0%。 上一代的 GPT-3.5 裸跑更惨，只有 48.1%。 但只要把 GPT-3.5 塞进多智能体工作流…","body":"怎么让落后的 GPT-3.5 干翻最强的 GPT-4？\n搭个工作流。\n\n看一组刺眼的测试数据。\n在写代码的 HumanEval 测试里，GPT-4 直接裸跑，得分只有 67.0%。\n上一代的 GPT-3.5 裸跑更惨，只有 48.1%。\n但只要把 GPT-3.5 塞进多智能体工作流，得分直接飙到了 95.1%。\n\n落后一代的模型，靠着架构，把最强模型按在地上摩擦。\n系统设计，比选哪个模型更重要。\n\n吴恩达把这套逻辑彻底拆开了。\n逼大模型一次性给个完美答案，就像让人类一口气写完万字长文不改稿，违背常理。\n解法就是让 AI 走四步：反思、用工具、做规划、多智能体协作。\n翻译一下：让它打草稿、上网查、拆任务、拉个群开会。\n\n到了 2026 年 7 月，这套系统又进化了。\n多个 AI 员工一起干活，最大的痛点是状态和记忆不同步。\n于是，知识图谱成了这个虚拟公司的底座。\n\n这套新架构分工极其明确。\n顶层是架构师 Agent，负责定计划。\n中间是技术主管 Agent，负责分发和评估。\n最底层是开发者 Agent，负责敲代码调用工具。\n它们围着一个共享的知识图谱实时读写，不再单线传话。\n事实能保存，跨任务能推理，连逻辑都能追溯。\n\n吴恩达把话放这了：\n今年智能体工作流带来的进步，可能比下一代基础模型的升级还要大。","category":"其它","score":100,"percentile":null,"reason_tags":[],"translated_x_url":"https://x.com/i/status/2080961389712036214","translated_status_id":"2080961389712036214","published_at":"2026-07-25 10:18:05","created_at":"2026-07-25T12:16:10.252442"}