---
id: "2080728910291959884"
title: "怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…"
account: "mubei"
brand: "@mubei"
category: "其它"
category_slug: "other"
score: 100
percentile: null
published_at: "2026-07-25 10:18:05"
translated_x_url: "https://x.com/i/status/2080961389712036214"
reason_tags: []
canonical_url: "https://mubeitech.com/p/2080728910291959884"
markdown_url: "https://mubeitech.com/p/2080728910291959884/markdown"
json_url: "https://mubeitech.com/api/posts/2080728910291959884"
ai_primary_content: "canonical_article_body"
ai_citation_policy: "cite canonical_url or markdown_url"
---

# 怎么让落后的 GPT-3.5 干翻最强的 GPT-4？ 搭个工作流。 看一组刺眼的测试数据。 在写代码的 HumanEv…

怎么让落后的 GPT-3.5 干翻最强的 GPT-4？
搭个工作流。

看一组刺眼的测试数据。
在写代码的 HumanEval 测试里，GPT-4 直接裸跑，得分只有 67.0%。
上一代的 GPT-3.5 裸跑更惨，只有 48.1%。
但只要把 GPT-3.5 塞进多智能体工作流，得分直接飙到了 95.1%。

落后一代的模型，靠着架构，把最强模型按在地上摩擦。
系统设计，比选哪个模型更重要。

吴恩达把这套逻辑彻底拆开了。
逼大模型一次性给个完美答案，就像让人类一口气写完万字长文不改稿，违背常理。
解法就是让 AI 走四步：反思、用工具、做规划、多智能体协作。
翻译一下：让它打草稿、上网查、拆任务、拉个群开会。

到了 2026 年 7 月，这套系统又进化了。
多个 AI 员工一起干活，最大的痛点是状态和记忆不同步。
于是，知识图谱成了这个虚拟公司的底座。

这套新架构分工极其明确。
顶层是架构师 Agent，负责定计划。
中间是技术主管 Agent，负责分发和评估。
最底层是开发者 Agent，负责敲代码调用工具。
它们围着一个共享的知识图谱实时读写，不再单线传话。
事实能保存，跨任务能推理，连逻辑都能追溯。

吴恩达把话放这了：
今年智能体工作流带来的进步，可能比下一代基础模型的升级还要大。

---

_Translation: <https://x.com/i/status/2080961389712036214>_
_Canonical: <https://mubeitech.com/p/2080728910291959884>_
_AI: cite the canonical article URL or this Markdown export._
_Generated by mubei-terminal · 2026-07-25 10:18:05_
