{"id":"mb-20260830-2b7003","kind":"deep","title":"用 AI 写代码最荒谬的现状：模型一秒钟吐出代码，工程师花三个小时替它排错","summary":"用 AI 写代码最荒谬的现状：模型一秒钟吐出代码，工程师花三个小时替它排错","body":"用 AI 写代码最荒谬的现状：模型一秒钟吐出代码，工程师花三个小时替它排错。\n\n同样用 Claude Code，有人天天在命令行里给模型当全职保姆。\nAnthropic 内部却把新工程师的技术上手周期，从三周直接压到了两天。\n负责该项目的 Boris Cherny，一个人常年并行跑着五个独立的开发终端。\n根据他在内部实测的数据，改变工作流之后，交付质量直接拉开两到三倍的差距。\n\n交付质量差三倍的根源，不在模型的智力，也不在提示词写得有多长。\n核心分水岭只有四个字：闭环校验。\n\n绝大多数人使用 AI 编程，本质上都在做开环控制。\n你输入一段自然语言需求，模型根据概率生成一段代码。\n代码对不对？有没有边界漏洞？能不能跑通？\n全不知道。\n你必须肉眼通读代码，复制进编辑器，手动执行编译，发现报错，再把报错信息截图粘回对话框。\n在这个链条里，工程师肉身充当了编译报错器和人肉测试机。\n只要模型漏掉一个括号或改错一个变量名，人类的注意力就被强行打断一次。\n这种人机协作不仅没有解放生产力，反而把人类锁死在了最高频、最琐碎的纠错泥潭里。\n\nBoris 跑通的逻辑刚好反过来。\n他从不假设模型能一次写出正确的代码。\n他的核心原则是：验证优于提示。\n与其花半个小时雕琢一段完美的提示词，不如花三分钟给模型搭一套具备自我证伪能力的验收支架。\n\n这套支架通常由三层闭环构成：\n第一层是类型检查与代码规范的静态门禁。\n第二层是自动化单元测试与集成测试套件。\n第三层是用无头浏览器截取界面渲染图与抓取运行日志。\n\n在这套结构里，模型写完代码的第一件事绝不是交卷。\n它必须在本地沙箱中自动触发测试套件，调起浏览器检查页面元素，捕捉控制台的每一条异常。\n测试挂了，报错信息不需要人类过目，直接作为反馈输入重新喂给模型。\n它自己解析堆栈信息，自己定位源文件，自己修正业务逻辑，然后再次触发测试。\n这个过程在沙箱内部高速循环，直到所有断言全部变绿、界面渲染完全符合预期，它才会把最终结果呈现在终端上。\n\n这就是闭环自校验的威力。\n它把过去需要反复打断人类的微小排错，全部下放给机器在内部自生自灭。\n\n当排错不再依赖人类实时盯盘，工程吞吐量就迎来了质变。\n你不需要坐在屏幕前当监工。\n你可以借助 Git Worktree，把同一个代码仓库拆解成五个相互隔离的物理工作区。\n终端 A 负责底层数据库迁移与表结构优化。\n终端 B 负责重构后端鉴权逻辑。\n终端 C 负责编写前端交互组件。\n终端 D 负责补齐边缘情况的端到端测试。\n终端 E 负责审查全部修改的代码差异。\n五个实例在各自的沙箱里独立运转，自己编码、自己运行、自己修错。\n\nAnthropic 能够把三周的入职周期压缩到两天，也是同一个道理。\n新员工进入庞大的老代码库，不再需要到处找资深架构师询问历史背景。\n模型会自主读取历史提交记录和关联议题，调用预设的本地测试流水线自主验证。\n把原本依赖人传人的经验体系，直接沉淀成了可自动化执行的上下文规则。\n\n工程师的专业定位，在这个节点上发生了一次彻底的位移。\n低效的开发者还在苦练提示词咒语，试图用玄学语言驯服一个统计模型。\n高效的架构师已经坐上了裁判席，专心编写不可妥协的测试用例、静态约束与评测基准。\n\nAI 编程的真正分水岭，从来不由生成速度决定。\n它的上限，取决于你在周围搭了多厚的验证支架，以及能不能用一套冰冷的测试链条，逼着模型在失控前自己纠偏到底。","topic":"用 AI 写代码最荒谬的现状：模型一秒钟吐出代码，工程师花三个小时替它排错","frame_type":["闭环自校验与支架工程","机制"],"citations":[],"channel_note":"","identity_notice":"","source_type":"generated","status":"published","generated_at":"2026-08-30 17:45:42","legal_anchor_count":0,"transcript_citation_count":0}