AI 写代码时弹出的权限确认框,97% 都会被人类直接点“同意”。 既然都是无脑点,为什么不干脆让它全自动? 但真要全自…
AI 写代码时弹出的权限确认框,97% 都会被人类直接点“同意”。 既然都是无脑点,为什么不干脆让它全自动? 但真要全自动,怎么防着 AI 突然发疯,把服务器给删了?
Claude Code 最近把“自动模式(Auto Mode)”设成了默认项。 它的解法很有意思。 它没有让 Claude 自己审查自己。 那相当于程序员自己写代码、自己审查、自己合并,肯定会夹带私货。
它在旁边单设了一个铁面无私的“分类器”。 这个分类器只看两样东西:你的原始指令,和 AI 接下来打算调用的工具。 它刻意“蒙住”了自己的眼睛:绝对不看 AI 的推理过程,不看 AI 的回复,也不看工具的输出结果。 为什么? 为了防止被 AI 的花言巧语带偏。 它只做一件事:死死盯住 AI 的动作,看它有没有超出你最初的意图。 比如,你明明只让它“清理本地文件”,它却试图去删远程分支? 直接拦截。
被拦了之后呢? AI 会自己找台阶下。 比如强行推送到主分支被拒,它会试着改推到一个新分支。 如果连续碰壁,它才会老老实实暂停,把你叫回来手动批准。
更难防的是什么? 提示词注入。 如果 AI 抓取的网页或读的文件里,藏着别人写好的恶意指令怎么办? 这里它用了两道闸。 内容进入 AI 上下文之前,服务端的“探针”会先扫一遍。 发现隐藏指令,直接打上“可疑”标签,警告 AI 不要轻信。 紧接着,就算 AI 真被忽悠瘸了,分类器还在最后一道关口盯着它的实际动作。 只要动作和你的原始指令不符,照样卡死。 测试数据显示,开了这两层防御,提示词注入攻击的成功率降到了零。
为了不影响写代码的速度,它还做了分级。 像搜代码库、改本地文件这种随时能撤销的操作,直接免检放行。 只有跑终端命令、抓取外部网页这些高危动作,才会送去审查。
系统默认只信任当前工作目录和 Git 远程库。 如果你想让它碰公司的云存储或内部服务,直接用大白话写进配置里。 哪里能碰,哪里得问,哪里绝对不能碰,划好线再让它跑。