{"id":"2086844755770757531","account":"mubei","brand":"@mubei","title":"AI 写代码时弹出的权限确认框，97% 都会被人类直接点“同意”。 既然都是无脑点，为什么不干脆让它全自动？ 但真要全自…","summary":"AI 写代码时弹出的权限确认框，97% 都会被人类直接点“同意”。 既然都是无脑点，为什么不干脆让它全自动？ 但真要全自动，怎么防着 AI 突然发疯，把服务器给删了？ Claude Code 最近把“自动模式（Auto Mode）”设成了默认项。 它的解法很有意思。 它没有让 C…","body":"AI 写代码时弹出的权限确认框，97% 都会被人类直接点“同意”。\n既然都是无脑点，为什么不干脆让它全自动？\n但真要全自动，怎么防着 AI 突然发疯，把服务器给删了？\n\nClaude Code 最近把“自动模式（Auto Mode）”设成了默认项。\n它的解法很有意思。\n它没有让 Claude 自己审查自己。\n那相当于程序员自己写代码、自己审查、自己合并，肯定会夹带私货。\n\n它在旁边单设了一个铁面无私的“分类器”。\n这个分类器只看两样东西：你的原始指令，和 AI 接下来打算调用的工具。\n它刻意“蒙住”了自己的眼睛：绝对不看 AI 的推理过程，不看 AI 的回复，也不看工具的输出结果。\n为什么？\n为了防止被 AI 的花言巧语带偏。\n它只做一件事：死死盯住 AI 的动作，看它有没有超出你最初的意图。\n比如，你明明只让它“清理本地文件”，它却试图去删远程分支？\n直接拦截。\n\n被拦了之后呢？\nAI 会自己找台阶下。\n比如强行推送到主分支被拒，它会试着改推到一个新分支。\n如果连续碰壁，它才会老老实实暂停，把你叫回来手动批准。\n\n更难防的是什么？\n提示词注入。\n如果 AI 抓取的网页或读的文件里，藏着别人写好的恶意指令怎么办？\n这里它用了两道闸。\n内容进入 AI 上下文之前，服务端的“探针”会先扫一遍。\n发现隐藏指令，直接打上“可疑”标签，警告 AI 不要轻信。\n紧接着，就算 AI 真被忽悠瘸了，分类器还在最后一道关口盯着它的实际动作。\n只要动作和你的原始指令不符，照样卡死。\n测试数据显示，开了这两层防御，提示词注入攻击的成功率降到了零。\n\n为了不影响写代码的速度，它还做了分级。\n像搜代码库、改本地文件这种随时能撤销的操作，直接免检放行。\n只有跑终端命令、抓取外部网页这些高危动作，才会送去审查。\n\n系统默认只信任当前工作目录和 Git 远程库。\n如果你想让它碰公司的云存储或内部服务，直接用大白话写进配置里。\n哪里能碰，哪里得问，哪里绝对不能碰，划好线再让它跑。","category":"其它","score":100,"percentile":null,"reason_tags":[],"translated_x_url":"https://x.com/i/status/2086967220945420454","translated_status_id":"2086967220945420454","published_at":"2026-08-10 21:38:04","created_at":"2026-08-10T23:36:04.025072"}