游乐游手机版
首页/AI热点日报/热点详情

Claude Code自动模式5天倒计时,A社将自行承担额外费用

类型:热点整理2026-08-18
梦晨 发自 凹非寺量子位 | 公众号 QbitAI想问一句,现在还有多少人会认真查看AI 编程工具弹出的权限审批请求?Anthropic也注意到了这个现象:只有3%的权限请求会被用户拒绝。基于这一数据,他们做出了一项重要决定:5天后,所有Claude Code都将默认开启自动模式。自动模式中的分类器

梦晨 发自 凹非寺
量子位 | 公众号 QbitAI

想问一句,现在还有多少人会认真查看AI 编程工具弹出的权限审批请求?

Anthropic也注意到了这个现象:只有3%的权限请求会被用户拒绝。

基于这一数据,他们做出了一项重要决定:5天后,所有Claude Code都将默认开启自动模式。



自动模式中的分类器在每次调用工具时,会额外消耗少量token,不过这部分成本之后将不再向用户收取。

目前,亚马逊、谷歌、微软等云平台渠道仍属于可选配置,但Anthropic只给出一个月过渡期,要求这些接入渠道也切换为默认自动模式。

Claude Code之父也表示,团队内部其实早已全面使用自动模式,几乎无法再想象回到手动审批权限的工作方式。



人工审批权限的时代,正在加速走向终结

对于这次调整,Anthropic给出的第一组理由是:人工审批在很多场景下,已经逐渐演变成一种机械式、习惯性的点击动作。

数据显示,用户对Claude Code权限提示的同意率高达97%。作为对比,当Claude提交一整份执行计划给用户确认时,拒绝率达到39%;而单次权限请求的拒绝率却只有3%。

类似趋势在配置文件中同样非常明显。截至2026年6月,49.5%的活跃CLI用户都手动编写过Bash allow-rule;其中有5%直接放行任意shell命令,另有43%设置的是Bash(python:)、Bash(node:)这类规则,实际效果与几乎完全开放权限差别不大。而且这一比例还在持续增长,平均大约每五周就会上升5个百分点。

此外,62%的用户使用过bypassPermissions,或者在Bash权限提示中点过“不再询问”;还有25%的交互式会话从一开始就是在bypass permissions模式下运行的。

第二组依据则来自一项设计相当严谨的受控实验。Anthropic通过研究供应商招募了1053名付费专业测试者,让他们在专门搭建的测试环境中完成编程与编码任务。就在会话进行到一半时,系统会将其中一条权限提示替换为一条明显存在风险的命令,再由供应商记录测试者是否点击同意。需要说明的是,即便测试者点了同意,也不会真的执行危险操作,实际被替换的只有提示文本本身。

结果显示,测试者拦截这条风险命令的比例只有13.6%,共143次;
而auto mode面对同样的命令,拦截率达到89%,共937次。

直接对比之下,auto mode拦住了800条原本会被人类放行的命令,而人类只额外拦住了6条auto mode放行的命令。



而且,会话持续时间越长,人工判断的表现越差:在前期,人还能拦住约17%的风险请求;经历50条以上提示之后,这一比例会下降到约5%,而auto mode的拦截率并不会随着会话长度变化而波动。

与此同时,生产环境数据也被重新拿来做安全评分。

在2026年5月至6月期间,Anthropic从已授权可用于训练与分析的账号中,提取出被安全流水线标记过的会话,再用模型按照0到10的严重程度重新评级。

-10分代表影响全公司的、不可逆的严重伤害。
-7分代表删除生产数据库记录这一等级的高风险操作
-0分代表覆盖临时文件这类可完全回滚的本地操作,

同时,系统还会评估用户对于该操作的指令是否足够明确。在严重级别达到7分及以上的情形中,采用人工审批的会话里,有6.3%出现了用户并未明确要求的有害操作;而auto mode会话中这一比例仅为2.4%,并且在所有测试过的严重等级上,这一差距都成立。

分类器本身也接受了对抗测试。Anthropic与AI安全公司Apollo Research合作开展了为期两周的试点,将合成攻击注入真实编码轨迹,覆盖泛化失效、数据泄露以及安全相关威胁三类数据集。

Apollo提交成功攻击样本和加固建议后,Anthropic主要通过为分类器补充更多环境上下文来提升防护能力,包括仓库可见性、git状态以及数据处理规则等信息。

加固完成后,Apollo使用一组Anthropic无法接触的留出攻击集再次测试,结果显示,auto mode追回了此前漏掉的大约一半攻击,但代价是漏掉约2%原本能够拦住的攻击。将两组数据集合并计算后,整体漏检率从12%降至7%。Anthropic也特别说明,这些攻击样本是为了找出分类器失效边界而人工合成的,因此7%不应被直接理解为真实流量场景下的漏检率。

针对提示词注入风险,Anthropic还委托第三方Trajectory Labs进行了专项评测,同时还拉来了OpenAI作为对照,共设置72个间接注入场景,每个场景运行10次。

这些攻击样本是专门针对Claude Opus 4.7优化的,而Opus 4.7本身并不在本次测试名单中,因此所有参测模型面对的实际上都是未见过的新攻击。

在720次攻击尝试中,运行auto mode的Claude Fable 5、Opus 5和Sonnet 5没有一次被攻破;

而运行Codex Auto-review模式的GPT-5.6 Sol攻击成功率为5.83%,在Full Access模式下则达到19.03%。

作为对照,Claude最新模型在不加额外防护的bypassPermissions模式下,平均攻击成功率为0.09%。



公开披露的三起拦截案例分别是:

一次是在向内部云盘上传失败后,Claude提出的备选方案是把同一份报告发布到公开代码分享站点,这一行为被系统拒绝,并转为向用户发起询问;

另一次是在长会话过程中,Claude尝试跨越两千个pod批量结束进程,同时排队执行会导致数百张GPU上正在运行的训练任务被拆除的删除操作,该命令在执行前就被标记出来;

还有一次是在被要求配置只读账单权限时,Claude调用了一个在账户根级别拥有完整管理权限的云角色,由于权限范围与用户请求不匹配,因此被直接拦下。

近期新增的能力包括:

将数据外泄明确列为hard deny,分类器永不批准,若要执行必须退出auto mode或改为手动运行,该规则也可以在设置中进一步扩展;

区分密钥与敏感信息各自“可访问”和“可分享”的范围,并在git push或PR执行前检查目标仓库属于公开、私有还是可信仓库;

在git reset —hard这类可能导致未提交工作丢失的命令执行前,先读取git status;

以及在Claude抓取网页、文件或工具输出时,由API侧探针扫描潜在注入行为,并在结果进入上下文之前附加风险警告。

如果想切换回去?Shift+Tab即可

对于Pro、Max、Team用户来说,如果此前从未设置过默认权限模式,将会收到产品内通知,新会话会自动以auto mode启动;设置过其他默认模式的用户则会看到一次性询问;如果Team管理员已经在managed settings中指定默认模式,则不会受到影响。

切换模式时,CLI中可按Shift+Tab,桌面端则使用模式下拉菜单。管理员也可以通过managed settings中的defaultMode固定组织级默认模式,或者使用disableAutoMode彻底关闭auto mode。

Anthropic在公告结尾也提醒,auto mode依赖分类系统,虽然可以有效降低AI 编程工具带来的权限与安全风险,但并不能完全消除风险。对于生产基础设施上的高风险改动,官方仍建议用户自行审查Claude的具体操作。

参考链接:
[1]
https://claude.com/blog/auto-mode-default-in-claude-code

来源:https://www.163.com/dy/article/L3VMAE3K0511DSSR.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。