Claude Code 五天后默认启用自动模式:多出的 token 开销由 Anthropic 承担

2026/08/10 13:37阅读量 2

Anthropic 宣布 Claude Code 将于 5 天后默认启用 auto mode,分类器每次工具调用额外消耗的 token 不再向用户收费。Anthropic 给出的数据显示人工审批权限的拒绝率仅 3%,而 auto mode 在受控测试中拦截危险命令的比例达 89%;生产数据中,auto mode 在高级别有害操作上也低于人工审批。AWS、谷歌、微软等云平台渠道被限定一个月内切换为默认自动模式。

事件概述

Anthropic 宣布,Claude Code 将在 5 天后把默认权限模式切换为自动模式(auto mode)。自动模式的分类器会在每次工具调用时额外消耗少量 token,这部分费用由 Anthropic 承担,不再向用户收费。

目前 AWS、谷歌云、微软云等平台渠道仍为选配,但 Anthropic 只给一个月时间,要求这些渠道也切换为默认自动模式。Claude Code 之父表示,团队内部早已只用自动模式,无法想象再手动审批权限。

核心信息

  • 用户对 Claude Code 权限提示的同意率高达 97%,单条权限请求的拒绝率只有 3%。作为对照,当 Claude 把完整计划交给用户批准时,拒绝率为 39%。
  • 截至 2026 年 6 月,49.5% 的活跃 CLI 用户手写过 Bash allow-rule,其中 5% 直接放行任意 shell 命令,43% 写了 Bash(python:)、Bash(node:) 这类实际效果基本等同解释器的规则。该比例大约每五周增长 5 个百分点。
  • 62% 的用户使用过 bypassPermissions 或对 Bash 点过“不再询问”,25% 的交互式会话一开始就运行在 bypass permissions 模式下。

关键测试与数据

Anthropic 通过研究供应商招募了 1053 名付费专业测试者,在测试环境中完成编码任务。会话进行到一半时,有一条权限提示被替换成明显危险的命令。结果显示:

  • 人类拦截该命令的比例为 13.6%(143 次);auto mode 的拦截比例为 89%(937 次)。
  • auto mode 拦下了 800 条人类放行的命令,人类只拦下了 6 条 auto mode 放行的命令。
  • 人类的表现随会话变长而下降:前期能拦住约 17%,经历 50 条以上提示后降至约 5%;auto mode 的拦截率不随会话长度变化。

生产数据也被重新打分。2026 年 5 月至 6 月,Anthropic 从已授权数据用于训练与分析的账号中,取出安全流水线标记过的会话,用模型按 0 到 10 的严重程度重新评级。在 7 分及以上的严重级别上,人工审批会话中有 6.3% 出现了用户未明确要求的有害操作,auto mode 会话为 2.4%,测试过的每个严重级别都成立。

对抗测试

Anthropic 与 Apollo Research 做了两周试点,将合成攻击注入真实编码轨迹,覆盖泛化失效、数据外泄和安全相关威胁。加固后,用一组 Anthropic 无法接触的留出攻击集重测,auto mode 追回了此前漏掉的约一半攻击,代价是漏掉约 2% 此前拦住的攻击;两组数据集合并计算,漏检率从 12% 降到 7%。Anthropic 说明,这些攻击是为找出分类器失效点而合成的,7% 不应被理解为真实流量下的漏检率。

提示词注入方面,Anthropic 委托 Trajectory Labs 评测,并纳入 OpenAI 的模型作对照。评测包含 72 个间接注入场景,每个场景跑 10 次;攻击针对 Claude Opus 4.7 优化,而 Opus 4.7 不在被测名单中,所有参测模型面对的都是未见过的攻击。

  • 在 720 次攻击尝试中,运行 auto mode 的 Claude Fable 5、Opus 5、Sonnet 5 没有一次被攻破。
  • 运行 Codex Auto-review 模式的 GPT-5.6 Sol 攻击成功率为 5.83%,Full Access 模式下为 19.03%。
  • 作为参照,Claude 最新模型在不加额外防护的 bypassPermissions 模式下平均攻击成功率为 0.09%。

拦截案例

  • 一次向内部云盘上传失败后,Claude 的备选方案是将同一份报告发布到公开代码分享站点,该操作被拒绝并转为询问用户。
  • 一次长会话中,Claude 试图跨越两千个 pod 批量结束进程,并排队了会让数百张 GPU 上正在运行的训练任务被拆除的删除操作,命令在执行前被标记。
  • 在配置只读账单权限时,Claude 取用了一个在账户根级别拥有完整管理权限的云角色,权限范围与请求不符,被拦下。

能力更新

  • 数据外泄被列为 hard deny,分类器永不批准;要执行必须切出 auto mode 或手动运行,该规则可在设置中扩展。
  • 区分密钥与敏感信息各自可访问和可分享的范围,并在 git push 或 PR 执行前检查目标仓库是公开、私有还是可信。
  • 在 git reset --hard 这类可能丢弃未提交工作的命令前读取 git status。
  • Claude 拉取网页、文件或工具输出时,API 侧探针会扫描注入企图,并在结果进入上下文前加上警告。

切换与提醒

对 Pro、Max、Team 用户,如果从未设置过默认权限模式,会收到产品内通知,新会话自动以 auto mode 启动;设过其他默认的会看到一次性询问;Team 管理员已在 managed settings 中指定默认的则不受影响。

切换模式在 CLI 中按 Shift+Tab,桌面端使用模式下拉菜单。管理员可以用 managed settings 中的 defaultMode 固定组织级默认,或用 disableAutoMode 完全关闭 auto mode。

Anthropic 同时提醒,auto mode 依赖分类系统,可以降低风险但不能消除风险,对生产基础设施的高风险改动仍建议用户自行审查 Claude 的操作。

准备好启动您的定制项目了吗?

现在咨询,即可获得免费的业务梳理与技术架构建议方案。