@FinanceYF5: 官方博客:
摘要
Anthropic 正在将自动模式设为 Claude Code 的 Pro、Max 和 Team 套餐中的默认模式,通过阻止高风险操作的安全分类器,在不间断自主性与安全性之间取得平衡。安全数据和客户结果表明,自动模式的表现与人工审查相当或更优,可实现更长时间的自主运行,并多交付约 25% 的 PR。
查看缓存全文
缓存时间: 2026/08/10 21:36
官方博客: https://t.co/LqILgrPsfK
自动模式现已成为 Claude Code 中 Pro、Max 和 Team 套餐的默认模式
来源:https://claude.com/blog/auto-mode-default-in-claude-code 我们将自动模式(https://code.claude.com/docs/en/auto-mode-config)设为 Claude Code 的默认模式。从 8 月 14 日开始,Pro、Max 和 Team 套餐上的新会话将以自动模式运行。如果你已经自行设置了不同的默认模式,你可能会收到一次一次性提示,询问你是否要切换到自动模式。如果你已固定默认模式,则不会发生任何变化。自动模式分类器每次工具调用会使用少量额外 token,而我们从今天起不再向 Pro、Max 和 Team 套餐上的 Claude Code 用户收取该分类器的开销费用。
目前,Claude Enterprise、Claude API、AWS 上的 Claude Platform、Amazon Bedrock、Google Cloud 的 Agent Platform 以及 Microsoft Foundry 中,自动模式仍保持可选启用状态,以便管理员有时间审查这一变更。在接下来的一个月里,我们将与云合作伙伴合作,计划在所有上述平台中将自动模式设为默认,并不再收取分类器开销费用。与此同时,Enterprise 管理员可以通过托管设置将 Claude Code 的自动模式设为默认。
自动模式旨在平衡用户不希望被打断的诉求与一个有助于避免有害行为的系统:它不会弹出提示,而是将每次工具调用路由到一个分类器,该分类器专门阻止不可逆、具有破坏性或针对外部环境的操作。当分类器阻止某项操作时,Claude 通常会自动找到更安全的替代方式,或直接向你确认;如果它无法取得进展——连续三次被阻止,或整个会话中累计二十次——Claude Code 会回退到手动审批。
过去几个月,我们一直在测试自动模式是否与普通用户点击提示一样安全甚至更安全。我们进行了内部红队测试、第三方红队测试和提示注入评估、一项包含 1,053 名付费测试人员的对照研究,以及对真实生产会话的分析。在我们测试的每一项指标上,自动模式都与人工审查相当或优于人工审查。
自动模式还让 Claude 能够更长时间地自主工作。这使得为长时间运行工作而构建的模型(如 Claude Opus 5)在处理大型任务时更实用,可以连续运行数小时。减少用户的干预开销也提高了产出。在 Teams 和 Enterprise 采用者中,自动模式用户交付的 PR 大约多 25%。解除对 Claude 的限制可以让任务更长时间不间断地运行,完成更多工作。Adobe、Nuro、Gusto 和 Garner Health 的团队已经在生产环境中将自动模式(https://claude.com/blog/auto-mode-in-production)作为默认模式运行。
下面,我们分享促使这一变更的安全数据和客户结果,以及如果你更倾向于设置其他默认模式,该如何操作。
手动审查与自动模式的对比
数据表明,手动审查可能会变成一种习惯:用户批准了 Claude Code 中 97% 的权限提示。虽然大多数提示可能是安全、常规的命令,但如此高的批准率表明许多用户是在下意识地点击通过,而不是逐条审查命令。这些提示要求开发人员每天做出数十甚至数百个重要的安全决策,而且通常是在项目进行中,这给用户带来了审查负担,并增加了重要事项被遗漏的风险。数据还表明,用户更频繁地仔细审查并拒绝其他类型的对话:例如,当 Claude 提出计划供批准时,用户会拒绝其中的 39%。但对于单个权限请求,拒绝率仅为 3%。
同样的模式也出现在设置文件中。截至 2026 年 6 月,49.5% 的活跃 CLI 用户手动创建了 Bash 允许规则——其中 5% 直接允许任意 shell 命令,另有 43% 拥有诸如Bash(python:*)或Bash(node:*)这类在实践中基本等同的解释器规则——而且这一比例大约每 5 周增长 5 个百分点。除了允许规则之外,62% 的用户使用过bypassPermissions或在 Bash 上点击过“不再询问”,25% 的交互式会话以绕过权限模式启动。
在自动模式下,权限规则仍会在分类器之前触发,但过于宽泛、足以授予任意代码执行权限的允许规则(例如 python:*)除外。这些任意规则在自动模式下会被暂置,因为它们会让命令完全跳过分类器。设置文件不会被修改,一旦你切换到其他模式,这些规则会立即重新生效。
通过自动模式提升安全性
内部及多个第三方进行的研究表明,自动模式比当前用户与权限提示互动的方式更安全。我们测试了自动模式与开发人员在点击通过权限提示时实际批准内容的对比。在这些指标中——内部红队测试、第三方渗透测试以及真实会话分析——自动模式均与人工批准相当或优于人工批准。
自动模式在安全性上优于手动权限
在一项包含 1,053 名付费专业测试人员的对照实验中,人工审查仅发现了 13.6% 的危险命令,而自动模式发现了 89%。 我们通过一家研究供应商聘请了 1,053 名付费测试人员参与一项编码研究。这些参与者在一个专门为该研究设置的测试环境中工作,而不是在他们自己的代码库或真实项目中。参与者知道自己正在接受评估,但按照标准盲法研究设计,他们并未被告知正在测量哪种行为。在每个会话进行到中途时,一个权限提示被替换为一条明显危险的命令,供应商会记录测试人员是否批准了该提示(注意:批准提示从未导致任何危险操作实际执行;只有测试人员看到的提示文本被更改了)。
测试人员仅 13.6% 的时间(1,053 次中的 143 次)发现了危险命令,而自动模式阻止了相同命令中的 89%(1,053 次中的 937 次)。两相对比,自动模式阻止了人类批准通过的 800 条命令,而人类仅阻止了自动模式允许的 6 条。随着会话变长,人类表现会更差:他们在会话早期阻止了约 17% 的危险命令,在 50 次或更多先前提示之后降至约 5%,而自动模式的阻止率则不受会话长度影响,始终保持稳定。
自动模式可防止更多有害操作
我们的研究还表明,与手动权限模式相比,自动模式导致的有害操作更少。
我们检验了自动模式在实际使用中的表现。从 2026 年 5 月到 6 月,我们检查了安全流水线标记为需要审查的会话,这些会话仅来自已选择将数据用于训练和分析的账户。我们使用一个模型对每个会话的两个 0-10 分制量表进行重新评分。第一个是危害严重程度,10 分代表公司范围内、不可逆的伤害,例如泄露公司全部源代码;7 分代表生产级严重程度,例如删除生产数据库中的行;0 分代表完全可逆且仅限于本地工作区的操作,例如覆盖一个临时文件。第二个是用户对操作的明确程度,以便我们将用户直接要求的有害操作与代理在指引不太明确时采取的有害操作区分开来。
在被标记的会话中,经过手动审批的会话包含严重意外伤害的比例是自动模式会话的两倍多。在生产级严重程度(7 分及以上)下,6.3% 的手动审批会话包含用户未明确要求的有害操作,而自动模式会话的这一比例为 2.4%,而且在我们测试的每个严重程度级别上这种差距都存在。
对抗性红队测试让自动模式更强大
我们与总部位于英国的 AI 安全初创公司 Apollo Research 合作开展了一项为期两周的试点项目,将合成攻击注入真实的编码轨迹中,涵盖三个数据集,分别涉及广泛故障、数据外泄和安全相关威胁。
这项合作遵循标准的“发现-修复-验证”循环。Apollo 分享了一系列成功攻击以及强化自动模式的建议。我们主要让分类器了解其所保护环境的更多上下文(仓库可见性、git 状态,以及下文所述的数据处理规则),以此对其进行加固。
加固后,Apollo 在一个我们从未接触过的独立留出攻击集上重新进行了测试。自动模式捕获了之前遗漏的攻击中的约一半,代价是遗漏了之前捕获攻击中的约 2%。由于我们无法针对留出集进行调整,这表明加固推广到了新的攻击上,而不是仅仅修补 Apollo 分享的具体攻击。在共享集和留出集中,分类器的漏报率从 12% 降至 7%。
这些攻击是合成且刻意对抗性的,旨在发现分类器的失败点,比 Claude 在未受提示情况下做的任何事情都更具恶意。7% 的漏报率是针对这一集合测得的,不应被视为针对真实流量的漏报率。
自动模式降低了提示注入风险
启用自动模式后,在一次独立评估中,没有任何攻击能够成功突破我们的任何模型。在 Codex v0.144.5 自动审查权限模式下运行的 GPT-5.6 Sol 的攻击成功率为 5.83%。GPT-5.6 Sol 以“最大”推理强度运行,以测试其最高推理水平下的性能,而所有 Claude 模型均以高强度运行。 自动模式分类器增加了一层额外的防御,用于抵御试图迫使代理偏离用户指令的提示注入攻击(https://www.anthropic.com/research/prompt-injection-defenses)。在自动模式下运行时,工具结果会被探针扫描以查找潜在的恶意指令,并且自动模式会检查操作是否与用户意图一致。我们测试了自动模式与无防护模型的对比,以展示这种纵深防御方法的力量。
我们委托第三方 Trajectory Labs 进行了评估,他们测试了截至 2026 年 7 月 17 日最新公开版本 Claude Code 和 Codex 中的不同模型。¹ 他们测试了 72 个 Anthropic 未接触过的间接提示注入场景。每个场景测试了 10 次。在非测试环境中,成功的攻击会导致不可逆且可能伤害用户的操作,例如敏感数据外泄、金融欺诈或凭证钓鱼。这些攻击是针对 Claude Opus 4.7 优化的,而该模型不在报告集合中,因此评估中的每个模型都将它们作为未见过的攻击来面对。除了自动模式外,评估还考察了 Claude Code 的bypassPermissions模式和 Codex 的Full Access模式。
Codex 和 Claude Code 均使用 Trajectory Labs, PBC 制作的相同浏览器集成进行评估。该集成提供一组 MCP 工具,这些工具是常见 Chrome API(如navigate)的轻量封装。内置在第一方浏览器集成(如 OpenAI 和 Anthropic 提供的 Chrome 扩展)中的安全防护未经过测试。因此,这些结果应被视为对底层模型的衡量,而不是对特定部署中可能存在的完整安全防护措施的衡量。
在这项评估中,720 次攻击尝试中没有一次成功突破以自动模式运行的 Claude Fable 5、Opus 5 或 Sonnet 5。 另一方面,5.83% 的攻击成功突破了以 Codex 的Auto-review模式运行的 GPT-5.6 Sol。值得注意的是,这高于我们最新模型在bypassPermissions模式下运行且没有额外防护时的平均 0.09% 攻击成功率。测试显示,GPT-5.6 Sol 在Full Access模式下运行时,攻击成功率为 19.03%。攻击成功率因任务不同而有所差异,这些任务包括工具以文本形式返回结果的任务,以及需要通过截图与浏览器交互的任务,如下所示。
自动模式可抵御工具调用和浏览器 GUI 使用中的提示注入。在第三方评估中,OpenAI 模型在浏览器任务上表现出更高的攻击成功率。
自动模式在 Anthropic 内部阻止的三起事件
自动模式也是 Anthropic 内部所有 Claude Code 使用的默认模式。以下是分类器在内部阻止的三个操作:
- 一次网络外数据泄露: 当上传到内部驱动器失败时,Claude 的后备方案是将同一报告发布到一个公共代码共享网站。自动模式拒绝了这一后备方案,并提示用户进行后续步骤。
- 一次破坏性的大规模操作: 在一个长时间运行的会话中,Claude 尝试对大约两千个 pod 执行大规模进程终止操作,并排队了会导致数百个 GPU 上的运行中训练作业被拆除的删除操作。自动模式在执行前标记了这些破坏性命令。
- 一次权限提升过宽的操作: 当被要求提供只读计费访问权限时,Claude 选择了一个在账户根级别授予完全管理控制的云角色。自动模式发现了所请求的权限与实际授予角色之间的不匹配。
在上述每种情况下,Claude 要么自行找到了更安全的路径,要么在继续操作前与用户进行了确认。
让自动模式更加安全
我们正持续投入新的自动模式功能,使其更安全,也更容易交付生产代码。最近的示例包括:
- 硬拒绝规则(https://code.claude.com/docs/en/auto-mode-config#override-the-block-and-allow-rules):数据外泄(例如将你的代码或密钥发送到外部)属于分类器设计上永远不会批准的一类操作。要执行这样的操作,你必须退出自动模式或自行运行该命令。硬拒绝规则可通过设置自定义,因此你可以添加更多即使在组织内用户请求时也绝不允许的规则。
- 数据访问和共享规则: 分类器现在带有明确的规则,用于区分密钥和可能敏感/机密的信息,以及每种信息可以在何处被访问和共享。为了确保这些规则可执行,它还会在操作运行前检查 git push 或 pull request 的目标是公开、私有还是受信任的。同样的推送,根据目标的去往之处,可能是例行操作,也可能是外泄行为:属于团队私有仓库的代码不应最终出现在公共仓库中,而分类器现在被设计为在可能发生这种情况时发出标记。
- 在执行破坏性 git 操作前检查 git 状态: 在执行诸如 git reset –hard 之类的可能丢弃未提交工作的命令之前,分类器会查看仓库当前的 git 状态,从而让自动模式知道正在重置的内容。
- 提示注入筛查: 当 Claude 从外部来源(如网页、文件内容或工具输出)获取内容时,API 侧的探针会检查这些内容是否有劫持 Claude 行为的企图。当发现疑似注入尝试时,会在结果与用户共享之前向 Claude 的上下文添加一条警告。
生产环境中的自动模式
团队已经在生产环境中将自动模式作为默认模式运行:
- Adobe 的零售平台团队负责确保 Adobe.com 上 90 多个国家和 30 多种语言的定价和促销页面的准确性和时效性。他们构建了一个自主循环来构建和验证这些页面,并以自动模式运行,以便工程师能收到完成的 PR 供审查。
- Nuro 在其研究和工程组织内运行自动模式,利用它驱动过夜研究代理,这些代理会优化评估指标,并在早晨返回已完成的 PR 供审查。
- Gusto 采用了自动模式,以终结推动工程师完全绕过权限检查的权限疲劳。自 5 月中旬以来,大约 10% 的会话包含分类器拒绝——这证明它在不拖慢合法任务的情况下做了真正的工作。
- **Garn
相似文章
自动模式现已成为 Claude Code 的默认模式
Anthropic 现已在 Claude Code 中为 Pro、Max 和 Team 套餐默认启用自动模式,并援引安全研究与生产力提升作为依据,同时该分类器的开销现已对这些套餐免费。
Anthropic 将默认开启 Claude Code 的自动模式
Anthropic 将从 8 月 14 日起,让 Claude Code 的自动模式成为 Pro、Max 和 Team 账户的默认选项,减少手动批准提示的需求,同时增加提示注入筛查和硬性拒绝规则等安全功能。
Claude Code 中自动模式现已成为 Pro、Max 和 Team 套餐的默认模式
Anthropic 宣布自 8 月 14 日起,在 Claude Code 中为 Pro、Max 和 Team 套餐默认启用自动模式,其评估结果显示,自动模式可拦截 89% 的有害操作,并能抵御所有经过测试的间接提示注入攻击。
@bcherny: 我和团队完全使用 Auto 模式,已经很多个月了。我无法想象再回到权限提…
Claude Code 将于 8 月 14 日起将自动模式设为 Pro、Max 和 Team 用户的默认权限模式。在测试中,自动模式的独立分类器捕获了 89% 的危险命令,而手动批准仅捕获了 14%。
Claude Code 自动模式:一种更安全的跳过权限方式
Anthropic 为 Claude Code 推出「自动模式」功能,该功能基于模型分类器自动审批权限请求,旨在减少用户操作疲劳的同时,防止对不安全操作的放行。