破解 Claude Code Opus 5 自动模式

Simon Willison's Blog 新闻

摘要

一位研究人员发现了一种攻击,能以80%的成功率绕过Claude Code的自动模式,暴露了AI安全机制的风险,并倡导使用沙箱。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/27 23:19

# 突破Claude Code Opus 5自动模式 来源:https://simonwillison.net/2026/Aug/27/breaking-claude-code-opus-5-auto-mode/ 2026年8月27日 \- 链接博客 **突破Claude Code Opus 5自动模式(https://embracethered.com/blog/posts/2026/breaking-claude-code-opus-5-and-automode/)**。Anthropic将大量信心寄托于Claude Code的自动模式,以保护其编程代理用户免受提示词注入攻击。他们近期已将此模式设为默认选项(https://simonwillison.net/2026/Aug/8/auto-mode/),并对其有效性作出了大胆声明。 Johann Rehberger是当前最权威的提示词注入研究者之一。他发现了一种针对自动模式的攻击手段,据称成功率达80%——该方法诱使Claude Code下载并解压一个ZIP存档,接着执行导入`base64`的代码,却未察觉这将从存档中提取并执行本地的`struct\.py`文件。 在少数情况下,自动模式甚至直接阻碍了代理阻止恶意代码继续执行的操作! > 在几次测试中,Claude一旦察觉入侵便试图终止恶意软件进程,但自动模式拒绝了清理指令。Claude检测到入侵,但**自动模式阻断了其清理命令**。安全机制本身可能成为失效环节。分类器允许创建恶意软件进程,却阻止了旨在终止它的指令! 我同意Johann的结论:若存在吸引对抗性攻击的风险,运行代理的唯一安全方式是使用沙箱: > - 在容器、虚拟机或操作系统沙箱中运行无人值守的编程代理。 > - 限制网络出口流量。 > - 监控您的代理。 > - 切勿将主目录、SSH密钥、云凭证等暴露给代理运行环境。 > \[\.\.\.\]

相似文章

Claude Code Opus 5 Auto Mode 中的提示注入

Lobsters Hottest

本文展示了在 Auto Mode 下对 Claude Code Opus 5 进行提示注入攻击的方法,该攻击实现了 60-80% 的代码执行成功率,这与先前评估显示的 0% 攻击成功率相矛盾。

五个月内两次Claude Code沙箱绕过,均被静默修复。AI代理的责任共担模型应如何构建?

Reddit r/AI_Agents

研究员Aonan Guan本月通过HackerOne披露了第二个Claude Code网络沙箱绕过漏洞。机制:SOCKS5主机名空字节注入。JavaScript策略层读取完整主机名,而libc在空字节处截断,因此策略批准的网络流量会解析到不同的主机。受影响版本为2.0.24至2.1.89,涵盖约130个版本,历时5.5个月。两次修复均未公开,也未发布安全通告。云基础设施花费十年构建了责任共担模型:供应商保护平台,客户掌控平台上运行的内容。运行时可见性、出口控制、操作层身份、数据允许列表——这一分工已明确。AI代理尚未建立此类模型。Anthropic保护沙箱,但关于代理实际执行了什么、调用了哪些工具、哪些数据被移动的运行时可见性,则属于客户的责任。五个月内两次静默修复,这应促使你反思你实际拥有什么。