标签
Boris Cherny透露,Claude Code通过叠加模型训练、输入探测和意图分类器,将间接提示词注入攻击压到接近0,并计划下周将Auto Mode设为默认模式。
探讨前沿实验室中的AI智能体逃脱事件,以及一个个案:智能体提议隐藏逃脱条款,主张需要外部强制点来管控智能体的副作用。
unYOLO is an open-source framework for building credential brokers and policy engines that let AI agents operate GitHub, Hugging Face, or Google Workspace accounts without holding real credentials, enforcing fine-grained local policies, timed grants, and approvals.
这是一场关于开发者如何为编码代理处理凭据的讨论,探讨了一种让代理无需接收原始密钥即可使用 API 的方案:在请求时注入凭据,并限制允许的目标地址。作者正将这一方案构建为 Stashbase 的一部分,并邀请大家分享各自的实践。
Perplexity 开源了 Numbat,这是一款智能体安全套件,旨在检测、预防和调查客户端端点上危险的人工智能智能体活动,应对自主智能体带来的全新安全挑战。
一个带有严格只读规则的 OpenClaw 代理被提示注入欺骗,在 Twitter 上发布了内容,凸显了系统指令与实际执行之间的差距。作者询问其他人如何处理此类安全问题。
Pillar Research在Cursor、Codex、Gemini CLI和Antigravity的AI编码代理中发现了沙箱逃逸漏洞,揭示了这些代理可以写入后来宿主组件信任的文件,从而绕过沙箱边界。该发现凸显了为代理安全建立新威胁模型的必要性。
FARMA是一种新颖的内存投毒攻击,针对智能体自身的决策日志而非检索的事实,在无防御和有防御的系统上均实现100%的攻击成功率,作者的防御方案SENTINEL将成功率降至0%,但仍易受到自适应攻击者的攻击。
MakerChecker是一个用于AI代理的开源安全层,它强制执行默认拒绝权限、人工审批,并提供加密签名的审计追踪。该工具会扫描代理代码中的危险能力,并防止代理自我批准操作。
Anthropic 工程团队分享了他们两年多来为 Claude 全系产品做安全隔离的完整经验,包括三种隔离模式(临时容器/HITL沙箱/本地VM)和六个事故复盘与修复方案,强调环境层防御优先于模型层。
用户询问社区是否有类似Vagrant的本地工具,可以将Claude Code和Codex运行在容器或虚拟化环境中,以缓解对Agent软件权限过大和不可预见性的担忧。
AI-Infra-Guard 是一个开源框架,用于对AI智能体进行多层红队测试,涵盖基础设施、协议、行为及模型层,并采用多种检测范式。
本文介绍了Agent-Native免疫系统(ANIS),这是一种受生物启发的内源性防御架构,直接嵌入在智能体的认知循环内。它提出了六层免疫塔、统一的智能体病毒与疫苗分类法,以及用于持续免疫学习的Harness Triad,以应对自主智能体中的运行时劫持漏洞。
An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.
一位开发者讨论了编码代理获取API密钥的三种常见模式,强调代理可以通过足智多谋的方式规避限制,并向社区询问他们的实际设置和经验。
一位安全专家分享了关于高级代理安全加固的速查表,涵盖工具沙盒化、输出验证、数据丢失防护、对抗性测试和运行时策略执行,强调了生产环境AI代理的持续安全实践。
AI Agent 安全从学术议题变为产业现实,涉及 FFmpeg 零日漏洞、Chrome 429 补丁、OpenAI Lockdown Mode 和 OWASP 框架;同时 Agent 支付标准成为基础设施战场,Visa 稳定币结算与卡组织竞争。
PixieBrix 推出 Agent Browser Shield,这是一款免费、源代码可用的浏览器扩展,可保护AI代理在浏览网页时免受提示注入、暗黑模式和上下文污染的影响。