你们如何在产品发布后检测新的提示注入模式?

Reddit r/AI_Agents 新闻

摘要

本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。

我希望能够检测到语义模式的漂移,而不对每一个报告的异常情况都产生问题。追踪级安全评分可以指出检索、推理和工具调用中的任何异常情况。语义搜索可以帮助检测已知间接注入的任何变体。主题聚类可以引入一组新的探测。对评分进行抽样的问题在于,可能会错过一些非常严重的内容。Braintrust可能是一个我们考虑的选择,用于安全评分、语义追踪搜索、抽样在线评估、主题聚类,以及将可疑追踪提升到对抗性回归数据集。硬件是容易描述的部分。评分器阈值和误报是实际的操作问题。研究语料库可以合法地包含关于绕过指令的文本,而模型讨论攻击与模型遵循攻击是不同的。我认为攻击分类还需要包括行为,而不仅仅是载荷措辞。代理是否暴露了秘密、扩大了工具范围、跳过了确认步骤,或跨回合持久化了攻击者控制的状态?你们如何在发布后找到新的注入模式,以及什么证据足够强大以将一个追踪提升到回归套件中?
查看原文

相似文章

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。

设计能抵抗提示词注入的AI智能体

OpenAI Blog

OpenAI发布了关于设计抗提示词注入攻击的AI智能体的指导意见,指出现代攻击日益采用社会工程学策略而非简单的字符串注入,并倡导采用系统级防御措施来限制影响范围,而不是单纯依赖输入过滤。

间接提示注入的见解(12分钟阅读)

TLDR AI

Zico Kolter 和 Matt Fredrikson,Gray Swan 的领导者及 AI 安全专家,讨论了 AI 红队测试的现状以及间接提示注入——这是 AI 代理的关键漏洞。他们解释了为何 AI 安全需要不同的思维模式,自动化红队测试如何超越人类,并介绍了用于对抗性测试的工具 Shade。