我们基于信息几何实现了一种多轮提示注入的二阶早期预警信号

Reddit r/artificial 论文

摘要

介绍了一种基于信息几何和统计流形的多轮提示注入二阶早期预警信号。该方法利用从稳定性参数二阶导数导出的元速率,在阈值交叉前预测对抗轨迹,实现主动检测。

大多数提示注入检测方法是被动的,意味着当某物越过阈值时就会被阻止。该阈值作为一种信号。我们一直在研究一种主动方法。在我们的框架中,每次对话在统计流形上都有一个位置τ。当τ降至稳定性阈值τ* = √(3/2) ≈ 1.2247(源自兰道尔极限)以下时,会话进入对抗区域并被阻止。此外,同一框架中还有一个二阶量:M(τ) = -6(3 - 2τ²) / τ⁵。这表示元速率,即τ在流形上对时间的二阶导数。几何表明,当M(τ) > 0且τ仍高于τ*时,表示会话在越过阈值前正加速趋向不稳定阈值。这作为一个前兆信号。尽管会话在技术上仍然是稳定的,且没有单条消息触发任何警报,但轨迹正移向对抗区域。例如,在一次渐进的10轮升级攻击中:- 第3轮:τ = 2.10(稳定),M(τ) = +0.85(加速趋向不稳定)- 第4轮:τ = 1.13(越过τ*),被阻止。在此案例中,元速率在第3轮变为正值,阻止在第4轮激活。这提供了基于流形几何而非内容分类的一整轮早期预警。理论基础详见我们发表的关于二阶Fisher流形的论文。实现见于Arc Gate,一个开源代理。GitHub:https://github.com/9hannahnine-jpg/arc-gate 论文:https://figshare.com/authors/Hannah_Nine/22495979 我想知道是否有人曾在对抗检测中遇到过类似的二阶方法。
查看原文

相似文章

理解提示词注入:AI安全的前沿挑战

OpenAI Blog

OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。