我们基于信息几何实现了一种多轮提示注入的二阶早期预警信号
摘要
介绍了一种基于信息几何和统计流形的多轮提示注入二阶早期预警信号。该方法利用从稳定性参数二阶导数导出的元速率,在阈值交叉前预测对抗轨迹,实现主动检测。
大多数提示注入检测方法是被动的,意味着当某物越过阈值时就会被阻止。该阈值作为一种信号。我们一直在研究一种主动方法。在我们的框架中,每次对话在统计流形上都有一个位置τ。当τ降至稳定性阈值τ* = √(3/2) ≈ 1.2247(源自兰道尔极限)以下时,会话进入对抗区域并被阻止。此外,同一框架中还有一个二阶量:M(τ) = -6(3 - 2τ²) / τ⁵。这表示元速率,即τ在流形上对时间的二阶导数。几何表明,当M(τ) > 0且τ仍高于τ*时,表示会话在越过阈值前正加速趋向不稳定阈值。这作为一个前兆信号。尽管会话在技术上仍然是稳定的,且没有单条消息触发任何警报,但轨迹正移向对抗区域。例如,在一次渐进的10轮升级攻击中:- 第3轮:τ = 2.10(稳定),M(τ) = +0.85(加速趋向不稳定)- 第4轮:τ = 1.13(越过τ*),被阻止。在此案例中,元速率在第3轮变为正值,阻止在第4轮激活。这提供了基于流形几何而非内容分类的一整轮早期预警。理论基础详见我们发表的关于二阶Fisher流形的论文。实现见于Arc Gate,一个开源代理。GitHub:https://github.com/9hannahnine-jpg/arc-gate 论文:https://figshare.com/authors/Hannah_Nine/22495979 我想知道是否有人曾在对抗检测中遇到过类似的二阶方法。
相似文章
大多数注入检测器逐条打分,我做了个追踪完整会话几何轨迹的,这是实测结果
开发者构建了 Arc Gate——一款基于 Fisher 信息流形几何的 LLM 监控代理,可在会话层面检测提示注入攻击,通过追踪 t 值相对相变阈值 t*=1.2247 的变化,识别 Crescendo 式渐进操控,而非逐句关键词匹配。
你们如何在产品发布后检测新的提示注入模式?
本文讨论了在AI系统发布后检测新提示注入模式的方法,包括语义搜索、追踪级安全评分以及Braintrust等工具,同时强调了误报和攻击分类方面的挑战。
我构建了一个针对多轮提示注入攻击的基准测试。大多数防御措施从未预料到它们的出现。
一项新的多轮提示注入攻击基准测试显示,目前大多数防御措施无法检测到复杂的多步攻击。
迟一步:多轮对话中隐藏恶意意图的响应感知防御
提出TurnGate,一种回合级监控器,通过识别最早响应即会促成有害动作的回合来检测多轮对话中的隐藏恶意意图,并配套构建了多轮意图数据集(MTID)以支持训练与评估。
理解提示词注入:AI安全的前沿挑战
OpenAI发布了关于提示词注入攻击的指导,这是一种社会工程漏洞,恶意指令可以隐藏在网页内容或文档中,诱骗AI模型执行意外操作。该公司概述了其多层防御策略,包括指令层级研究、自动化安全测试和AI驱动的监控系统。