POISE:面向LLM智能体的位置感知隐形技能注入
摘要
POISE是一种隐形技能中毒攻击,它将恶意触发器嵌入看似良性的指令中,在逃避LLM扫描器检测的同时实现高攻击成功率。
查看缓存全文
缓存时间: 2026/06/11 13:37
论文页面 - POISE:面向LLM智能体的位置感知不可检测技能注入
来源: https://huggingface.co/papers/2606.07943
摘要
POISE是一种隐蔽的技能投毒攻击,它将恶意触发器嵌入看似无害的指令中,在实现高攻击成功率的同时,能够避免对特权工具操作过度敏感的LLM扫描器的检测。
智能体技能为扩展通用智能体提供了轻量级机制,但其开放格式使其容易受到技能投毒攻击。真正危险的注入必须保持隐形:如果执行载荷扰乱了用户的合法任务,由此产生的失败信号会引发对技能的审查。因此,我们使用攻击成功率(ASR)来评估攻击,该指标要求注入的载荷能够执行,且用户的任务在同一轮测试中仍能通过其验证器。在这种视角下,先前的技能投毒攻击面临着可靠性-隐蔽性之间的权衡:YAML头部注入可靠但容易被检查,而更隐蔽的主体注入(在技能文本中放置显式恶意命令)可靠性较低,因为脱离上下文的命令会引起智能体自身的怀疑。我们提出了POISE,一种位置感知攻击,它将触发器压缩为一条看似无害的主体指令,将其放置在可行位置,并使用上下文感知生成器使其与附近的设置或预备步骤融为一体。在使用codex+gpt-5.2的Skill-Inject基准测试中,POISE实现了89.3%的ASR,比随机位置的主体基线高出28.0个百分点,比仅YAML基线高出2.6个百分点,同时保留了主体注入的隐蔽性优势。这种隐蔽性是决定性因素:由于合法的技能主体自然需要特权工具操作,LLM扫描器高度敏感,在四个评判者和两个基准测试中平均将74.6%的干净技能误报为危险。在这种误报背景下,POISE仅导致5.6%的投毒变体比其干净基线新增高风险警报,使得当前的静态防御无效。
查看 arXiv 页面 (https://arxiv.org/abs/2606.07943)
查看 PDF (https://arxiv.org/pdf/2606.07943)
GitHub0 (https://github.com/liofoil/SkillSafety)
添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07943)
在您的智能体中获取此论文:
hf papers read 2606\.07943
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到这篇论文
在模型 README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。
引用此论文的数据集0
没有数据集链接到这篇论文
在数据集 README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。
引用此论文的Space空间0
没有Space空间链接到这篇论文
在Space README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。
包含此论文的收藏集0
没有收藏集包含这篇论文
将这篇论文添加至收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
领域伪装注入攻击规避多智能体LLM系统检测
本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。
SkillJack:自我进化智能体中的持久性技能后门
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
Plimsoll: 一个用于测试提示注入、信息泄露和工具滥用的智能体技能
Plimsoll是一个开源的智能体技能,专为红队测试LLM应用和智能体而设计,专注于针对提示注入、信息泄露和工具滥用等安全问题的测试。
当智能体记忆过多:针对大语言模型智能体的记忆投毒攻击
本文介绍了GhostWriter,一种新颖的攻击向量,利用基于大语言模型的个人智能体的记忆子系统来毒化其记忆存储,实现了高注入率和激活率。作者提出了AM-Sentry防御机制,在保持智能体实用性的同时显著降低攻击成功率。
我对OpenClaw技能向系统提示注入垃圾内容感到担忧,于是构建了一个隔离管道,使用两个LLM作为审查员(检测率93.75%,零假阴性)
一位开发者构建了一个隔离管道,使用两个LLM审查员(Claude和Codex)检测OpenClaw技能中的注入攻击,实现了93.75%的检测率且零假阴性。该系统采用双重任务:基于清单的模式匹配和开放式分析,以捕获已知和新型注入技术。