POISE:面向LLM智能体的位置感知隐形技能注入

Hugging Face Daily Papers 论文

摘要

POISE是一种隐形技能中毒攻击,它将恶意触发器嵌入看似良性的指令中,在逃避LLM扫描器检测的同时实现高攻击成功率。

智能体技能为扩展通用智能体提供了一种轻量级机制,但其开放格式使其容易遭受技能中毒攻击。实际危险的注入必须保持隐形:如果执行有效载荷导致用户的合法任务偏离轨道,由此产生的失败信号会引发对技能的检查。因此,我们通过攻击成功率(ASR)来评估攻击,该指标要求注入的有效载荷得以执行,同时用户的同一任务仍能通过其验证器。在这种视角下,以前的技能中毒攻击面临可靠性与隐蔽性的权衡:YAML头部注入可靠加载但易于检查,而将显式恶意命令置于技能正文中的更隐蔽注入则可靠性较低,因为脱离上下文的命令会引发智能体自身的怀疑。我们提出POISE,一种位置感知攻击,它将触发器压缩为单个看似良性的正文指令,将其放置在可行位置,并使用上下文感知生成器将其与附近的设置或前置步骤混合。在基于codex+gpt-5.2的Skill-Inject数据集上,POISE达到了89.3%的ASR,比随机放置的正文基线高出28.0个百分点,比纯YAML基线高出2.6个百分点,同时保留了正文放置的隐蔽性优势。这种隐蔽性是决定性优势:由于合法的技能正文天然需要特权工具操作,LLM扫描器变得高度敏感,在四个评判者和两个基准测试中,平均错误地将74.6%的干净技能标记为风险。融入这些误报中,POISE仅导致5.6%的中毒变体在其干净基线之上获得新的高风险警报,使得当前的静态防御失效。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:37

论文页面 - POISE:面向LLM智能体的位置感知不可检测技能注入

来源: https://huggingface.co/papers/2606.07943

摘要

POISE是一种隐蔽的技能投毒攻击,它将恶意触发器嵌入看似无害的指令中,在实现高攻击成功率的同时,能够避免对特权工具操作过度敏感的LLM扫描器的检测。

智能体技能为扩展通用智能体提供了轻量级机制,但其开放格式使其容易受到技能投毒攻击。真正危险的注入必须保持隐形:如果执行载荷扰乱了用户的合法任务,由此产生的失败信号会引发对技能的审查。因此,我们使用攻击成功率(ASR)来评估攻击,该指标要求注入的载荷能够执行,且用户的任务在同一轮测试中仍能通过其验证器。在这种视角下,先前的技能投毒攻击面临着可靠性-隐蔽性之间的权衡:YAML头部注入可靠但容易被检查,而更隐蔽的主体注入(在技能文本中放置显式恶意命令)可靠性较低,因为脱离上下文的命令会引起智能体自身的怀疑。我们提出了POISE,一种位置感知攻击,它将触发器压缩为一条看似无害的主体指令,将其放置在可行位置,并使用上下文感知生成器使其与附近的设置或预备步骤融为一体。在使用codex+gpt-5.2的Skill-Inject基准测试中,POISE实现了89.3%的ASR,比随机位置的主体基线高出28.0个百分点,比仅YAML基线高出2.6个百分点,同时保留了主体注入的隐蔽性优势。这种隐蔽性是决定性因素:由于合法的技能主体自然需要特权工具操作,LLM扫描器高度敏感,在四个评判者和两个基准测试中平均将74.6%的干净技能误报为危险。在这种误报背景下,POISE仅导致5.6%的投毒变体比其干净基线新增高风险警报,使得当前的静态防御无效。

查看 arXiv 页面 (https://arxiv.org/abs/2606.07943)
查看 PDF (https://arxiv.org/pdf/2606.07943)
GitHub0 (https://github.com/liofoil/SkillSafety)
添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.07943)

在您的智能体中获取此论文:

hf papers read 2606\.07943

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到这篇论文

在模型 README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。

引用此论文的数据集0

没有数据集链接到这篇论文

在数据集 README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。

引用此论文的Space空间0

没有Space空间链接到这篇论文

在Space README.md 中引用 arxiv.org/abs/2606.07943 以将其链接到此页面。

包含此论文的收藏集0

没有收藏集包含这篇论文

将这篇论文添加至收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

领域伪装注入攻击规避多智能体LLM系统检测

Hacker News Top

本文识别出一类新的注入攻击,其载荷模仿领域语言以规避LLM注入检测器,实验显示检测率急剧下降(例如,在Llama 3.1 8B上从93.8%降至9.7%)。该漏洞具有系统性,且延伸至诸如Llama Guard 3等专用安全分类器,后者对伪装载荷的检测率为零。

SkillJack:自我进化智能体中的持久性技能后门

Hugging Face Daily Papers

本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。