SkillJack:自我进化智能体中的持久性技能后门
摘要
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
查看缓存全文
缓存时间: 2026/08/05 05:43
论文页面 - SkillJack:自进化智能体中的持久性技能后门
Source: https://huggingface.co/papers/2608.03509
摘要
自进化智能体越来越多地将交互历史转化为可复用的技能,这些技能在单个任务之外持续存在。尽管先前的工作研究了记忆和检索投毒,但这种攻击仅在中毒记录被作为上下文检索时才会影响智能体。我们发现了一种新的、更根本的风险:中毒经验可被智能体自身转化为持久的行为产物。我们提出了 SkillJack,这是第一个利用自进化智能体经验到技能管道的攻击。SkillJack 并非直接操纵运行时上下文,而是劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中。我们识别出这一转化的三个关键特性:清洗粉饰(sanitization whitewashing),即在技能提取过程中恶意意图被掩盖;跨层提升(cross-layer promotion),即瞬时经验变为持久能力;以及持久性隔离(persistence isolation),即攻击在移除其原始来源记录后仍然存在。我们在两个代表性系统 SkillX 和 Anything2Skill 上评估了 SkillJack,使用了一个共享数据集,包含跨越四个策略风险类别的 150 条轨迹。结果表明,技能提取大幅降低了攻击的可检测性:在 SkillX 中,安全检测从中毒轨迹的 98.5% 降至提取技能的 11.4%,而 Anything2Skill 也表现出类似效果。与此同时,植入的技能仍然有效,在两个系统上的攻击成功率分别为 56.2% 和 89.2%。此外,80.0% 的经由技能介导的攻击在删除原始中毒记录后仍然存在,并且一些技能会在良性查询上无意激活。我们的发现揭示了技能进化是一个新的攻击面,并推动了具有来源感知的技能生命周期保护。我们的代码可在 https://github.com/Tencent/AI-Infra-Guard/research/skilljack 获取。
查看 arXiv 页面 (https://arxiv.org/abs/2608.03509) 查看 PDF (https://arxiv.org/pdf/2608.03509) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03509)
在你的智能体中获取此论文:
hf papers read 2608\.03509
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。
包含此论文的收藏夹 0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
SkillHarm:通过自动化构建的生命周期感知技能攻击
SkillHarm 是一个用于评估技能使用生命周期中基于技能的攻击的基准,揭示了当前AI代理的高度脆弱性(攻击成功率高达86.3%),并引入了通过AutoSkillHarm实现的自动化攻击构建。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
盲人策展人:有偏见的评委如何悄无声息地禁用自进化代理中的技能退出机制
本文研究有偏见的LLM评委如何悄无声息地禁用自进化代理中的技能退出机制,表明跨越尖锐阈值的假阳性偏差阻止了基于贡献的退出,且该失败跨领域普遍存在,只能通过缺陷注入审计检测到。
SkillMaster:迈向大语言模型智能体的自主技能掌握
本文介绍了 SkillMaster,一种训练框架,使大语言模型智能体能够通过轨迹知情审查和反事实效用评估,自主地创建、优化和选择技能。
SkillGen:经过验证的推理时代理技能合成
本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。