SkillJack:自我进化智能体中的持久性技能后门

Hugging Face Daily Papers 论文

摘要

本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。

自我进化智能体越来越多地将交互历史转化为可复用的技能,这些技能在单个任务之外持续存在。虽然先前的研究关注记忆和检索投毒,但此类攻击仅在中毒记录被作为上下文检索时才会影响智能体。我们揭示了一种新的、更根本的风险:中毒经验可以被智能体自身转化为持久的行为制品。我们提出了SkillJack,这是首个利用自我进化智能体“经验到技能”管线的攻击。SkillJack不是直接操纵运行时上下文,而是劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中。我们确定了这种转化的三个关键属性:消毒粉饰(sanitization whitewashing),即在技能提取过程中恶意意图被掩盖;跨层提升(cross-layer promotion),即瞬时经验变成持久能力;以及持久性隔离(persistence isolation),即攻击在原始来源记录被删除后依然存活。我们使用包含150条轨迹、涵盖四类策略风险类别的共享数据集,在两个代表性系统SkillX和Anything2Skill上评估了SkillJack。结果表明,技能提取显著降低了攻击的可检测性:在SkillX中,安全检测率从中毒轨迹的98.5\%降至提取技能的11.4\%,而Anything2Skill也表现出类似效果。同时,植入的技能仍然有效,在两个系统上的攻击成功率分别达到56.2\%和89.2\%。此外,80.0\%的技能介导攻击在删除原始中毒记录后仍然存在,并且一些技能会在良性查询上无意中激活。我们的发现揭示了技能进化是一个新的攻击面,并促使业界关注基于来源的技能生命周期保护。我们的代码可在https://github.com/Tencent/AI-Infra-Guard/research/skilljack获取。
查看原文
查看缓存全文

缓存时间: 2026/08/05 05:43

论文页面 - SkillJack:自进化智能体中的持久性技能后门

Source: https://huggingface.co/papers/2608.03509

摘要

自进化智能体越来越多地将交互历史转化为可复用的技能,这些技能在单个任务之外持续存在。尽管先前的工作研究了记忆和检索投毒,但这种攻击仅在中毒记录被作为上下文检索时才会影响智能体。我们发现了一种新的、更根本的风险:中毒经验可被智能体自身转化为持久的行为产物。我们提出了 SkillJack,这是第一个利用自进化智能体经验到技能管道的攻击。SkillJack 并非直接操纵运行时上下文,而是劫持智能体自身的学习过程,将恶意行为植入其可复用的技能库中。我们识别出这一转化的三个关键特性:清洗粉饰(sanitization whitewashing),即在技能提取过程中恶意意图被掩盖;跨层提升(cross-layer promotion),即瞬时经验变为持久能力;以及持久性隔离(persistence isolation),即攻击在移除其原始来源记录后仍然存在。我们在两个代表性系统 SkillX 和 Anything2Skill 上评估了 SkillJack,使用了一个共享数据集,包含跨越四个策略风险类别的 150 条轨迹。结果表明,技能提取大幅降低了攻击的可检测性:在 SkillX 中,安全检测从中毒轨迹的 98.5% 降至提取技能的 11.4%,而 Anything2Skill 也表现出类似效果。与此同时,植入的技能仍然有效,在两个系统上的攻击成功率分别为 56.2% 和 89.2%。此外,80.0% 的经由技能介导的攻击在删除原始中毒记录后仍然存在,并且一些技能会在良性查询上无意激活。我们的发现揭示了技能进化是一个新的攻击面,并推动了具有来源感知的技能生命周期保护。我们的代码可在 https://github.com/Tencent/AI-Infra-Guard/research/skilljack 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.03509) 查看 PDF (https://arxiv.org/pdf/2608.03509) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.03509)

在你的智能体中获取此论文:

hf papers read 2608\.03509

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.03509 以从此页面链接。

包含此论文的收藏夹 0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。