SkillDRE:通过预执行和运行时反馈的双阶段代理技能红队进化
摘要
SkillDRE引入了一个双阶段反馈循环,用于自主进化代理中的恶意技能包,在保持良性任务功能的同时实现高攻击成功率。
查看缓存全文
缓存时间: 2026/09/29 08:17
论文页面 - SkillDRE:通过预执行与运行时反馈实现智能体技能的双阶段红队演进
来源:https://huggingface.co/papers/2609.32400
摘要
智能体技能将指令、可执行代码和任务特定资源封装成可复用的模块,使智能体能够通过执行反馈不断改进。同一机制也使攻击者能够演进恶意技能,使其更有效且更难检测。然而,候选技能可能通过预执行扫描,却在运行时防御下无法实现其目标;而修复执行问题的修订版又可能引入新的扫描器发现。我们提出 SkillDRE——一个全自动框架,通过双阶段反馈循环演进完整的恶意技能包。给定良性任务及其相关技能,SkillDRE 自主构建并验证任务条件下的恶意目标和可验证的判断规则。随后它固定这两者,同时演进技能实现,并保持合法任务能力。SkillDRE 结合了扫描器引导的演进与运行时引导的细化——后者基于在运行时防御下观察到的执行结果进行改进。每次运行时引导的修订都会返回预执行阶段重新扫描和进一步优化,然后再重新执行,形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 实现了平均 45.28% 的攻击成功率,超过最强基线 40.3%,而其最终提交的技能未发现 SkillScan 问题,且基本保持了良性任务性能。这些结果表明,双阶段防御反馈可作为适应性红队的有效学习信号,并且单独评估任一防御阶段可能会遗漏由此产生的攻击能力。代码可通过以下链接获取:https://github.com/whfeLingYu/SkillDRE
查看 arXiv 页面 (https://arxiv.org/abs/2609.32400) 查看 PDF (https://arxiv.org/pdf/2609.32400) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.32400)
在您的智能体中获取此论文:
hf papers read 2609.32400
尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。
引用本文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。
引用本文的 Space 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。
包含本文的合集 0
暂无合集收录本文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
SkillJack:自我进化智能体中的持久性技能后门
本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。
隐蔽分散,协同为害:针对基于技能的代理系统的技能级联攻击
介绍了针对基于技能的代理系统的技能级联攻击,其中多个看似无害的技能修改共同造成危害并逃避检测,并提出了一个自动化红队测试框架和基准来研究这一威胁。
SkillEvo:基于多轮交互反馈的自我更新进化梯度
SkillEvo 引入了一种通过使用多轮交互反馈和治理层来持续改进 AI 代理技能的方法,以保持进化梯度,超越了自反思和单轮问答驱动的方法。
@dair_ai: // MetaSkill-Evolve // 关于自我改进代理的优秀论文。大多数自我改进代理重写代理所做的并……
MetaSkill-Evolve 引入了一个递归的双时间尺度框架,用于LLM代理,使其能够同时进化任务技能和改进过程本身,在OfficeQA、SealQA和ALFWorld基准测试上取得了显著的准确性提升。
SkillOpt:自我进化智能体技能的执行策略
SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。