SkillDRE:通过预执行和运行时反馈的双阶段代理技能红队进化

Hugging Face Daily Papers 论文

摘要

SkillDRE引入了一个双阶段反馈循环,用于自主进化代理中的恶意技能包,在保持良性任务功能的同时实现高攻击成功率。

代理技能将指令、可执行代码和任务特定资源打包成可重用的工件,代理可以使用执行反馈来改进这些工件。同样的机制也使攻击者能够进化恶意技能,使其更有效且更难被检测。然而,一个候选技能可能通过预执行扫描,但在运行时防御下无法实现其目标,而修复执行的修订可能会引入新的扫描器发现。我们引入了SkillDRE,一个通过双阶段反馈循环进化完整恶意技能包的全自动化框架。给定一个良性任务及其相关技能,SkillDRE自主构建并验证一个任务条件化的恶意目标和一个可验证的判断规则。然后,在进化技能实现的同时固定两者,以保留合法任务能力。SkillDRE结合了扫描器引导的进化和基于运行时防御下观察到的执行结果的运行时引导细化。每个运行时引导的修订都返回到预执行阶段,进行重新扫描和进一步优化,然后重新执行,形成跨阶段的闭环。在四个受害模型上评估SkillsBench时,SkillDRE实现了45.28%的平均攻击成功率,比最强基线高出40.3%,而其最终提交的技能没有SkillScan发现,并基本保持良性任务性能。这些结果表明,两阶段防御反馈可以作为适应性红队的有效学习信号,并且单独评估任一防御阶段可能会错过由此产生的攻击能力。代码可在以下地址获取:https://github.com/whfeLingYu/SkillDRE
查看原文
查看缓存全文

缓存时间: 2026/09/29 08:17

论文页面 - SkillDRE:通过预执行与运行时反馈实现智能体技能的双阶段红队演进

来源:https://huggingface.co/papers/2609.32400

摘要

智能体技能将指令、可执行代码和任务特定资源封装成可复用的模块,使智能体能够通过执行反馈不断改进。同一机制也使攻击者能够演进恶意技能,使其更有效且更难检测。然而,候选技能可能通过预执行扫描,却在运行时防御下无法实现其目标;而修复执行问题的修订版又可能引入新的扫描器发现。我们提出 SkillDRE——一个全自动框架,通过双阶段反馈循环演进完整的恶意技能包。给定良性任务及其相关技能,SkillDRE 自主构建并验证任务条件下的恶意目标和可验证的判断规则。随后它固定这两者,同时演进技能实现,并保持合法任务能力。SkillDRE 结合了扫描器引导的演进与运行时引导的细化——后者基于在运行时防御下观察到的执行结果进行改进。每次运行时引导的修订都会返回预执行阶段重新扫描和进一步优化,然后再重新执行,形成跨阶段闭环。在 SkillsBench 上对四个受害模型进行评估时,SkillDRE 实现了平均 45.28% 的攻击成功率,超过最强基线 40.3%,而其最终提交的技能未发现 SkillScan 问题,且基本保持了良性任务性能。这些结果表明,双阶段防御反馈可作为适应性红队的有效学习信号,并且单独评估任一防御阶段可能会遗漏由此产生的攻击能力。代码可通过以下链接获取:https://github.com/whfeLingYu/SkillDRE

查看 arXiv 页面 (https://arxiv.org/abs/2609.32400) 查看 PDF (https://arxiv.org/pdf/2609.32400) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.32400)

在您的智能体中获取此论文:

hf papers read 2609.32400

尚未安装最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型 0

暂无模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。

引用本文的数据集 0

暂无数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。

引用本文的 Space 0

暂无 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2609.32400 以从此页面链接。

包含本文的合集 0

暂无合集收录本文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

SkillJack:自我进化智能体中的持久性技能后门

Hugging Face Daily Papers

本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。

SkillOpt:自我进化智能体技能的执行策略

Hugging Face Daily Papers

SkillOpt 引入了一种系统化的文本空间优化器,用于智能体技能。该优化器将技能训练为智能体的外部状态,具有稳定的更新和零部署推理开销,在多个基准测试和执行环境中实现了卓越性能。