@dair_ai:终于有篇论文来测试隐藏智能体技能文件是否真能起到保护作用了。简短回答是:不能。这个结论实在讽刺。

X AI KOLs Following 论文

摘要

本文介绍了名为"Daydreaming"的攻击方法,该方法通过常规任务交互窃取隐藏的代理技能,证明了仅隐藏技能文件无法防止其被重构。

最终,有篇论文测试隐藏智能体技能文件是否真的能保护它们。 简短答案是:不能。这令人担忧。 如果你出售技能访问权限或在团队间共享技能,本文值得一读。 这份新论文讨论了更多内容: "白日梦"方法仅通过服务本身执行的常规任务,就能重构托管的多文件技能。受害者从未被要求泄露技能或评估重构结果,因此披露过滤器无法捕捉到任何异常。 在最弱的访问级别(攻击者仅能看到最终响应和返回文件)下,该技术在7个技能和4个受害者模型上恢复了原始技能86.8%的能力。 这是在披露防御机制启用情况下,SigLeak效果的大约4倍,每个技能平均仅需32次受害者调用。 论文链接:https://arxiv.org/abs/2608.26733 与论文对话:https://academy.dair.ai/papers/hidden-agent-skills-can-be-stolen-through-normal-use-2608.26733…
查看原文
查看缓存全文

缓存时间: 2026/08/30 12:06

最后,一篇测试隐藏技能文件是否真能提供保护的论文出炉了。简短的答案是:不能。这令人担忧。如果你销售技能访问权限或在团队间共享技能,值得阅读。

这篇新论文对此进行了更深入的探讨:Daydreaming 仅利用服务本身为完成正常任务而设计的普通操作,就重建了一个托管的多文件技能。受害者从未被要求泄露技能或对重建结果进行评分,因此披露过滤器无从捕获。在最弱的访问级别下——攻击者只能看到最终响应和返回的文件——它在 7 个技能和 4 个受害者模型上恢复了原始技能 86.8% 的能力。这大约是 SigLeak 的 4 倍,且在每个技能上仅需中位数 32 次受害者调用,即使启用了披露防御。

论文:https://arxiv.org/abs/2608.26733 与论文聊天:https://academy.dair.ai/papers/hidden-agent-skills-can-be-stolen-through-normal-use-2608.26733…


Daydreaming:通过黑盒任务交互窃取隐藏的智能体技能

来源:https://arxiv.org/html/2608.26733

摘要

智能体技能打包了指令、参考数据和可执行的辅助程序,使通用智能体能够执行专门任务。托管服务提供商可以在出售任务结果访问权限的同时,对这些文件保密,这使得技能本身成为一个有价值的目标。现有的披露防御可以阻止请求获取技能或复制其文本的请求,但它们无法阻止客户提交服务本身旨在完成的普通任务。

我们提出了 Daydreaming,一种仅执行的攻击,通过黑盒任务交互窃取多文件技能。攻击过程中,从未要求受害者泄露技能或对重建结果进行评分。相反,Daydreaming 自适应地创建精心设计的任务,其结果能够区分可能的隐藏行为。它测试单个行为,使用攻击者控制的影子代理进行选择,并利用存储的受害者结果和本地执行检查完成每个文件。

我们形式化了三个嵌套的访问威胁级别:差异级、追踪级和输出级,并重点关注输出级(攻击者只能看到最终响应和返回的文件)。在 7 个技能和 4 个受害者模型上,Daydreaming 在输出级恢复了原始技能 86.8% 的能力,性能几乎是 SigLeak 的 4 倍。即使在启用披露防御的情况下,它也仅需每个技能中位数 32 次受害者调用,即可生成可安装的技能。

这些结果表明,仅仅隐藏技能文件和过滤直接披露,并不能阻止通过正常使用实现的功能性重建。

††脚注:*这些作者贡献相同。

1 引言

通用智能体能力广泛,但现实世界的专门任务需要深度专业知识。现实世界的专家知识常常不仅仅依赖于底层模型的能力:复杂的指令、特定领域的参考材料、调整后的参数、辅助脚本、工具以及精心设计的工作流程,可能都是可靠执行专门任务所必需的。

智能体系统将这些编码为一个 技能,智能体在普通任务接口后加载该技能。一个日益增长的市场以软件即服务的方式销售此类能力,我们称这种环境为 技能即服务,供应商在自己的智能体上托管该技能,客户按任务或订阅付费。软件即服务隐藏程序并收取其计算结果的费用,而 技能即服务 隐藏专业知识,并对其判断收取费用。

现有供应商已在法律、自主医疗编码和安全运营等领域销售托管访问权限,有时按完成的任务收费。托管、仅提供访问的供应商包括 Harvey(法律,https://www.harvey.ai/)和 Dropzone(安全运营,https://www.dropzone.ai/);Nym 销售自主医疗编码;Intercom 的 Fin 按每次解决收费。这些是按任务计量专业知识的实例(2026-08-21 访问)。本文贯穿始终的示例是这种模式的综合;其中宣传的那行文字是我们自己编写的。

此外,这些供应商将隐藏的技能视为受保护的资产,因为他们的服务条款禁止对服务进行逆向工程或使用输出来构建竞争产品,并且受这种商业市场驱动的窃取攻击已经出现在诸如特定领域系统提示等单提示设置中。

然而,随着智能体系统将日益专业的知识打包到托管技能中,技能本身可能成为一个比单一提示更有价值得多的专有资产。构建这样的技能可能需要专家和工程师将领域知识转化为详细的决策逻辑、整理支持数据、调整阈值和参数,并通过反复部署经验来优化工作流程。

例如,一个安全运营供应商为其托管技能只宣传一行字:“调查安全警报并返回带有证据的裁决”,但它可能将多年工程和运营知识保密在其升级规则、威胁指标、参考数据和调整后的阈值中,这些决定了哪些警报值得唤醒分析师。然而,它的客户是其自身网络触发这些警报的企业,因此每个客户都可以将选定的警报提交给该技能,并观察供应商的决定。

技能的执行输出揭示了一条先前防御未涉及的攻击路径。当前防御侧重于 披露路径:检测试图揭示隐藏技能的可疑请求,并阻止复制受保护文本的输出。另一方面,工作路径(使良性用户任务执行成为可能)仍然容易受到行为克隆、逆向工程和重建的影响。因此,执行本身成为观察和行为推断的来源。

我们将这种行为推断的可观察性形式化为三个嵌套级别:输出级、追踪级和差异级,具体取决于部署向客户暴露的信息。

  • 输出级 仅暴露最终响应和返回的文件,使其对攻击者最具限制性和挑战性。
  • 追踪级 另外暴露智能体的中间工具活动,包括调用了哪些工具、它们的输入和返回的结果;此类追踪通常会被呈现,以便客户审计他们未亲自计算的工作。
  • 差异级 提供更丰富的反馈,通过揭示在受控输入变化下输出如何变化。

我们主要关注输出级,因为仅使用最终输出就能成功的攻击,当可用观察更丰富时同样适用。

我们提出 Daydreaming,一种将任务执行视为黑盒系统识别问题的技能窃取攻击。Daydreaming 是 仅执行的:每个查询都要求受害者执行真实任务,从未要求受害者泄露其隐藏技能或比较、评分或纠正重建结果。这使得攻击即使在披露防御已激活的情况下也能运作,我们在此假设中贯穿始终。

Daydreaming 反复构建任务,对于这些任务,合理的属性、技能计划或文件版本会预测不同的结果,然后利用受害者观察到的结果消除替代方案并优化其重建。Daydreaming 不是一次性合成目标技能,而是通过反复探测和修改顺序重建它。

我们主要评估窃取的技能是否能在未见过的输入上重现受害者的任务性能,而不是其文件文本是否与隐藏的原始文件匹配。

在七个技能和三个受害者模型上,Daydreaming 仅使用输出级访问,每个技能平均 31.3–32.8 次受害者调用,就恢复了无技能与原始技能之间行为效用差距的 35.8%–86.8%。它在所有评估的攻击和基线中,对每个受害者模型都实现了最高的行为效用。因此,我们做出以下贡献:

  • 我们将技能窃取攻击者可用的可观察性形式化为三个嵌套的访问级别:差异级 ⊇ 追踪级 ⊇ 输出级,并将所有先前攻击置于该轴上。我们还表明,没有一个级别可以保证精确恢复隐藏的源。
  • 我们构建了 Daydreaming,一种仅执行的技能重建攻击。每个查询都委托普通工作,从未请求隐藏技能或对重建结果进行判断。因此,Daydreaming 即使在披露阻塞、提取输入分类和输出过滤都启用的情况下也能运作。
  • 我们表明 Daydreaming 在最具限制性的访问级别(输出级)下,使用有限的受害者查询数量即可工作。在 7 个技能上,Daydreaming 在输出级恢复了受害者 86.8% 的任务性能,在追踪级和差异级分别为 87.0% 和 86.0%,且攻击者推断成本中位数(见第 6 节)。

2 相关工作

智能体技能。 “技能”一词在先前工作中的使用背景不同。一些工作将技能视为可学习的可重用抽象:PolySkill 学习多态技能,将抽象目标与其具体实现分离,并在 Web 任务间迁移。其他系统以不同形式外部化可重用行为:大型语言模型可以合成分摊昂贵推理的可调用工具,而智能体工作流记忆则诱导重复出现的行动程序并为后续 Web 任务检索它们。这些工作展示了可重用智能体能力的形式,但未研究作为机密、供应商控制资产的技能。我们研究 供应商控制的技能:一个客户可见的名称和描述,配对供应商控制的隐藏指令和可选的参考、资产或可执行辅助程序。在开放技能标准下,名称和描述保持可用以便智能体知道技能何时适用,而指令文档和捆绑文件仅在任务执行期间根据需要加载。技能是围绕通用模型安装的,而不是合并到其权重中,允许重建的技能被复制、安装到另一个智能体上,并独立于受害者服务进行评估。在我们的设计和评估中,“技能”均指此供应商控制环境。

窃取智能体技能。 黑盒模型提取确立了查询访问可以在不复制其实现字节的情况下恢复专有训练模型的功能;技能窃取遵循相同的理念,但目标是一个由自然语言规则和辅助资产组成的模块化、可部署的程序,其评估标准是它所重现的行为,而非精确等同。此后有三项并发研究涉及此设置,每项假设都比我们的更狭窄。BBS 提示智能体显示其自身的指令文件并评分泄露的文本。SigLeak 读取执行轨迹,并且需要服务在技能被抑制的情况下运行一次。RedAct 是一种防御,在发布前编辑轨迹。这些都没有在披露防御活跃的服务上重建多文件技能。我们将它们视为激发而非约束我们设计的并发工作,第 4 节将每个攻击置于可观察性轴上。

窃取系统提示。 最接近的研究场景是窃取隐藏的系统提示。PLeak 针对直接披露优化对抗性查询,而其他研究则从输入输出对或仅从答案重建功能相似的提示。一项实地研究表明,词汇相似性是功能复制的不完全度量,而提示混淆研究则关注防御方面。最接近我们框架的是,信息论分析表明,每次查询的可恢复性取决于暴露哪个响应通道。系统提示是文本,而技能是由指令、脚本和参考数据组成的可部署程序。因此,重建技能不仅需要恢复其措辞,还需要恢复其文件、它们的作用以及它们如何协同工作,最终通过重建的技能是否能执行来评判。

3 威胁模型

我们的威胁模型围绕一个攻击者展开,该攻击者是 技能即服务 服务的付费客户,最多进行有限数量(B)的查询,并旨在在此预算内从专有技能中窃取尽可能多的功能。攻击者只能看到公开的技能卡片 d = (ν, σ),其中 ν 是公开的技能名称,σ 是其简短描述。攻击者从一个无技能的智能体 V∅ = (M, Π, T, ∅) 开始,并旨在重建供应商保留的、托管受害者智能体 VS = (M, Π, T, S) 使用的技能 S。在这两个智能体内部,M 是语言模型,Π 是智能体编排策略(包括其系统指令和工具路由逻辑),T 是任务工具集。关键区别在于隐藏的技能:受害者安装 S = (m, R),其中 m 是主要指令文档,R 是有限的支持资源集,例如脚本、参考文档、模板或数据文件。此技能是攻击者针对的专有资产,攻击者没有 S 的副本,也无法读取受害者的文件、内存、私有推理或技能加载操作。

在执行期间,攻击者向 VS 提交任务 x,并观察最终输出 yS(x),包括智能体的消息和任何返回的文件。在部署设置中轨迹可见时,我们额外用 trS(x) = ((g1, r1), …, (gk, rk)) 表示客户端可见的执行轨迹,其中 gi 表示第 i 次工具调用及其参数,ri 是相应的返回值。攻击者可以根据先前的观察调整未来的查询,并使用自己的影子代理和本地工具,但必须保持在 B 次查询预算内,并且不能使用受害者的披露路径直接请求或恢复隐藏的技能。

运行示例。 为了使威胁模型和符号更具体,我们在整篇论文中使用一个运行 技能即服务 示例:安全警报分诊,如图 1 所示。

  • • 攻击场景。 一个安全运营…

相似文章

SkillJack:自我进化智能体中的持久性技能后门

Hugging Face Daily Papers

本文介绍了SkillJack,这是首个针对自我进化智能体“经验到技能”管线的攻击,表明被投毒的经验可以被转化为持久的恶意技能,从而逃避检测并在原始记录被删除后依然存活。