TRUSS: 面向任务可靠和用户安全的自动化代理技能生成

arXiv cs.AI 论文

摘要

TRUSS 是一个证据引导的框架,用于生成功能有效且安全可靠的代理技能,将任务有效性从 17.11% 提高到 52.94%,并将安全率提高到 100%。

arXiv:2608.17588v1 公告类型:新 摘要:代理技能将可重用的自然语言过程与可执行资源打包,使软件代理无需模型适应即可获取特定任务的能力。自动生成此类技能可以提高任务性能,但仅通过其工件或最终任务结果来评估候选技能,无法解决装备了该技能的代理将执行哪些操作以及这些操作会产生哪些副作用的问题。我们提出了 TRUSS,一个用于生成功能有效且安全可靠的代理技能的证据引导框架。TRUSS 首先根据源代码和领域证据检查功能声明,同时根据九个预定义的安全属性评估完整的工件。通过此静态关卡的候选技能由阴影代理加载到可控执行环境中,在那里代理工具将请求的操作暴露给策略执行,并将其结果记录为保留来源的执行轨迹。功能故障和属性违规被链接回负责的技能内容,并用于指导迭代改进。 我们在 168 个 SkillInject 工件、155 个 SkillSafetyBench 案例和 SkillGenBench 中的所有 187 个任务上评估了 TRUSS。TRUSS 在漏洞检测中实现了 100.00% 的精度和召回率。修复将 GPT 5.5 的攻击成功率从 38.71% 降低到 19.35%,将 GPT 5.4 的攻击成功率从 46.45% 降低到 29.68%,且无攻击回归。对于技能生成,TRUSS 将无技能时的任务有效性从 17.11% 提高到 52.94%,同时将基准安全率从 50.80% 提高到 100.00%。这些结果表明,执行证据可以暴露工件检查中遗漏的行为故障,并可以指导技能生成功能联合验证的功能和安全结果。
查看原文
查看缓存全文

缓存时间: 2026/08/19 10:07

# 面向任务可靠与用户安全的自动化代理技能生成
来源:https://arxiv.org/html/2608.17588
## TRUSS:面向任务可靠与用户安全的自动化代理技能生成
会议:ACM软件工程基础国际会议;2027年7月12–16日;中国深圳
ACM软件工程基础国际会议论文集,2027年7月12–16日,中国深圳
CCS:安全与隐私 软件安全工程
CCS:软件及其工程 软件验证与确认
2027© , 2027;

###### 摘要

代理技能将可复用的自然语言流程与可执行资源打包,使软件代理无需模型适配即可获取特定任务能力。自动生成此类技能虽能提升任务性能,但仅从技能产物或最终任务结果评估候选方案,无法明确配备该技能的代理将执行哪些操作及这些操作会产生何种副作用。本文提出TRUSS,一个基于证据引导的框架,用于生成功能有效且安全可靠的代理技能。TRUSS首先对照源证据与领域证据核查功能声明,同时基于九项预定义安全属性评估完整产物。通过此静态关卡的候选方案被加载到可控执行环境中的影子代理内,其中代理通过工具中介暴露操作请求至策略执行层,并将执行结果记录为保持来源的执行轨迹。功能故障与属性违规被关联至对应的技能内容,用于指导迭代优化。

我们在168个SkillInject产物、155个SkillSafetyBench案例及SkillGenBench全部187个任务上评估TRUSS。TRUSS在漏洞检测中达到100.00%的精确率与召回率。修复操作使攻击成功率在GPT 5.5上从38.71%降至19.35%,在GPT 5.4上从46.45%降至29.68%,且未引发攻击回归。在技能生成方面,TRUSS将任务有效性从无技能时的17.11%提升至52.94%,同时将基准安全率从50.80%提高至100.00%。这些结果表明:执行证据能揭示产物检查遗漏的行为缺陷,并能引导技能生成趋向联合验证的功能与安全目标。

###### 关键词:
编码代理,代理技能,运行时验证,程序修复,软件安全

## 1. 引言

基于大语言模型(LLM)的代理正迅速超越虚拟规划阶段,转向直接执行现实世界任务。为更好地应对专业或流程化场景,开发者通过将可复用工作流、领域特定知识和工具集成打包为文件式指令来扩展这些代理,从而在无需模型调优的情况下有效提升代理性能(Wang等,2024;Nottingham等,2024;Li等,2026)。我们将此类可复用包称为技能。目前,技能制作高度依赖人工构建。生成技能需要将领域流程转化为代理可解释并能跨不同任务可靠执行的指令,这需要专业知识和反复的行为验证。随着目标任务数量和多样性的急剧增加,自动化技能构建已成为重要研究课题(Nottingham等,2024;Alzubi等,2026;Liang等,2026;Zhou等,2026)。

*功能有效性*要求技能在其预期任务上产生经验证的改进。近期研究已采用配对评估作为必要评估方案,以确保预期任务的性能提升不会以牺牲基础代理已成功完成的任务为代价(Li等,2026)。*安全可靠性*要求技能引发的每个操作都需完成功能目标,且不引入超出预期和用户授权范围的安全相关行为。当前代理系统为所有安装的技能授予完整本地用户权限,且极少审查或交互确认。近期安全研究表明,不安全的技能可能为基于LLM的代理引入严重漏洞,使用户及其本地环境面临重大安全风险(Liu等,2026b)。主要代理提供商如OpenAI和Anthropic已明确警告:第三方或外部来源技能中的漏洞可能导致有害操作,并可能对用户本地系统造成严重损害(OpenAI,2026;Anthropic,2025)。因此,可靠的生成技能不应在执行流程中使本地系统面临潜在安全风险,例如执行未授权系统命令、调用高风险工具、访问恶意或不可信链接,或窃取敏感数据。

然而,*功能有效性*与*安全可靠性*通过技能的操作特异性相互作用。详细流程和可执行辅助程序可通过减少模糊性提高任务成功率,同时扩大代理可用动作空间并引入不确定行为。主要依赖指令文本静态分析的生成管道往往难以识别功能有效性与安全可靠性之间的最佳平衡点。例如,专业技能通常指导代理检索安装片段并后续执行。由此产生的下载和执行链仅在多个单独看似合理的操作后显现。现有技能自动生成工作通常仅使用少数属性对生成技能的功能性或安全性进行静态检查,未能评估其在动态执行场景中的状态(Nottingham等,2024;Zhou等,2026;Paz等,2026)。这导致生成迭代过程未能完全捕获技能性能,生成的技能在实际场景中可能暴露更多问题。

本文提出TRUSS(任务可靠与用户安全的技能生成),一个融合动态执行证据的自动化技能构建框架。在依赖静态属性检查的先前工作基础上,TRUSS进一步在可控执行环境(CEE)中观察候选技能,并利用生成的执行轨迹指导迭代优化。TRUSS支持两种生成模式:任务条件模式(生成期间目标任务可用)和任务无关模式(从源材料构建技能而不预设下游任务)。通过将CEE中的执行轨迹抽象为属性级证据,并结合预定义的静态检查,TRUSS通过混合静态-动态验证过程为生成技能提供功能与安全保证。跨多样基准和指标的评估表明,TRUSS在功能和安全性能上持续提升技能生成质量。在漏洞检测方面,TRUSS对匹配的清洁/注入技能对达到100%精确率和召回率。此外,在SkillSafetyBench上的修复测试显示,TRUSS在GPT-5.5上将有害率从38.70%降至19.35%(消除19.35%),在GPT-5.4上从46.45%降至29.68%(消除16.77%),且未对先前成功的任务产生回归。在两种输入模式下的187个生成任务中,TRUSS在保持可复用性和运行时安全性的同时,持续提供相对于基础代理的经验证改进。

本文贡献如下:
- 我们的实证研究揭示:静态技能筛选未能检测显著数量的运行时漏洞,强调需要以执行感知验证补充产物级检查。
- 我们开发了TRUSS,一个自动化生成与优化框架,它超越了对技能产物的静态检查,转而关注产物被代理加载后引发的行为。
- 通过跨3个代理和5个模型的综合评估,TRUSS在多个方面展现显著性能提升,表明运行时证据能弥补静态检查遗留的检测误差,并指导修复操作,在保留先前成功任务行为的同时大幅降低攻击成功率。

## 2. 相关工作

### 2.1. 自动化技能生成

自动化技能生成旨在将任务经验和外部知识转化为可复用的过程资产,以在不更新模型参数的情况下改进代理。执行引导方法通过下游代理性能评估候选技能。Skill Set Optimization从与高环境奖励相关的轨迹中构建可迁移技能(Nottingham等,2024)。EvoSkill分析失败执行并保留能在验证集上改进性能的生成技能文件夹(Alzubi等,2026)。这些方法使候选技能暴露于可执行代理环境,并使用观测到的任务结果指导后续生成。其选择目标由功能奖励或答案正确性定义。因此,即使轨迹包含未授权文件访问、危险命令执行或非预期网络通信,候选方案在产生预期结果后仍可能获得正向优化信号。其证据覆盖也遵循固定任务划分和任务特定验证器。未执行场景下的环境条件分支和安全相关行为无法为生成过程提供信号。

另一方向在部署前评估生成产物的多项属性。SkillNet从轨迹、仓库、文档和用户指令中构建技能,并评估其安全性、完整性、可执行性、可维护性和成本(Liang等,2026)。其安全评估主要通过LLM评估器应用预定义规则,同时沙盒执行确定打包代码和工具调用是否可执行。该设计将安全可靠性纳入技能质量评估,并能识别生成指令和可执行组件中可见的风险。其安全证据仍集中于产物可观察属性。状态相关工具参数、跨多步骤的操作组合以及代理执行期间产生的持久效果仍超出优化信号范围。

TRUSS在单一循环中结合静态与动态验证。静态检查验证声明任务、所需能力、可执行组件、数据访问和预期副作用间的一致性。通过关卡的候选方案由影子代理在CEE中执行。功能结果与安全属性在同一轨迹上评估,区分成功执行与不安全中间行为。观测到的信息流和副作用成为优化证据。这种联合反馈使TRUSS能在移除仅当技能与执行环境交互后才可见的漏洞的同时,保留经验证的任务改进。

### 2.2. 代理技能的安全性

代理技能构成安全关键扩展层,因其自然语言指令和打包资源影响具备系统命令执行和外部网络资源访问权限的代理。技能的有效权限遵循其宿主代理暴露的权限。在本地编码代理部署中,此权限可能包括访问敏感用户数据和在本地用户账户下执行(Liu等,2026a)。大规模分析发现,26.1%的被检技能至少包含一个漏洞,数据窃取和权限提升是最普遍的类别(Liu等,2026b)。行为研究表明,良性请求可能激活嵌入在技能或其执行上下文中的有害指令。Skill Inject展示了跨前沿代理的严重技能文件攻击,而SkillSafetyBench在可执行环境中重现了此类故障(Schmotz等,2026;Jin等,2026)。SkillSpector识别安装前可见的风险,而运行时验证捕获调用后出现的行为(Paz等,2026)。

代理提供商认识到相同的执行边界。Anthropic警告恶意技能可能指导代理窃取数据或执行非预期操作(Anthropic,2025)。OpenAI将沙盒、审批策略和网络控制确定为执行模型生成操作的编码代理的核心保障(OpenAI,2026)。这些发现促使安全可靠性成为完整执行轨迹的属性。TRUSS将此属性直接纳入技能生成,使运行时违规在候选方案进入最终技能库前指导修订。

## 3. 方法论

### 3.1. 符号与问题表述

令C表示生成技能的源语料库,G表示技能生成器。生成的技能S是一个标准化产物,其过程内容和可执行资源可被固定代理𝒜加载,该代理在交互执行环境的同时解释该产物。

我们研究两种生成模式,其区别在于G可用的信息。在*任务条件模式*下,G接收C连同公开的任务规范T,产生S=G(C,T),而P表示与T相关的保留实例分布。在*任务无关模式*下,G接收C,产生S=G(C),而P表示生成期间隐藏的下游任务分布。无论哪种模式,x∼P表示用于评估生成技能的单个任务实例。

对于实例x,我们标记代理𝒜加载S后产生的完整执行轨迹为τ^S(x)(τ^∅(x)为空技能条件下的对应轨迹)。我们将S的功能有效性定义为相对于空技能条件的预期效用增益:

(1)F(S,P) = E_{x∼P}[U(x,τ^S(x)) - U(x,τ^∅(x))]
其中U(x,τ)∈[0,1]是轨迹τ在x上的外部评估任务效用。

对于安全可靠性,令J表示框架考虑的安全属性数量,j∈{1,...,J}。

相似文章

SkillHarness:为计算机使用代理驾驭安全技能

Hugging Face Daily Papers

SkillHarness 是一个框架,通过整合安全约束和自适应技能选择机制,使计算机使用代理能够在动态环境中安全地学习和执行技能,将不安全率降低了57.1%。

SkillGen:经过验证的推理时代理技能合成

arXiv cs.LG

本文介绍了 SkillGen,这是一个多智能体框架,通过对比成功和失败的轨迹来合成和验证可复用的推理时大语言模型(LLM)代理技能。该方法确保技能可审计,并通过实证验证其对代理性能具有净正面影响。