EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架

Hugging Face Daily Papers 论文

摘要

EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。

大语言模型(LLM)智能体正将语言转化为现实世界的影响,因此有必要防范间接提示注入和直接有害请求。系统级安全框架在模型级防御之外增加了一层执行层,但现有的框架通常由专家设计一次,然后应用于异构的模型和领域。有效的保护依赖于部署:模型在效用下降前所需的执行程度不同,而领域在必须管理的效果、状态和动作序列上也存在差异。对一个模型足够严格的框架可能对另一个模型过度阻塞,而跨领域转移的策略可能忽略应用特定的安全关系。 我们提出EvoSafeHarness,一个安全特定的优化框架,为目标域中的冻结模型合成可部署的框架。它联合搜索自然语言策略和可执行代码逻辑,由模型行为、领域规范和新鲜上下文对抗审查引导,以拒绝基准特定规则。在四个智能体基准族中,EvoSafeHarness实现了比固定专家设计防御更强的安全-效用前沿。在DecodingTrust-Agent上,它将平均攻击成功率(ASR)从45.6%降低到10.0%,效用成本为3.3个百分点,并在15个单元中的14个获得最佳分数。在AgentDojo上,它在0.0% ASR时达到82.8%的效用,是CaMeL在相同操作点效用的两倍,并且不变地转移到未见的AgentDyn套件。它还在Agent-SafetyBench上为每个受害者获得最佳分数,并在自适应PAIR攻击下,以16的精炼预算保持平均ASR低于20%。分析表明,领域语义决定了需要哪些安全关系和轨迹状态,而模型和运行时行为决定了这些关系应如何以及在哪里执行。
查看原文
查看缓存全文

缓存时间: 2026/09/11 06:15

论文页面 - EvoSafeHarness:为安全智能体演化模型与领域专用护栏

来源:https://huggingface.co/papers/2609.05903

摘要

EvoSafeHarness 通过联合搜索针对冻结模型和目标领域量身定制的自然语言策略与可执行逻辑,优化可部署的安全护栏,在多个智能体基准测试中改进了安全性与实用性的权衡。

大型语言模型(LLM)智能体正将语言转化为现实世界的影响,因此需要防范间接提示注入(https://huggingface.co/papers?q=indirect%20prompt%20injection)和直接有害请求。系统级安全护栏(https://huggingface.co/papers?q=System-level%20safety%20harness)在模型级防御之外增加了一层执行机制,但现有的护栏通常由专家设计一次,然后应用于异构的模型和领域。有效的保护依赖于部署:模型在实用性下降前所需的强制程度各不相同,而领域在需要监管的效果、状态和动作序列方面也存在差异。对一个模型足够严格的护栏可能对另一个模型过度阻止,而一个可跨领域迁移的策略可能忽略特定应用的安全关联。

我们提出 EvoSafeHarness(https://huggingface.co/papers?q=EvoSafeHarness),这是一个安全专用优化框架,旨在为目标领域的冻结模型综合生成可部署的护栏。它联合搜索自然语言策略(https://huggingface.co/papers?q=natural-language%20policy)和可执行代码逻辑(https://huggingface.co/papers?q=executable%20code%20logic),由模型行为、领域规范以及新鲜上下文的对抗性审查(https://huggingface.co/papers?q=adversarial%20review)指导,以拒绝基准特定的规则。

在四个智能体基准测试系列中,EvoSafeHarness(https://huggingface.co/papers?q=EvoSafeHarness)实现了比固定专家设计防御更强的安全性-实用性前沿(https://huggingface.co/papers?q=safety-utility%20frontier)。在 DecodingTrust-Agent(https://huggingface.co/papers?q=DecodingTrust-Agent)上,它将平均攻击成功率(https://huggingface.co/papers?q=attack%20success%20rate)从45.6%降低至10.0%,实用性成本为3.3个百分点,并在15个单元中的14个取得了最佳分数。在 AgentDojo(https://huggingface.co/papers?q=AgentDojo)上,它在0.0% ASR下达到了82.8%的实用性,是 CaMeL 在相同操作点上实用性的两倍,并能原封不动地迁移至未见过的 AgentDyn 套件。它还在 Agent-SafetyBench 上为每个受害者都取得了最佳分数,并在16次细化预算下,将自适应 PAIR 攻击(https://huggingface.co/papers?q=PAIR%20attacks)的平均ASR保持在20%以下。

分析表明,领域语义决定了需要哪些安全关联和轨迹状态,而模型及运行时行为决定了这些关联应如何以及在何处被强制执行。

查看 arXiv 页面 (https://arxiv.org/abs/2609.05903) 查看 PDF (https://arxiv.org/pdf/2609.05903) 项目页面 (https://andylinx.github.io/EvoSafeHarness/) GitHub1 (https://github.com/SaFo-Lab/EvoSafeHarness) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05903)

在您的智能体中获取此论文:

hf papers read 2609\.05903

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。

引用此论文的空间0

没有空间关联此论文

在空间 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。

包含此论文的收藏夹0

没有收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。

相似文章

EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架

arXiv cs.LG

介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。

重新审视智能体框架演进的评估

arXiv cs.AI

本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。