EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架
摘要
EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。
查看缓存全文
缓存时间: 2026/09/11 06:15
论文页面 - EvoSafeHarness:为安全智能体演化模型与领域专用护栏
来源:https://huggingface.co/papers/2609.05903
摘要
EvoSafeHarness 通过联合搜索针对冻结模型和目标领域量身定制的自然语言策略与可执行逻辑,优化可部署的安全护栏,在多个智能体基准测试中改进了安全性与实用性的权衡。
大型语言模型(LLM)智能体正将语言转化为现实世界的影响,因此需要防范间接提示注入(https://huggingface.co/papers?q=indirect%20prompt%20injection)和直接有害请求。系统级安全护栏(https://huggingface.co/papers?q=System-level%20safety%20harness)在模型级防御之外增加了一层执行机制,但现有的护栏通常由专家设计一次,然后应用于异构的模型和领域。有效的保护依赖于部署:模型在实用性下降前所需的强制程度各不相同,而领域在需要监管的效果、状态和动作序列方面也存在差异。对一个模型足够严格的护栏可能对另一个模型过度阻止,而一个可跨领域迁移的策略可能忽略特定应用的安全关联。
我们提出 EvoSafeHarness(https://huggingface.co/papers?q=EvoSafeHarness),这是一个安全专用优化框架,旨在为目标领域的冻结模型综合生成可部署的护栏。它联合搜索自然语言策略(https://huggingface.co/papers?q=natural-language%20policy)和可执行代码逻辑(https://huggingface.co/papers?q=executable%20code%20logic),由模型行为、领域规范以及新鲜上下文的对抗性审查(https://huggingface.co/papers?q=adversarial%20review)指导,以拒绝基准特定的规则。
在四个智能体基准测试系列中,EvoSafeHarness(https://huggingface.co/papers?q=EvoSafeHarness)实现了比固定专家设计防御更强的安全性-实用性前沿(https://huggingface.co/papers?q=safety-utility%20frontier)。在 DecodingTrust-Agent(https://huggingface.co/papers?q=DecodingTrust-Agent)上,它将平均攻击成功率(https://huggingface.co/papers?q=attack%20success%20rate)从45.6%降低至10.0%,实用性成本为3.3个百分点,并在15个单元中的14个取得了最佳分数。在 AgentDojo(https://huggingface.co/papers?q=AgentDojo)上,它在0.0% ASR下达到了82.8%的实用性,是 CaMeL 在相同操作点上实用性的两倍,并能原封不动地迁移至未见过的 AgentDyn 套件。它还在 Agent-SafetyBench 上为每个受害者都取得了最佳分数,并在16次细化预算下,将自适应 PAIR 攻击(https://huggingface.co/papers?q=PAIR%20attacks)的平均ASR保持在20%以下。
分析表明,领域语义决定了需要哪些安全关联和轨迹状态,而模型及运行时行为决定了这些关联应如何以及在何处被强制执行。
查看 arXiv 页面 (https://arxiv.org/abs/2609.05903) 查看 PDF (https://arxiv.org/pdf/2609.05903) 项目页面 (https://andylinx.github.io/EvoSafeHarness/) GitHub1 (https://github.com/SaFo-Lab/EvoSafeHarness) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.05903)
在您的智能体中获取此论文:
hf papers read 2609\.05903
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。
引用此论文的空间0
没有空间关联此论文
在空间 README.md 中引用 arxiv.org/abs/2609.05903 以从此页面关联。
包含此论文的收藏夹0
没有收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection) 以从此页面关联。
相似文章
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
EvoHarness-RL:为长时程LLM智能体学习自进化运行时框架
介绍了EvoHarness-RL,一个为长时程LLM智能体学习运行时框架策略的框架,使其能够在任务执行过程中构建和更新外部状态(信念、进度、经验)。在ALFWorld上使用Qwen3-8B,它达到了96.9%的成功率,并揭示了框架退火和进化动态。
HarnessRisk:一个面向生命周期的代理工具安全性基准测试
HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。
EVOHARNESSBENCH: 你的代理能否跟上不断演进的框架?
本文介绍了EVOHARNESSBENCH,一个用于评估在工具、技能和代理框架不断演进下的LLM代理的基准测试,揭示了在保持和适应方面的差距。
重新审视智能体框架演进的评估
本文重新评估了 LLM 智能体自动框架演进的方法论,指出其收益可能源于额外的测试时搜索而非改进的框架设计,并且在相同基准上的评估存在过拟合风险。实验表明,框架演进并不始终优于更简单的测试时扩展方法。