ToolHazard:为基于LLM的智能体扩展安全评估与对齐的对抗环境
摘要
ToolHazard是一个可扩展的框架,通过合成对抗环境来测试LLM智能体面对间接提示注入的鲁棒性,揭示漏洞,并通过ToolHazard-Bench基准提升防御性对齐。
查看缓存全文
缓存时间: 2026/08/13 15:35
论文页面 - ToolHazard:扩展对抗性环境,用于基于 LLM 的智能体的安全评估与对齐
来源:https://huggingface.co/papers/2608.11878
摘要
ToolHazard 是一个可扩展的框架,通过合成对抗性环境来测试 LLM 智能体抵御间接提示注入的能力,并揭示漏洞及改进防御性对齐。
集成了外部工具的大型语言模型(LLM)智能体容易受到环境状态中嵌入的间接提示注入的影响。然而,现有研究大多依赖于手动实现或复用的环境、基于随机 LLM 的工具模拟以及预定义的注入位置,这限制了在更广泛领域中进行可扩展安全研究的可能性。为弥补这一差距,我们提出了 ToolHazard,一个可扩展的对抗性环境合成框架,它减少了人工工程,并支持通过额外的种子领域和计算资源进行扩展。通过环境模拟器、攻击者智能体和用户模拟器,ToolHazard 合成了可执行的有状态环境,发现可行的注入点并生成针对特定环境的载荷,同时构建基于状态的长期任务。基于 ToolHazard,我们构建了 ToolHazard-Bench,用于在复杂工作流和多样化环境攻击下对智能体进行压力测试。实验揭示了智能体的重大漏洞,并表明注入时机和位置会影响攻击效果。此外,ToolHazard-生成的对齐数据在 ToolHazard-Bench 和 AgentDojo 上均提高了安全性,同时保持了良性任务效用。
查看 arXiv 页面 (https://arxiv.org/abs/2608.11878) 查看 PDF (https://arxiv.org/pdf/2608.11878) GitHub5 (https://github.com/MurrayTom/ToolHazard) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11878)
在你的智能体中获取此论文:
hf papers read 2608\.11878
没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。
引用此论文的 Spaces 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。
包含此论文的集合 0
没有集合包含此论文
将此论文添加到集合中以从此页面链接它。
相似文章
受控智能体的集合切换行为测试
本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。
通过对抗性黑客-修复循环强化代理基准测试
研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。
HazardAuditor: 从可执行威胁到更安全的计算机使用代理
HazardAuditor 引入了一个基于执行的框架,用于监督计算机使用代理的安全性,其中 Guard Policy Optimization 将安全结果的准确率提高了多达 16.5%,相比之前的方法。
当较低权限即足够:探究LLM Agent中的过度权限工具选择
本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。
大规模安全测试LLM智能体:从风险发现到基于证据的验证
本文介绍了Vera,一个面向LLM智能体的端到端自动化安全测试框架,它结合了文献驱动的风险发现、安全案例的组合式构建以及基于证据的验证。在四个智能体框架上的评估揭示了显著的安全缺陷,在多通道攻击下平均攻击成功率高达93.9%,同时发布了包含1600个可执行安全案例的Vera-Bench。