ToolHazard:为基于LLM的智能体扩展安全评估与对齐的对抗环境

Hugging Face Daily Papers 论文

摘要

ToolHazard是一个可扩展的框架,通过合成对抗环境来测试LLM智能体面对间接提示注入的鲁棒性,揭示漏洞,并通过ToolHazard-Bench基准提升防御性对齐。

集成外部工具的大型语言模型(LLM)智能体容易受到环境中嵌入的间接提示注入攻击。然而,现有研究大多依赖手动实现或复用的环境、基于LLM的随机工具模拟以及预定义的注入位置,限制了在更广泛领域中的可扩展安全研究。为弥补这一差距,我们提出了**ToolHazard**,一种可扩展的对抗环境合成框架,减少了人工工程,并支持通过额外种子领域和计算资源进行扩展。通过环境模拟器、攻击者智能体和用户模拟器,ToolHazard合成可执行的有状态环境,发现可行的注入点并生成特定于环境的载荷,并构建基于状态的长时程任务。基于ToolHazard,我们构建了**ToolHazard-Bench**,用于在复杂工作流和多样化环境攻击下对智能体进行压力测试。实验揭示了智能体的重大漏洞,并表明注入时机和位置会影响攻击效果。此外,ToolHazard生成的对齐数据在ToolHazard-Bench和AgentDojo上均提升了安全性,同时保持了良性任务的效用。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:35

论文页面 - ToolHazard:扩展对抗性环境,用于基于 LLM 的智能体的安全评估与对齐

来源:https://huggingface.co/papers/2608.11878

摘要

ToolHazard 是一个可扩展的框架,通过合成对抗性环境来测试 LLM 智能体抵御间接提示注入的能力,并揭示漏洞及改进防御性对齐。

集成了外部工具的大型语言模型(LLM)智能体容易受到环境状态中嵌入的间接提示注入的影响。然而,现有研究大多依赖于手动实现或复用的环境、基于随机 LLM 的工具模拟以及预定义的注入位置,这限制了在更广泛领域中进行可扩展安全研究的可能性。为弥补这一差距,我们提出了 ToolHazard,一个可扩展的对抗性环境合成框架,它减少了人工工程,并支持通过额外的种子领域和计算资源进行扩展。通过环境模拟器、攻击者智能体和用户模拟器,ToolHazard 合成了可执行的有状态环境,发现可行的注入点并生成针对特定环境的载荷,同时构建基于状态的长期任务。基于 ToolHazard,我们构建了 ToolHazard-Bench,用于在复杂工作流和多样化环境攻击下对智能体进行压力测试。实验揭示了智能体的重大漏洞,并表明注入时机和位置会影响攻击效果。此外,ToolHazard-生成的对齐数据在 ToolHazard-Bench 和 AgentDojo 上均提高了安全性,同时保持了良性任务效用。

查看 arXiv 页面 (https://arxiv.org/abs/2608.11878) 查看 PDF (https://arxiv.org/pdf/2608.11878) GitHub5 (https://github.com/MurrayTom/ToolHazard) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11878)

在你的智能体中获取此论文:

hf papers read 2608\.11878

没有最新版的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。

引用此论文的 Spaces 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.11878,以从此页面链接它。

包含此论文的集合 0

没有集合包含此论文

将此论文添加到集合中以从此页面链接它。

相似文章

受控智能体的集合切换行为测试

arXiv cs.AI

本文介绍了一个基准测试,用于评估当可靠工具在会话中悄然发生变化时,LLM智能体如何调整其工具选择,借鉴了认知心理学中的集合切换概念。该测试对开放权重LLM进行了评估,并根据工具集合的框架识别出不同的失败模式。

通过对抗性黑客-修复循环强化代理基准测试

Hugging Face Daily Papers

研究人员提出了一种利用LLM代理的对抗性黑客-修复循环,自动修补代理基准测试中脆弱的验证器,在KernelBench上将攻击成功率从62%降至0%,并证明较弱的防御者可以压制更强的攻击者。

当较低权限即足够:探究LLM Agent中的过度权限工具选择

Hugging Face Daily Papers

本文研究了LLM Agent中的过度权限工具选择问题,引入了ToolPrivBench来评估并缓解不必要的高权限工具使用。研究发现,安全对齐并不能确保最小权限选择,并提出了一种训练后防御方法,能够在不牺牲性能的情况下减少过度权限的使用。

大规模安全测试LLM智能体:从风险发现到基于证据的验证

arXiv cs.AI

本文介绍了Vera,一个面向LLM智能体的端到端自动化安全测试框架,它结合了文献驱动的风险发现、安全案例的组合式构建以及基于证据的验证。在四个智能体框架上的评估揭示了显著的安全缺陷,在多通道攻击下平均攻击成功率高达93.9%,同时发布了包含1600个可执行安全案例的Vera-Bench。