从序列到结构:LLM智能体的关系不确定性传播

Hugging Face Daily Papers 论文

摘要

本文提出RUPA,一个框架,将LLM智能体的执行建模为依赖图以传播不确定性,改进长轨迹中的故障检测和置信度估计。

可靠的不确定性量化(UQ)对于在复杂交互环境中部署大型语言模型(LLM)智能体至关重要。现有的UQ方法主要依赖于局部信号,如令牌概率、预测熵或每一步置信度,因此忽略了错误在整个执行轨迹中累积的长期依赖关系。结果,它们可能无法识别那些原因在最终答案之前几个推理或交互步骤就已产生的智能体故障。我们提出RUPA(智能体的关系不确定性传播),一个面向LLM智能体的轨迹级UQ框架。RUPA将执行历史表示为一个有向轨迹图,其中推理状态、工具交互和环境反馈是节点,由时间和语义依赖边连接。然后,它在这个图上传播不确定性,以捕获执行风险如何在交互步骤之间累积和转移。传播的信号与轨迹级行为特征和目标对齐信息结合,为整个智能体轨迹产生置信度估计。我们在代表性智能体基准上评估RUPA,包括τ-2、Terminal-Bench-2和GAIA,使用6个跨多个模型系列的开源LLMs。实验结果表明,RUPA通过提供更准确的不确定性估计、实现更早的故障检测,并在多样化的智能体任务中改进不确定性引导的智能体执行,始终优于现有的UQ方法。这些结果表明,明确建模关系依赖对于长时域LLM智能体的可靠UQ至关重要,为可信赖的智能体执行提供了实际基础。
查看原文
查看缓存全文

缓存时间: 2026/08/19 03:58

论文页面 - 从序列到结构:面向LLM智能体的关系不确定性传播

来源:https://huggingface.co/papers/2608.16002

摘要

RUPA将智能体执行建模为依赖图,以在长轨迹中传播不确定性,从而提升LLM智能体的故障检测与置信度估计能力。

可靠的不确定性量化(https://huggingface.co/papers?q=uncertainty%20quantification)(UQ)对于在复杂交互环境中部署大语言模型(LLM)智能体至关重要。现有UQ方法主要依赖局部信号,如词元概率、预测熵或单步置信度,因此忽略了错误在执行轨迹中通过长程依赖累积的过程。这可能导致它们无法识别那些根源早在最终答案之前多个推理或交互步骤的智能体故障。我们提出RUPA(面向智能体的关系不确定性传播(https://huggingface.co/papers?q=Uncertainty%20Propagation)),一个面向LLM智能体(https://huggingface.co/papers?q=LLM%20agents)的轨迹级UQ(https://huggingface.co/papers?q=trajectory-level%20UQ)框架。RUPA将执行历史表示为有向轨迹图(https://huggingface.co/papers?q=directed%20trajectory%20graph),其中推理状态、工具交互和环境反馈是节点,通过时间和语义依赖边连接。随后,它在该图上传播不确定性,以捕捉执行风险如何在交互步骤间累积与传递。传播的信号与轨迹级行为特征及目标对齐信息相结合,为整个智能体轨迹生成置信度估计。我们在τ-2、Terminal-Bench-2和GAIA等代表性智能体基准上对RUPA进行了评估,使用了涵盖多个模型家族的6个开源LLM。实验结果表明,RUPA通过提供更准确的不确定性估计、实现更早的故障检测,以及在各种智能体任务中提升不确定性引导的智能体执行效果,持续优于现有UQ方法。这些结果证明,显式建模关系依赖(https://huggingface.co/papers?q=relational%20dependency)对于长期LLM智能体(https://huggingface.co/papers?q=LLM%20agents)的可靠UQ至关重要,为可信赖的智能体执行提供了实用基础。

查看arXiv页面 (https://arxiv.org/abs/2608.16002) 查看PDF (https://arxiv.org/pdf/2608.16002) GitHub1 (https://github.com/icip-cas/RUPA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16002)

在您的智能体中获取此论文:

hf papers read 2608.16002

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.16002以从本页面链接。

引用此论文的数据集0

无数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.16002以从本页面链接。

引用此论文的空间0

无空间链接此论文

在空间README.md中引用arxiv.org/abs/2608.16002以从本页面链接。

包含此论文的收藏集0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化

arXiv cs.CL

本文研究单轮不确定性量化方法是否能迁移到交互式LLM智能体轨迹中,在五个LLM和四个工具使用数据集上评估了白盒、黑盒和反思型评分器。结果表明迁移效果参差不齐,黑盒自洽性通常最强,并建议在轨迹层面重新验证UQ方法。

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

基于LLM的多智能体系统中作为收敛压力的关系先验

arXiv cs.CL

本文研究了在基于LLM的多智能体系统中,使智能体间关系语义显式化如何充当收敛压力,提高一致性但并不稳定地提升准确性。作者认为,关系先验应被诊断性地、针对具体任务地使用,而非作为默认附加项。