从序列到结构:LLM智能体的关系不确定性传播
摘要
本文提出RUPA,一个框架,将LLM智能体的执行建模为依赖图以传播不确定性,改进长轨迹中的故障检测和置信度估计。
查看缓存全文
缓存时间: 2026/08/19 03:58
论文页面 - 从序列到结构:面向LLM智能体的关系不确定性传播
来源:https://huggingface.co/papers/2608.16002
摘要
RUPA将智能体执行建模为依赖图,以在长轨迹中传播不确定性,从而提升LLM智能体的故障检测与置信度估计能力。
可靠的不确定性量化(https://huggingface.co/papers?q=uncertainty%20quantification)(UQ)对于在复杂交互环境中部署大语言模型(LLM)智能体至关重要。现有UQ方法主要依赖局部信号,如词元概率、预测熵或单步置信度,因此忽略了错误在执行轨迹中通过长程依赖累积的过程。这可能导致它们无法识别那些根源早在最终答案之前多个推理或交互步骤的智能体故障。我们提出RUPA(面向智能体的关系不确定性传播(https://huggingface.co/papers?q=Uncertainty%20Propagation)),一个面向LLM智能体(https://huggingface.co/papers?q=LLM%20agents)的轨迹级UQ(https://huggingface.co/papers?q=trajectory-level%20UQ)框架。RUPA将执行历史表示为有向轨迹图(https://huggingface.co/papers?q=directed%20trajectory%20graph),其中推理状态、工具交互和环境反馈是节点,通过时间和语义依赖边连接。随后,它在该图上传播不确定性,以捕捉执行风险如何在交互步骤间累积与传递。传播的信号与轨迹级行为特征及目标对齐信息相结合,为整个智能体轨迹生成置信度估计。我们在τ-2、Terminal-Bench-2和GAIA等代表性智能体基准上对RUPA进行了评估,使用了涵盖多个模型家族的6个开源LLM。实验结果表明,RUPA通过提供更准确的不确定性估计、实现更早的故障检测,以及在各种智能体任务中提升不确定性引导的智能体执行效果,持续优于现有UQ方法。这些结果证明,显式建模关系依赖(https://huggingface.co/papers?q=relational%20dependency)对于长期LLM智能体(https://huggingface.co/papers?q=LLM%20agents)的可靠UQ至关重要,为可信赖的智能体执行提供了实用基础。
查看arXiv页面 (https://arxiv.org/abs/2608.16002) 查看PDF (https://arxiv.org/pdf/2608.16002) GitHub1 (https://github.com/icip-cas/RUPA) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16002)
在您的智能体中获取此论文:
hf papers read 2608.16002
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.16002以从本页面链接。
引用此论文的数据集0
无数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.16002以从本页面链接。
引用此论文的空间0
无空间链接此论文
在空间README.md中引用arxiv.org/abs/2608.16002以从本页面链接。
包含此论文的收藏集0
无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
超越单轮置信度:面向LLM智能体的轨迹自适应不确定性量化
本文研究单轮不确定性量化方法是否能迁移到交互式LLM智能体轨迹中,在五个LLM和四个工具使用数据集上评估了白盒、黑盒和反思型评分器。结果表明迁移效果参差不齐,黑盒自洽性通常最强,并建议在轨迹层面重新验证UQ方法。
你的智能体拥有基因组:LLM驱动的自主智能体的序列级行为分析与运行时治理
本文介绍了Base Sequence Analysis框架,该框架将LLM智能体的运行时行为编码为紧凑序列,揭示了高风险模式(如'P-X-P'三元组)和验证缺失。它提出了Governor,一个运行时干预系统,使任务成功率提高了6.2%,并将令牌消耗减少了44%。
管理虚拟实验室规划中LLM生成程序性知识的不确定性
本文介绍了一个原型框架,用于管理虚拟实验室规划中LLM生成的程序性知识的不确定性,通过使用结构化领域表示来修复不确定的程序步骤。
面向LLM Agent澄清请求的不确定性分解
本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。
基于LLM的多智能体系统中作为收敛压力的关系先验
本文研究了在基于LLM的多智能体系统中,使智能体间关系语义显式化如何充当收敛压力,提高一致性但并不稳定地提升准确性。作者认为,关系先验应被诊断性地、针对具体任务地使用,而非作为默认附加项。