QVal:低成本评估长视界LLM智能体的密集监督信号
摘要
介绍QVal,一个无需训练的测试平台,通过衡量与Q值的对齐程度来评估长视界LLM智能体任务中的密集监督信号,从而无需训练即可公平比较不同监督方法。
查看缓存全文
缓存时间: 2026/07/01 15:43
论文页面 - QVal:廉价评估长视界LLM智能体的密集监督信号
来源:https://huggingface.co/papers/2606.32034
摘要
本文介绍了一个名为QVal的测试平台,用于评估长视界LLM智能体任务中的密集监督信号,通过衡量方法评分与Q值的一致性,无需训练即可公平比较不同的监督方法。
LLM智能体(https://huggingface.co/papers?q=LLM%20agents)日益在长视界(https://huggingface.co/papers?q=long%20horizons)中运行,单个轨迹可能包含数百或数千个动作。在这些场景中,仅基于结果的奖励提供的指导过于稀疏,无法告知模型中间动作的好坏。密集监督(https://huggingface.co/papers?q=Dense%20supervision)方法旨在通过评分中间步骤来解决此问题,这些评分来源包括内在置信度、自蒸馏和嵌入相似性等。然而,通常的做法是通过测量集成这些方法的训练管道的下游性能来评估它们。这种做法成本高昂,将监督质量与训练工程混杂因素混为一谈,并且使得需要不同训练设置的不同方法论家族无法相互比较。因此,密集监督(https://huggingface.co/papers?q=dense%20supervision)方法很少在共同基础上进行基准测试。我们引入了QVal,一个免训练(https://huggingface.co/papers?q=training-free)的测试平台,用于直接评估密集监督(https://huggingface.co/papers?q=dense%20supervision)信号。给定一个状态-动作对,QVal衡量方法的评分与Q值对齐(https://huggingface.co/papers?q=Q-aligned)的程度:即它是否根据强参考策略(https://huggingface.co/papers?q=reference-policy)的Q值(https://huggingface.co/papers?q=Q-values)对动作进行排序。这让我们可以在任何训练运行之前比较信号,并将信号质量与其他工程选择分离开。我们将QVal实例化为QVal-v1.0,对跨四个不同环境和七个方法家族的21种密集监督(https://huggingface.co/papers?q=dense%20supervision)方法进行了基准测试,涉及超过1.2K次评估实验,跨越六个开放权重模型主干(https://huggingface.co/papers?q=model%20backbones)模型。我们发现,简单的提示基线在性能上始终优于文献中最近的密集监督(https://huggingface.co/papers?q=dense%20supervision)方法,并且性能按家族强烈聚类。这些发现适用于不同模型大小、环境和观察模态。QVal设计为易于扩展到新的环境和方法,使研究人员能够在任何训练运行之前对密集监督(https://huggingface.co/papers?q=dense%20supervision)方法进行迭代。
查看arXiv页面(https://arxiv.org/abs/2606.32034)查看PDF(https://arxiv.org/pdf/2606.32034)项目页面(https://q-val.com/)GitHub3(https://github.com/bethgelab/qval)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.32034)
在您的智能体中获取此论文:
hf papers read 2606.32034
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2606.32034以从此页面链接它。
引用此论文的数据集1
bethgelab/qval 更新于约4小时前 • 2(https://huggingface.co/datasets/bethgelab/qval)
引用此论文的Spaces0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2606.32034以从此页面链接它。
包含此论文的收藏0
没有收藏包含此论文
将此论文添加到收藏(https://huggingface.co/new-collection)以从此页面链接它。
相似文章
EnvSimBench:用于评估和改善基于大语言模型的环境模拟的基准
本文介绍了 EnvSimBench,这是一个用于评估大语言模型在智能体训练中模拟环境能力的基准。它指出了当前大语言模型中存在的“状态变化悬崖”问题,并提出了一种约束驱动的流水线以减少幻觉和降低成本。
基于大语言模型定性及定量评估的常微分方程发现方法
本文介绍了 DoLQ,这是一个多智能体框架,利用大语言模型执行定性和定量评估,从而从观测数据中发现常微分方程。
当眼见不为实:交互式视觉定位在LVLMs中的基准测试
本文介绍了一个用于大型视觉语言模型(LVLMs)中交互式视觉定位的受控评估框架,表明当前LVLMs的表现低于人类基线,并在主动问题驱动定位方面存在困难。
从描述性到规范性:揭示基于LLM的智能体的社会价值对齐
本文提出了SoVA,一个使用GraphRAG将心理学理论转化为规范性指令,从而使基于LLM的智能体与人类社会价值观对齐的框架。在DAILYDILEMMAS基准上的实验表明,相比基于提示的基线方法有显著改进。
CVPO:通过值方差适应与动态课程学习增强LLM强化学习推理
这篇arXiv论文介绍了CVPO,一种针对LLM的强化学习方法,它适应值方差以进行优势估计,并使用动态课程学习来匹配问题难度,在数学任务上取得了比VAPO更好的推理性能。