@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
摘要
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。
查看缓存全文
缓存时间: 2026/08/30 10:16
// 你的LLM评审与专家意见相左 //
构建LLM评审机制可能颇具挑战性。
以下是一个有趣的例证说明:
他们提出了一个包含数百段完整人机对话的参考丰富型基准测试。这些对话由专业编剧创作,具有真实的轮次密度,并包含超过30,000个专家生成的对话轮次,每个轮次附有超过36,000条人工标注。
对话评估框架大多为摘要、翻译和简短问答而构建,其指标本身通常源自合成数据而非人类对话进行推导和验证。
在此规模上对照专家判断进行测试,传统的自动指标和无参考的LLM评判者方法均被证明不可靠。
其“评判者混合“框架结合了多种评估信号,与人类评估的相关性提升了约30%。
论文链接:https://arxiv.org/abs/2608.26131
论文讨论:https://academy.dair.ai/papers/evaluating-language-models-in-realistic-conversational-contexts-2608.26131…
在真实对话情境中评估语言模型
来源:https://arxiv.org/html/2608.26131
摘要
随着大型语言模型(LLMs)越来越多地应用于开放式、多轮次交互,以人类规模评估对话质量已成为一项核心挑战。现有的为摘要、翻译或简短问答任务构建的评估框架,在充分衡量人类规模对话的一致性方面存在不足,尤其是当这些指标本身的推导和验证通常依赖合成数据而非人类对话时。我们通过引入UPHELD(UPwork Human-Scale Evaluated Long Dialogues,Upwork人类规模评估长对话)填补了这一空白,这是一个大规模、参考丰富型的基准测试,用于评估超越事实正确性的人类规模对话能力。UPHELD包含数百段由专业编剧创作的完整人机对话,具有真实的轮次密度,并在30,000+个专家生成的对话轮次上提供了36,000+每轮人工标注。利用UPHELD,我们系统地评估了传统的自动指标和无参考的LLM评判者方法,发现当它们与专家人类判断进行关联时表现不可靠。基于此分析,我们利用UPHELD开发了一个评判者混合框架,该框架结合了多种评估信号,将与人类评估的相关性提高了约30%。总体而言,UPHELD为评估人类规模对话智能提供了一个稳健、基于人类的基础,填补了现有LLM数据集领域的一个关键空白。
1引言
大型语言模型(LLMs)的快速发展彻底改变了文本生成,尤其是在问答等专注的单轮任务中。然而,随着这些模型越来越多地集成到服务复杂系统的应用中,评估的前沿已转向开放式、多轮次的环境。在这些环境中,对话更长、约束更少、更开放,成功的定义不仅在于事实正确性,还在于模型在长期对话中与人类终端用户保持自然、连贯且有用互动的能力。现有的评估指标大多继承自前LLM时代的自然语言任务,如机器翻译、摘要和问答,侧重于事实精确度和词汇重叠。当评估成功对话的微妙特质时,这些指标通常被证明是不足的,因为对话的成功取决于更软性的、长期的品质,如连贯性、参与度以及在多轮次中保持一致语气的能力。虽然最近的基准测试通过无参考的“LLM评判者”评估或人类偏好平台评估了更长的对话,但这些方法面临关键局限。LLM评判者的质量常常未能超越非专家人类评判者,且此类基准测试越来越容易受到训练数据泄露和分布外任务可靠性差的影响。此外,许多指标主要在合成数据集上进行测试,由于经验证的LLM对话生成限制和用于训练和评估的LLM模拟数据中持续存在的偏差,可能在指标结果中引入显著偏差。
本文介绍的工作通过一个专门的基准测试来缓解这些问题,该测试在对话上评估模型,其设计旨在:
- • 多轮次且人机交互:强调真实互动的自然流动,而非模拟或蒸馏的输出。
- • 不依赖特定外部知识:将重点从基于检索的准确性转向对话智能。
- • 不依赖特定结果:允许流畅、开放式的对话,不专注于“正确答案”(例如编码、摘要),但仍有总体目标(例如,“告诉我如何制作披萨”)。
我们介绍了UPHELD(UPwork Human-Scale Evaluated Long Dialogues,Upwork人类规模评估长对话),这是一个满足这些标准的新型对话集合。UPHELD包含超过30,000个高质量的人工撰写的对话轮次,跨越数百个新的对话,并且对于每个轮次,我们在重要的对话连贯性标准(如风格和内容一致性)上提供了多个人类标签。与从嘈杂来源提取的数据集或依赖标注者背景未知的众包平台的数据集不同,UPHELD利用专业剧作家来保证高对话质量,这已被证明可以显著提高数据集收集的质量和真实性。
我们的数据收集策略和总体方法使得UPHELD在三个基本方面与现有对话基准测试明显不同(更详细的逐点概述见附录A):
- • 面向任务的自然对话:UPHELD专注于面向任务的对话(例如,数学辅导或旅行规划),但所有专业剧作家都被指示以自然、随意的方式编写对话。这与标准面向任务的数据集显著不同,后者中的代理遵循僵化的“设定”目标或受编码模型知识的限制。通过让剧作家自由决定如何完成任务,我们捕捉到了实用性与类人交互更自然的交集。
- • 真实的对话轮次密度:虽然一些数据集专注于极长的对话,如访谈或LoCMo,但大多数人机交互更简洁,尤其是在引导的面向任务的领域。我们对可用数据集中的机机交互分析显示,现实世界的对话很少超过20轮。附录A显示,完全人工收集的数据集平均为9.3轮,而Topical-Chat数据集最多为21轮。我们的剧作家被赋予决定对话长度并在自然停止点结束的自由,以保持互动尽可能自然,这意味着UPHELD更好地反映了现实世界的轮次分布。
- • 强调对话流畅性而非信息检索:我们刻意避免需要复杂上下文的任务,如复杂数学或编码。相反,UPHELD关注模型在整个对话中保持连贯且合理对话的能力,服务于不需要大量上下文工程的日常任务。这使我们的工作与像Wizard of Wikipedia这样的基准测试区分开来,后者优先考虑知识基础而非纯粹的对话动态。
为了进一步说明UPHELD旨在弥合的关键差距,我们深入分析了现有方法(如LLM评判者或经典NLP指标),并指出它们在针对UPHELD测试时,在评估LLM对话环境方面的不足。我们的分析显示这些指标在相关任务上表现不佳,我们展示了如何使用UPHELD通过一个简单的机器学习的评判者混合(集成)指标来生成更好的评估指标。在各项评估中,所提出的指标展示了比单个LLM评判者指标以及既定的句法和语义评分方法更高的与人类判断的相关性。
我们的主要贡献如下:
- • 我们介绍了UPHELD,一个由专业剧作家精心制作的包含10,000+对话轮次的新型数据集。凭借153,578个密集的、按轮次的人类标签,这些标签根据各种连贯性标准对轮次质量进行评级,UPHELD提供的评估规模几乎是可比的人类验证基准测试的10倍,有效弥合了相对于众包或合成数据集的质量和数量差距。
- • 我们专注于与自然对话长度分布相关的现实任务导向对话,而非纯粹的随意、开放式对话。通过这样做,UPHELD在自然的人类认知边界内有效评估功能实用性,避免了合成数据集中常见的人为轮次长度膨胀。
- • 我们引入了一个多轮次一致性指标,通过轮次级别的连贯性和合理性来评估对话。我们证明,虽然标准指标在此任务上表现出显著的性能差距,但我们提出的评判者混合集成指标在预测专家人类判断方面比单个LLM评判者更成功,提升约30%。
2相关工作
评估大型语言模型(LLMs)的性能是一个关键的研究领域。当前的基准测试,例如Open LLM排行榜(现已归档)上的测试,通常侧重于使用输入-输出指标的基于任务的评估。这些指标包括基于任务的生成评估,如IFEval(评估LLMs遵循指令的能力)和BBH(Big Bench Hard,包含单词排序、因果判断、导航等23组任务)。这些及类似的“任务-答案”评估利用精确匹配(EM)、精确率/召回率/F1和基于子串的准确率等指标。具体示例包括用于数学问题的MATH和用于多选问答的GPQA。与专注于特定任务(MATH、GPQA)或对话质量的基准测试不同,HELM提供了一个统一的框架,评估模型在不同场景和指标下的表现,强调评估方法论而非特定任务领域。然而,它仍然是基于单轮的,并且建立在正确/错误事实答案比较的基础上。
问答(QA)基准测试也很普遍。MUSR是一个基于叙事的QA评估,其中输入是一个段落,输出是一个带有评估分数的答案。MMLU-PRO结合了基于任务的评估与QA和链式思考提示。最近,使用LLM评判者进行评估是另一种方法,它允许在没有标准答案或参考答案的情况下进行评估。虽然上述基准测试很突出,但有几个相关工作领域通常不包括在侧重于单轮评估的排行榜中,特别是那些涉及更长对话的领域。这包括类似于Chatbot Arena的方法、MultiHop QA(涉及跨多个文档或轮次回答问题)和MT-eval(侧重于直接和多维评估对话)。BotChat也被提及为一种对话生成评估方法。
上述工作通常依赖于输入-输出对、精确匹配或与特定正确答案相关的分数,这些非常适合评估执行离散任务或提取事实信息的能力。然而,它们可能不适合评估长的、非专题性的对话。此类交互涉及持续的连贯性、多轮次的上下文管理、引人入胜的对话以及处理主观或开放式讨论(这些讨论没有清晰简洁的“正确”答案)的能力。当前专注于非事实对话的人类规模对话数据集,包括MuTal、Topical-chat、LLM-arena和DailyDialogue(多轮),往往缺乏真实的人机交互或受限于预定义的主题。认识到这些局限性,并为了构建一个稳健的基准测试,我们认为有必要建立一个具有全面策划、专家创作和人工注释特征的数据集。本文介绍了这样一个数据集,我们已精心收集和组织,详细信息将在后续章节中提供。
3数据集
3.1 UPHELD数据集
我们首先收集了对话数据,通过要求从Upwork自由职业者市场聘请的一组专业作家,创建涵盖客户服务和教育等多样话题的开放式、自然主义对话。作家们被明确指示创作更长的对话,特点是对话复杂性和探索性。
相似文章
在现实对话环境中评估语言模型
本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。
JudgeArena:可复现的LLM裁判评估统一框架
JudgeArena是一个开源框架,将主要的LLM裁判基准统一在单一接口下,支持对裁判选择的系统研究,并提供与闭源模型相当或更优的开源模型裁判,同时能够模拟LMArena Elo分数。
RankJudge:一个多轮LLM-as-a-Judge合成基准生成器
RankJudge是一个基准生成器,它创建带有注入缺陷的配对多轮对话,用于评估LLM评判者在复杂对话中正确识别更好和更差回复的能力。
LLMs-as-a-Judge在多语言环境和低资源语言中的挑战与建议
本文分析了LLM-as-a-Judge在多语言和低资源场景下的应用,发现评估结果不一致且过度信任LLM判断,并提出了改进实践的建议。
@omarsar0: LLM-as-a-Judge 在约10分钟内解析
LLM-as-a-Judge 概念的快速介绍,解释如何构建 AI 验证器和裁判,并指出进一步学习的资源。