一个用于评估和对齐大型语言模型问题澄清能力的三代理框架

arXiv cs.CL 论文

摘要

本文提出一种三代理框架,用于评估与对齐大型语言模型的问题澄清能力,通过三个基于LLM的代理模拟并评估澄清对话。

arXiv:2609.02054v1 公告类型:新 摘要:大型语言模型 (LLMs) 正日益部署于交互系统中,其中精确理解用户意图至关重要。此类系统的一个关键能力是有效的问题澄清,尤其是在用户查询模糊或未明确指定时。本文介绍了一种新颖的三代理框架,用于稳健评估LLM参与澄清对话的能力。我们的框架包含三个不同的基于LLM的代理:(1) 问题澄清代理 (QCA),即被评估的系统,负责识别歧义并提出澄清问题;(2) 应答代理 (RA),旨在模拟人类用户响应,可能包括无关或挑战性回复;以及 (3) 评估代理 (EA),一个LLM作为评判者,基于一套全面的指标评估对话质量。我们以供应链领域为例,详细说明了合成数据生成的方法。我们提出了评估歧义处理、问题质量、对话效率、语言适当性和最终意图对齐的指标。我们还简要讨论了EA与人类判断的验证。这项工作提供了一种结构化方法,用于基准测试、验证和改进会话LLM应用的澄清能力。
查看原文
查看缓存全文

缓存时间: 2026/09/03 05:49

# 一种用于评估和对齐大型语言模型提问澄清能力的三智能体框架

来源: https://arxiv.org/html/2609.02054  
DOI: XXXXXXX.XXXXXXX (https://doi.org/XXXXXXX.XXXXXXX)  
会议: 第31届ACM SIGKDD知识发现与数据挖掘会议;2025年8月3-4日;加拿大多伦多,安大略省  
KDD '25: 第31届ACM SIGKDD知识发现与数据挖掘会议论文集,2025年8月3-4日,加拿大多伦多,安大略省

Saurabh Pandey  
隶属: Amazon,美国华盛顿州西雅图市  
邮箱: [[email protected]](mailto:[email protected])

与

Pradeep Kumar Misra  
隶属: Amazon,美国得克萨斯州达拉斯市  
邮箱: [[email protected]](mailto:[email protected])

2025

###### 摘要

大型语言模型正日益被部署到交互式系统中,在这些系统中,精确理解用户意图至关重要。此类系统的一项关键能力是有效的提问澄清,尤其是在用户查询存在歧义或表述不足时。本文引入了一个新颖的三智能体框架,用于稳健评估LLM参与澄清对话的能力。该框架包含三个不同的基于LLM的智能体:(1) 一个提问澄清智能体,即被评估的系统,负责识别歧义并提出澄清问题;(2) 一个应答智能体,旨在模拟人类用户响应,可能包括无关或具有挑战性的回复;(3) 一个评估智能体,作为LLM评判者,根据一套全面的指标评估对话质量。我们以供应链领域为例,详细阐述了合成数据生成的方法。我们提出了评估歧义处理、问题质量、对话效率、语言恰当性和最终意图对齐的指标。我们还简要讨论了评估智能体相对于人类判断的验证。这项工作提供了一种结构化的方法,用于基准测试、验证和改进对话式LLM应用的澄清能力。

## 1. 引言

大型语言模型的激增推动了对话式人工智能的显著进步。由LLM驱动的系统现在需要参与细微的多轮对话,并根据用户指令执行复杂任务。有效人机交互的一个关键方面是模型准确理解用户意图的能力,而这通常通过可能模糊、不完整或表述不足的查询来传达。LLM智能体主动识别此类问题并寻求澄清的能力对于任务成功和用户满意度至关重要。该过程通常涉及一个“澄清-重新表述”循环,智能体通过提问解决歧义,然后在继续之前向用户确认其优化后的理解。

评估此澄清过程的有效性具有挑战性。传统的LLM评估基准通常关注静态的输入-输出任务,可能无法充分捕捉澄清对话的动态和交互本质。评估需要与环境或用户进行多步交互的智能体型LLM,则需要专门的框架。人们日益需要能够专门评估智能体管理歧义、提出相关问题、理解响应,并最终在对话上下文中推导出清晰、可执行的用户意图能力的评估框架。

本文提出了一个评估提问澄清智能体的综合框架。我们的方法利用三个基于LLM的智能体:
- • **提问澄清智能体**:被评估澄清能力的LLM智能体。其角色是分析初始用户查询,识别缺失信息或歧义,并迭代提出澄清问题。它还必须处理用户提供不支持的实体或维度的情况。在获得用户对澄清查询的明确确认后,此智能体将调用专用工具将澄清查询发送到相应的后端进行分析。
- • **应答智能体**:设计用于模拟人类用户对QCA澄清问题响应的LLM。RA可以被编程为提供相关答案,但也可能引入挑战,例如无关信息或模糊回复,以测试QCA的鲁棒性和错误处理能力。
- • **评估智能体**:充当“评判者”的LLM。EA分析QCA和RA之间的完整对话记录。它根据预定义的指标评估QCA性能的各个方面,包括澄清质量、对话连贯性和最终解释意图的准确性。

本文的核心贡献是:
1. (1) 一种在交互环境中评估LLM提问澄清能力的新颖三智能体框架。
2. (2) 一种针对澄清对话评估定制的合成数据生成方法,并在供应链领域内进行演示。
3. (3) 一套评估指标,用于评估歧义处理、问题相关性与时机、语言得体性、实体提取完整性以及与真实用户意图的对齐程度。
4. (4) 关于将LLM评判者与人类评估进行验证,以及编码者间信度在确保稳健评估中作用的讨论。

我们相信,该框架为基准测试和迭代改进提问澄清智能体提供了一种可扩展且稳健的方法,为更可靠和有效的对话式AI系统铺平了道路。

## 2. 相关工作

### 2.1. LLM与智能体评估框架

LLM和对话智能体的评估是一个快速发展的领域。像BLEU和ROUGE这样的传统指标虽然对文本生成任务有用,但在评估对话质量和交互成功与否的细微方面往往力不从心。最近的研究侧重于开发更全面的评估框架。像GLUE和SuperGLUE这样的基准评估通用语言理解,而BIG-Bench则探测更广泛的能力。对于对话智能体,评估通常集中在任务完成率、对话效率(例如,轮次数量)和用户满意度上。

像Guan等人(Guan et al., 2024)提供的调查则为基于LLM的多轮对话智能体评估提供了分类法(评什么:任务完成、响应质量、用户体验、记忆、规划;以及如何评:基于标注、自动指标、混合、自我评判)。MINT基准侧重于评估涉及工具和自然语言反馈的多轮交互中的LLM。像AgentBench和ToolBench这样的框架则专门针对评估作为能够使用工具和规划的自主智能体的LLM。

### 2.2. 对话中的澄清评估

专门针对澄清,研究探讨了智能体何时以及如何提出澄清问题。早期工作通常关注更简单的情景。最近的努力,如ClarQ-LLM基准,评估了智能体在任务导向对话中通过提问解决不确定性和收集信息的能力,使用了诸如成功率和平均查询差异等指标。AGENT-CQ框架也专注于对话搜索中澄清问题的自动生成和评估。歧义检测的重要性在多项工作中被强调,例如APA框架旨在引导模型进行自我消歧。

澄清问题本身的质量,包括相关性、具体性、清晰度和实用性,至关重要。InfoQuest为需要澄清的多轮信息检索对话提供了基准。

### 2.3. LLM评判与人类对齐

使用LLM评估另一个LLM输出的概念作为一种可扩展的替代人类评估的方式获得了关注。像G-Eval这样的框架使用强大的LLM并提供详细的评分标准来为NLG输出评分。MT-Bench专门使用强大的LLM作为评判者来评估聊天助手,并显示出与人类偏好的高度一致性。

虽然前景广阔,但LLM评判系统可能表现出偏见(例如,位置偏见、冗长偏见)以及对提示的敏感性,因此需要仔细对照人类判断进行验证。通过与人类评估的比较来确保自动或半自动评估的可靠性至关重要。

我们提出的框架建立在这些研究方向之上,将交互式模拟循环与LLM评判者相结合,专门针对提问澄清这个多方面的问题。与静态基准不同,我们的方法允许动态评估智能体如何在特定领域上下文中处理对话流程,包括意外或对抗性响应(通过合成数据生成促进),同时也强调了评判者自身验证的必要性。

## 3. 提出的评估框架

### 3.1. 核心组件

#### 提问澄清智能体
QCA是主要的LLM系统,其在澄清用户查询方面的表现正在接受评估。给定一个初始用户查询(可能模糊或不完整),QCA的职责包括:
- • **歧义检测**:识别初始查询是否表述不足、模糊,或存在多种可能的解释而妨碍直接执行。
- • **澄清问题生成**:制定相关、清晰、简洁的问题,旨在引出解决歧义所需的具体信息。
- • **响应理解**:解释RA提供的响应,并将这些新信息整合到其对用户意图的理解中。
- • **迭代对话管理**:参与可能多轮的澄清,保持对话连贯性,并根据RA的响应调整其策略。
- • **不支持输入处理**:识别RA何时提供了底层系统或任务不支持的实体、维度或意图,并做出适当响应(例如,说明限制)。
- • **意图确认与最终确定**:一旦QCA认为意图已充分澄清,它会制定一个最终、明确的用户问题版本。理想情况下,它也会寻求对此理解的确认。

#### 应答智能体
RA的角色是模拟与QCA交互的人类用户。它接收来自QCA的澄清问题并生成响应。RA的行为由提示中的两个关键输入指导:
1. (1) 一个预定义的基准真实明确查询 $Q_{gt}$,代表模拟用户针对给定测试用例所持有的无歧义意图。其模拟将在下一节中解释。
2. (2) 一个规定其响应风格(例如,合作型、倾向于提供模糊响应、或引入特定挑战如不支持的意图或实体维度)的角色设定。

RA使用 $Q_{gt}$ 确保其答案与基本目标一致,同时其角色设定为QCA引入了变化性和挑战。

#### 评估智能体
EA充当LLM评判者。在QCA和RA之间的交互结束后,EA获得:
- • 完整的对话记录,包括初始用户查询 ($Q_{orig}$)、QCA的每个澄清问题(第 $i$ 轮记为 $CQ_i$)、RA的每个相应响应(第 $i$ 轮记为 $R_i$)以及QCA提出的最终澄清问题 ($Q_{final}$)。
- • 该测试用例的基准真实明确查询 ($Q_{gt}$)。

基于这些信息,EA使用预定义的一套指标(第5.1节详述)评估QCA的性能。EA为每个指标输出定量分数和/或定性反馈。

### 3.2. 交互协议

单个测试用例的评估过程如下:
1. (1) **初始化**:从合成数据集中选择一个测试用例。该测试用例包括一个初始(可能模糊的)用户查询 ($Q_{orig}$)、相应的基准真实明确查询 ($Q_{gt}$) 以及RA的任何特定行为指令。
2. (2) **查询呈现**:将 $Q_{orig}$ 作为交互的起点呈现给QCA。
3. (3) **澄清对话**:
    - • QCA分析 $Q_{orig}$,如果认为需要澄清,则向RA提出其第一个澄清问题 ($CQ_1$)。
    - • RA在 $Q_{gt}$ 及其指定角色的指导下,生成一个响应 $R_1$ 来回答 $CQ_1$。
    - • 这种QCA提出澄清问题 $CQ_i$ 和RA提供响应 $R_i$ 的交互过程迭代进行。
    - • 对话持续进行,直到QCA确定它拥有足够的信息来形成对用户意图的完整且无歧义的理解。
4. (4) **最终澄清问题表述**:QCA将其对用户意图的最终理解输出为一个澄清良好的问题 ($Q_{final}$)。
5. (5) **评估**:EA接收完整的对话记录(包含 $Q_{orig}$、所有轮次的 $\{CQ_i, R_i\}$、$Q_{final}$)和 $Q_{gt}$。然后EA根据第5.1节中概述的指标评估QCA的性能。

## 4. 合成数据集生成

为了在合成数据集中评估QCA……

相似文章

知道何时提问: 分层语言代理的自我门控澄清

arXiv cs.AI

本文提出ActionRating,一种将澄清置于代理的动作空间内,与导航共享一个顺序标尺的公式,实现了两种信息寻求模式(强制性和机会性)。在分层分类法基准测试中,使用9个LLM的实验表明,机会性澄清提高了准确性和信息寻求效率。

面向LLM Agent澄清请求的不确定性分解

arXiv cs.AI

本文针对LLM Agent提出了一种基于提示的不确定性分解方法,将行动置信度与请求不确定性分离,使其能在未明确指定的任务中主动寻求澄清。该方法在五个LLM骨干网络上使用新的澄清增强基准进行了评估,显示出显著改进。

基于信息增益的LLM代理中的不确定性感知澄清

arXiv cs.AI

提出了一种目标导向的澄清框架,利用信息增益奖励训练LLM代理,在用户指令不明确的情况下提出有效的澄清问题,在仅增加少量交互开销的情况下,将任务成功率提升了3.7%。