CallBench:电话助手双目标协调基准测试
摘要
CallBench是一个中文基准测试,用于评估电话助手中的双目标协调能力,包含50,000轮跨越六个场景的多轮对话,并采用预设感知的评估协议,覆盖语义理解、安全性和对话节奏。
查看缓存全文
缓存时间: 2026/07/28 06:26
# CallBench:电话助手双目标协调评估基准
来源:https://arxiv.org/html/2607.22635
###### 摘要
目标导向对话系统在通过交互式对话完成用户目标方面已展现出强大能力。然而,现有研究主要针对单一、显式目标完成而设计,而电话助手面临一种代理设定,需要协调设备所有者的显式预设目标与呼叫者的隐式、动态目标。我们提出CallBench,一个用于评估电话助手中双目标协调的中文基准。CallBench包含50,000个完整的多轮电话对话,涵盖六种场景:外卖、快递、出行、工作、生活及骚扰。它覆盖常规预设、紧急预设和无预设情况,并包含所有者侧与呼叫者侧目标之间的多种关系,如一致、互补、无关和冲突。我们进一步设计了一种预设感知的轮次级评估协议,涵盖语义理解、上下文使用、主动引导、回复质量、预设遵循、对话节奏和安全性。在代表性对话方法上的实验表明,现有方法仍难以应对这一任务,突显了在代理约束下能够对两个独立目标做出可靠轮次级决策的电话助手的必要性。
请参阅标题
图1:CallBench中的一个常规预设示例。
## 引言
目标导向对话系统旨在引导多轮交互朝向预定义目标,如推荐、说服或任务完成(Lewis et al. 2017; Wang et al. 2019; Liu et al. 2021)。现有研究在目标规划、回复生成和多轮决策方面取得了显著进展(Deng et al. 2023a)。然而,大多数研究假设一种相对简单的设定:系统直接与需要完成其目标的用户交互。这种单一目标假设并未充分捕捉电话助手的代理设定。
电话助手代表设备所有者接听来电。因此,它必须协调两方目标:所有者的显式预设和呼叫者的隐式、动态目标。这两个目标可能一致、互补、无关或冲突。例如,所有者预设指令“把外卖放在门口”,而呼叫者报告食物洒了。在这种情况下盲目推进预设可能导致不相关甚至有害的回复。因此,关键挑战不仅仅是完成目标,而是根据不断变化的呼叫者情况决定何时推进、延迟或暂停所有者侧目标。
这种代理设定也引入了严格的安全边界。助手不得泄露所有者的私人信息、编造未经支持的事实、声称拥有对物理世界的访问权或代替所有者做决定。在实践中,助手很容易从合理的协助滑向未经授权的决策,例如未经所有者确认就同意变更、做出承诺或拒绝请求。因此,安全性不仅是目标完成后的附加要求,而是部署电话助手的基本前提。
现有的对话基准不足以评估这些能力。传统任务导向对话数据集主要关注意图识别、对话状态跟踪、API调用及以用户为中心的目标下的任务成功(Budzianowski et al. 2018; Rastogi et al. 2020)。目标导向对话基准强调目标推进,但通常假设一个单一稳定目标(Lewis et al. 2017; Wang et al. 2019; Liu et al. 2021; Deng et al. 2023a)。最近的基于LLM的对话和智能体基准评估通用回复质量、工具使用或策略遵循(Zheng et al. 2023; Yao et al. 2024; Li et al. 2023),但它们很少考虑必须在严格安全约束下协调两个独立个人的代理助手。因此,我们仍然缺乏用于评估电话助手中双目标协调的基准。
为填补这一空白,我们提出CallBench,一个用于评估电话助手中双目标协调的中文基准。虽然真正的电话助手通过语音接口运行,但大多数实际系统遵循ASR-文本处理-TTS流水线。因此,我们专注于基于文本的对话处理阶段,这使我们能够将决策和回复生成能力与语音识别和合成错误分离。CallBench包含50,000个完整的多轮电话对话,涵盖六种场景:外卖、快递、出行、工作、生活和骚扰。该基准覆盖常规预设、紧急预设和无预设情况,并包含所有者侧与呼叫者侧目标之间的多种关系。图1展示了CallBench中的一个常规预设外卖示例,其中助手必须先处理呼叫者侧的异常情况,然后返回所有者侧预设。
我们进一步设计了面向电话助手的预设感知轮次级评估协议。我们的评估不仅依赖任务成功或表面回复质量,而是衡量语义理解、上下文使用、主动引导、回复质量、预设遵循、对话节奏和安全性。这使得CallBench能够揭示助手是否能在双目标条件下做出适当的局部决策,例如在正确时机传达预设、处理呼叫者异常、避免过早或重复传递预设,以及保持在代理特定的安全边界内。
我们的主要贡献如下:
- • 我们将电话助手任务形式化为一个轮次级决策过程,在严格安全约束下动态协调所有者的显式目标与呼叫者的隐式意图。
- • 我们构建了CallBench,一个中文多场景基准,包含50,000个完整的多轮电话对话,涵盖六种场景、三种预设情况以及多样化的双目标关系。
- • 我们部署了一个细粒度评估框架,从多个方面评估模型能力。
- • 我们评估了代表性的任务导向和目标导向对话框架,量化了双目标权衡、异常处理和边界控制中的关键瓶颈,以指导未来研究。
## 相关工作
### 任务导向与目标导向对话基准
任务导向对话基准已被广泛用于评估对话状态跟踪、意图识别和任务完成。代表性数据集如MultiWOZ(Budzianowski et al. 2018)、SGD(Rastogi et al. 2020)和CrossWOZ(Zhu et al. 2020)侧重于多领域槽填充和面向API的任务执行。其他数据集进一步引入了更真实的交互设定,包括Taskmaster(Byrne et al. 2019)和AirDialogue(Wei et al. 2018)中的交易对话、Decision-Oriented Dialogue(Lin et al. 2024)中的隐式偏好获取,以及CaSiNo(Chawla et al. 2021)中的协商。这些基准在显式或部分隐式用户目标下推动了多轮对话系统的评估进展。
然而,这些基准大多假设系统直接服务当前交互者。系统的角色通常是理解和完成用户自身的任务,而不是作为另一个人的代理。这一假设不符合电话助手,其中助手必须协调设备所有者的显式预设与呼叫者的动态隐式目标。现有基准对两个目标无关、互补或冲突的情况覆盖有限,并且很少将代理特定约束(如隐私保护和未经授权的决策)作为核心评估标准。
### 策略约束下的智能体对话评估
最近的LLM智能体基准将对话评估从文本生成扩展到工具使用、策略遵循和多轮决策(Schick et al. 2023; Liu et al. 2024)。例如,τ-bench(Yao et al. 2024)和τ^2-bench(Barres et al. 2025)在客户服务环境中通过策略文档和受控交互评估智能体。ABCD(Chen et al. 2021)将客户请求与机构策略和动作序列对齐,而ToolTalk(Farn and Shin 2023)研究了工具使用对话中的安全问题,特别是在不可逆操作下。相关工作如PAChat(Fu et al. 2025)进一步探索了多说话人和个性化通信设定。
这些基准涵盖了策略遵循、动作正确性和通信结构等重要方面,但它们仍与电话助手的代理设定不同。它们的约束通常由机构或工具定义,而交互主要发生在用户和服务系统之间。相比之下,电话助手在两个独立自然人(设备所有者和呼叫者)之间进行中介。它必须在尊重呼叫者当前需求和严格安全边界的同时,决定何时推进、延迟或暂停所有者的预设。CallBench针对这一差距,通过评估在电话通话特定约束下的双目标协调,包括目标冲突处理、预设时机、隐私保护和决策边界遵循。
## 问题定义
当前实时通话助手系统通常构建为包含ASR、文本处理和TTS的流水线。本文聚焦于文本处理阶段。我们假设系统已获得呼叫者话语的文本形式,并需要生成通话助手的下一个回复。语音识别、语音合成、端点检测及其他语音侧问题不在本文范围之内。在此设定下,我们定义实时通话助手的双目标协调任务。
给定第t轮对话历史:
H_t = {(u_1, a_1), (u_2, a_2), ..., (u_{t-1}, a_{t-1})},
其中u_i表示第i轮呼叫者的话语,a_i表示第i轮助手的回复。当前输入包括呼叫者的最新话语u_t、场景标签s ∈ S以及所有者的预设池P^o,其中:
S = {外卖, 快递, 出行, 工作, 生活, 骚扰}。
所有者的预设池P^o包含设备所有者预定义的与目标相关的信息。为与实际部署中的电话助手系统对齐,我们将P^o建模为结构化的预设接口,而非任意指令集。每个预设可表示为:
p_i^o = (q_i^o, r_i^o),
其中q_i^o表示触发表达式或触发条件,r_i^o表示对应的所有者指定回复。每个预设槽位也可能为空。
预设池包含两类槽位:常规预设槽位和紧急预设槽位。常规预设槽位对应高频服务通话的默认所有者指令。在我们的设定中,仅对外卖、快递和出行定义常规预设槽位。每个场景至多有一个常规预设槽位。对于常规预设,触发表达式q_i^o由系统预定义,所有者仅指定回复r_i^o。
当当前服务场景具有非空常规槽位时,常规预设可用。如果呼叫者的话语匹配默认触发查询,助手可直接传达所有者指定的回复。如果话语尚未匹配默认触发查询,助手不应将预设视为无关。相反,它可以询问缺失信息、确认呼叫者情况或引导对话到可以自然传达预设的状态。然而,如果呼叫者提出异常或冲突请求,助手应延迟或暂停预设,而非强制执行。
紧急预设槽位对应使用者定义的条件指令。对于紧急预设,触发表达式q_i^o和回复r_i^o均由所有者指定。与常规预设不同,紧急预设可在任意六种场景中激活,但仅当当前呼叫者话语匹配使用者定义的触发表达式时。
在第t轮,助手检索当前上下文中可用的所有者侧显式目标:
g_t^o = RetrievePreset(H_t, u_t, s, P^o)。
检索过程根据对话历史、呼叫者话语和当前场景检查预设池。对于外卖、快递和出行,助手首先检查与当前场景关联的常规预设槽位。如果槽位为空,则检查是否有紧急预设被当前话语触发。对于工作、生活和骚扰,助手仅检查当前呼叫者话语是否匹配任何使用者定义的紧急触发条件。如果没有可用预设,则g_t^o = ∅。
此设定产生三种预设情况。常规预设情况发生在当前服务场景具有非空常规预设槽位时。紧急预设情况发生在呼叫者话语匹配使用者定义的触发条件时。无预设情况发生在当前轮次没有可用或激活的所有者侧预设时。由于每个常规槽位和紧急槽位都可能为空,无预设情况可能出现在任何场景中。
与所有者侧显式目标相反,当前轮次呼叫者的目标记为g_t^c。该目标通常在通话前不显式提供,而是需要从对话历史、当前话语和场景信息中理解。呼叫者侧隐式目标可能与当前所有者侧目标一致、互补、无关或冲突。
这种设定引出了实时通话助手中的一个轮次级双目标协调问题。在每一轮,系统需要确定两者之间的关系。相似文章
Conv-to-Bench: 通过用户-助手对话评估语言模型在代码任务中的表现
Conv-to-Bench 是一个多阶段框架,能够自动将多轮用户-助手对话转化为结构化的、可验证的需求清单,用于评估大型语言模型在代码任务上的表现,以较低的计算成本实现了与人工编写的基准近乎完美的对齐。
Shopping Reasoning Bench:一个由专家编写的用于多轮对话购物助手的基准
购物推理基准(Shopping Reasoning Bench)是一个由专家编写的用于评估多轮对话购物助手的基准,包含525个任务和超过10,000个二元评判标准。对GPT、Claude和Gemini的评估显示,当前模型仅能达到57%至77%的通过率,揭示了在专家级购物推理方面存在显著差距。
M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models
M3-DuplexBench is a new multi-turn, multilingual, multidomain benchmark for evaluating full-duplex spoken dialogue systems, supporting English and Japanese across casual conversation and question answering domains.
TeamBench:在强制角色分离下评估智能体协同
本文介绍了 TeamBench,这是一个用于评估在强制角色分离下智能体协同能力的基准测试,旨在解决仅靠提示词定义角色可能绕过预期约束的问题。
SpeechEditBench:面向指令引导语音编辑的双语多属性基准
SpeechEditBench是一个双语多属性基准,用于评估指令引导的语音编辑,涵盖七项原子任务和组合任务,并采用基于锚点的评估方案及三项指标。对主流语音大模型的评估表明,没有单一模型能在所有维度上表现出色,而组合编辑仍然极具挑战性。