Hear2Act:评估韵律何时应改变助手行为基准

arXiv cs.CL 论文

摘要

本文介绍了Hear2Act,一个统一的基准,用于评估韵律线索如何影响任务导向对话的决策。研究发现,当词汇证据不足时,韵律很重要,并且音频LLM通过显式的动作关注表示能获益。

arXiv:2608.19515v1 公告类型:新 摘要:韵律线索可以传达任务相关信息,即使词语本身保持不变,也能改变任务导向对话的轨迹和结果。然而,现有基准通常单独评估韵律感知、响应适当性和任务导向对话,难以测试韵律证据是否改变下游决策。我们引入Hear2Act,这是一个统一的评估协议,适用于文本和语音助手,包含480个基于角色的场景、隐藏的用户关注点和客观可验证的结果。对于每个场景,我们保持任务和用户需求不变,同时改变同一关注点是通过词语显式传达还是主要通过韵律传达,并在转录、音频和关注状态访问下评估决策。 使用Hear2Act,我们评估了两个具备音频能力的LLM。在韵律介导的反馈下,向转录添加音频仅将平均最优解率从14.6%提高到15.3%。相比之下,当模型从音频推断关注状态,在文本中表示它,并用于下一个动作选择时,该比率上升到39.6%,接近真实状态的40.7%。然而,在显式词汇反馈下,即关注点在话语中被口头提及时,这种对比大部分消失。总的来说,这些结果表明,当词汇证据不足时,韵律很重要,并且具备音频能力的LLM可以从语音中恢复信息,但如果没有显式的中间表示,就不能可靠地将其转化为行动。
查看原文
查看缓存全文

缓存时间: 2026/08/21 10:04

# 当韵律变化应指导助手行为时的基准测试
来源:https://arxiv.org/html/2608.19515

## Hear2Act:评估韵律应何时改变助手行为的基准
刘心怡1,2,Hooshang Nayyeri1,Dilek Hakkani-Tur1,2,Emine Yilmaz1,3,JK Kim1,张逸飞1,Charith Peris1,Hari Thadakamalla1
1亚马逊 2伊利诺伊大学厄巴纳-香槟分校 3伦敦大学学院
{liu323, dilek}@illinois.edu  {hooshang, jookyk, jimmyzyf, perisc, thadakah}@amazon.com  [email protected]

#### 摘要
韵律线索可以传达与任务相关的信息,即使词语本身不变,也能改变任务型对话的进程和结果。然而,现有基准通常将韵律感知、回应适当性和任务型对话分开评估,难以检验韵律证据是否改变了后续决策。我们提出 **Hear2Act**,这是一个针对文本和语音助手的统一评估协议,包含480个基于角色设定的场景、隐藏的用户顾虑以及可客观验证的结果。对于每个场景,我们在固定任务和用户需求的同时,改变相同的顾虑是通过言语明确表达还是主要通过韵律传达,并在转录文本、音频和顾虑状态可访问条件下评估决策。使用 **Hear2Act**,我们评估了两个具备音频能力的大型语言模型。在 **韵律介导的反馈** 下,向转录文本添加音频仅将平均最优解决方案率从14.6%提高到15.3%。相比之下,当模型从音频推断顾虑状态,将其用文本表示,并用于下一步行动选择时,该比率升至39.6%,接近使用真实状态时的40.7%。然而,这种对比在 **显式词汇反馈** (即顾虑在话语中被口头提及)下基本消失。这些结果共同表明,当词汇证据不足时,韵律至关重要;而具备音频能力的大型语言模型虽然能从语音中恢复信息,但若无明确的中间表示,则无法可靠地将其转化为行动。

## 1 引言
任务型对话系统通过多轮交互引导用户做出具体决策。在语音任务型对话中,这些决策可能依赖于转录文本之外的信息。一句犹豫的“好的,听起来不错”可能表明一个重要顾虑仍未解决,而用明快语调说出同样的话则可能表示真正的接受。这一区分可以决定助手是继续收集信息,还是过早地承诺一个不合适的解决方案。由此产生的评估问题是:何时韵律证据应指导信息收集和最终选择,以及当前助手使用韵律证据的效率如何。因此,核心问题不仅在于模型是否感知到韵律线索,还在于该线索在何时提供了词语之外的信息,以及模型是否将其带入后续的任务决策中。

**图1:Hear2Act概述。** (1) 每个场景结合一个表面请求、优先隐藏的顾虑以及具有可验证满足特征的候选选项。(2) 助手在不同的反馈和访问条件下交互。(3) 匹配的交互过程在任务结果和交互行为上进行比较。

现有基准解决了该问题的互补部分,但未完整覆盖从韵律证据到任务行动的完整链条。任务型对话基准支持多轮交互和可验证的成功指标,但未孤立地研究韵律反馈如何改变序列决策。副语言基准保留了语音线索,但主要评估感知、回应适当性或情感交互,缺乏基于任务的隐藏需求和可验证结果。StyleTalk和ParaS2S控制词汇内容,但评估的是适当的后续回应,而非由此产生的多轮任务轨迹。据我们所知,目前尚无现有协议能够在评估文本和语音助手于相同任务内的表现时,追踪韵律证据如何通过多轮任务决策最终达到可验证的结果。

我们提出 **Hear2Act** 来填补这一空白。它包含480个受控的用户-助手场景,每个场景将初始请求和优先隐藏的顾虑与候选选项配对,其匹配度可被客观评分。一个确定性的用户引擎将每个助手动作映射为结构化的用户反应和允许的信息披露。由此产生的反馈以自然话语形式呈现,在语音条件下则渲染为语音,其中顾虑要么在词汇中明确,要么主要通过韵律传达。匹配的交互过程保持任务和用户需求固定,同时改变助手对转录文本、音频和显式顾虑状态信息的访问权限。这种设计既隔离了韵律证据的决策价值,也揭示了该价值在从音频到行动的过程中在何处流失。

结果回答了三个问题:韵律信息何时具有决策价值、语音助手能否将其转化为行动,以及正确的顾虑信息如何改变对话。在 **韵律介导的反馈** 下,向转录文本添加音频仅使两个具备音频能力的大型语言模型的平均最优解决方案率从14.6%提高到15.3%。当模型转而从音频推断顾虑状态,用文本表达,并用于下一步行动选择时,该比率升至39.6%,接近40.7%的真实状态参考值。在 **显式词汇反馈** 下,这种对比基本消失,因为相关顾虑已用词汇表达。进一步分析表明,正确的轮次特定顾虑信息使交互转向信息挖掘,并帮助助手决定何时继续搜索、何时停止。这些结果共同表明,当词汇证据不足时,韵律最为有用,但当前具备音频能力的大型语言模型未能有效利用直接从语音中获取的信息来进行下游决策。

## 2 相关工作
**表1:基准定位。** P:韵律输入,C:在固定词汇内容下对韵律访问进行匹配控制,M:多轮任务决策,N:基于任务的隐藏用户需求,O:可验证的轨迹和结果。△标记结构化用户目标通过词汇而非隐藏需求传达。

| 基准 | P | C | M | N | O |
| :--- | :---: | :---: | :---: | :---: | :---: |
| MultiWOZ, SGD | × | × | × | ✓ | △ | ✓ |
| SpokenWOZ | ✓ | × | ✓ | △ | ✓ |
| StyleTalk, ParaS2S | ✓ | ✓ | × | × | × |
| MULTI-Bench, HumDial-EIBench | ✓ | × | ✓ | × | × |
| **Hear2Act(本文工作)** | **✓** | **✓** | **✓** | **✓** | **✓** |

**图2:Hear2Act在韵律介导反馈下的示例轨迹。** 从完整的11个候选集中展示了三个代表性候选。仅访问转录文本可能过早确认,而访问真实的顾虑状态则支持进一步挖掘并选择最匹配的选项。

### 2.1 任务型与语音任务对话
MultiWOZ和Schema-Guided Dialogue数据集建立了具有结构化状态和可验证任务成功率的多领域任务型对话,而ATOD则将评估扩展到代理能力。SpokenWOZ将此设置扩展到语音,RealTalk-CN则研究语音-文本交互。情感感知工作增加了情感标注或用户模拟,经典的POMDP公式将用户状态视为隐变量。这些方法研究任务成功、代理行为、语音、情感或隐状态,但未孤立地研究韵律证据何时在转录文本之外增加了决策价值,或如何改变下游任务行动。

### 2.2 副语言与语音评估
副语言基准主要针对识别、回应适当性或多轮情感。识别套件测试词汇内容之外的属性;面向回应的基准评估回复是否符合说话风格或音频上下文;多轮基准评估情感理解和轨迹。StyleTalk和ParaS2S控制词汇内容,但仅限于单次回应评估,而基于情感条件的用户模拟器增加了交互,但缺乏基于候选的隐藏需求,这些需求使得挖掘、停止和最终选择能够共同验证。表1总结了这些区别。近期工作还研究了副语言证据是否从感知带入下游行为。LISTEN发现了词汇主导性和声学线索利用不足;PALLM将副语言分类与回应生成相结合;ParaBridge识别了感知-行为差距,并通过支架和训练改进了基于线索的行为;Miyazawa和Sato展示了在对话行为预测中利用已识别的副语言态度类别的收益。而 **Hear2Act** 则测试受控的韵律线索是否会改变多轮挖掘、停止以及客观可验证的最终任务选择。

## 3 Hear2Act 评估设计
**任务定义**
**Hear2Act** 评估助手能否利用任务相关的韵律证据做出更好的对话决策。每个场景固定一个初始请求、一个候选集以及优先隐藏的顾虑,这些顾虑决定了哪个选项最能满足用户需求。给定对话及其访问条件下的可用证据,助手必须决定是挖掘更多信息、询问什么,以及推荐哪个选项。在匹配的交互过程中,任务和用户需求保持固定,而可用证据发生变化。我们评估最终选择以及导向该选择的对话轨迹。图1总结了该设计。

### 3.1 基准场景
每个场景的构建使得原本隐藏的顾虑信息的价值可以通过助手的最终选择来衡量。它结合了一个初始请求、三个优先隐藏的顾虑以及一个与这些顾虑匹配度已知的候选集(图1,左)。我们从Schema-Guided Dialogue数据集的服务类别中选取了48个领域,每个领域实例化十个场景,得到480个涵盖旅行、住房、医疗保健、金融和其他消费服务的场景。场景种子在紧迫性、预算、专业知识和生活背景上有所不同,因此相似的请求可以反映不同的潜在需求。初始请求仅说明可见要求,而三个顾虑保持隐藏:一个硬约束(L1)、一个强偏好(L2)和一个中等偏好(L3)。在图2中,用户仅要求便宜的航班,而关于夜间旅行、旅程时长和日间旅行的顾虑仍未说明。通过交互,助手可能发现部分或全部这些顾虑。

候选集使得这些信息的后果可被观察到。这三个顾虑定义了八种可能的满足模式,每种由一个候选代表。我们增加一个安全替代方案和两个违反已声明要求的候选,总共得到11个候选。最匹配的选项满足所有三个隐藏顾虑,但在价格或评分等可见属性上并非最优,而其他候选在信息不完整的情况下仍然合理。因此,最终选择反映了助手是否发现并使用了区分最匹配选项所需的信息。附录H展示了完整的匹配交互过程,附录G.1总结了候选构建流程。

### 3.2 交互式交互过程
每个场景被实现为一个交互式片段,使顾虑证据能够影响助手询问的内容、停止的时机以及选择的选项。一个交互过程将一个片段与一个助手和一种访问条件配对(图1,中间)。所有交互过程都从一个表面有吸引力的选项开始。文本助手可以进行询问、澄清、推荐或确认,而语音助手使用询问、推荐和确认。当选项被接受或达到20轮预算时,片段结束。

一个确定性的用户引擎控制交互。给定场景、对话历史和助手动作,它决定哪些顾虑仍未解决、可以披露什么信息、用户如何回应以及片段是否结束。一个针对性问题揭示用户对查询属性的要求,而一个通用问题仅揭示当前推荐为何仍未解决。由此产生的结构化响应以自然话语形式呈现,在语音条件下则渲染为语音。详细的交互和信息披露规则见附录G.6。

我们既改变顾虑信息的表达方式,也改变助手可用的证据。在 **显式词汇反馈** 下,顾虑用词汇明确表达。在 **韵律介导的反馈** 下,硬约束违规保持明确,而软顾虑在词汇上保持隐含,语音语调传达推荐仍未解决的信号。图2展示了由此产生的差异:仅访问转录文本可能将犹豫的接受视为解决,而访问顾虑状态则支持进一步挖掘和更匹配的选择。匹配的交互过程保持场景和用户需求固定,同时改变对转录文本、音频、从音频推断的文本状态或真实顾虑状态的访问,从而实现对话轨迹和结果的配对比较(图1)。

相似文章

在现实对话环境中评估语言模型

arXiv cs.CL

本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。