使用语义不确定性估计话轮转换中的转换相关性
摘要
本文提出利用从大型语言模型派生的语义不确定性来预测口语对话中话轮转换的相关位置,在对话系统中展示了优于基线的性能。
arXiv:2609.10934v1 公告类型:新
摘要:话轮转换是控制对话者何时发言和倾听的基本机制。尽管口语对话系统(SDS)利用了语言、声学和非言语线索,但在未脚本化的交互中,它们会产生不及时的响应。一个核心挑战是预测转换相关位置(TRPs),即听者接话的机会,而非义务。人类听者不会等待话轮结束;随着话语的展开,他们利用对其发展意义的预期来预测TRPs并决定是否接话。我们研究这些不断变化的预期是否可以通过语义不确定性来建模——这是一种从大语言模型派生的度量,用于衡量当前话轮在多大程度上限制了接下来可能出现的合理内容。为此,我们采样当前话轮的可能延续,并利用语义离散度的变化来识别话轮内的TRPs。我们在一个数据集上评估了这个模型,该数据集的TRP标签来自实时听者响应,而非回顾性标注。我们的方法显著优于基于提示和微调的纯文本基线,为以下观点提供了实证支持:在未脚本化的交互中,不断变化的语义约束影响了感知到的话轮转换机会。
查看缓存全文
缓存时间: 2026/09/11 08:20
# 利用语义不确定性估计轮次交替中的转换相关性
来源:https://arxiv.org/html/2609.10934
作者:JP de Ruiter
所属机构:美国马萨诸塞州梅德福德
联系邮箱:\{muhammad\.umair, jp\.deruiter\}@tufts\.edu
###### 摘要
轮次交替是支配对话者何时发言与倾听的基本机制。尽管口语对话系统(SDS)利用了多种语言、声学和非言语线索,但在非脚本化交互中仍常产生时机不当的回应。核心挑战在于预测**转换相关位置**(TRPs),即听者**可以**(而非必须)接话的时机点。人类听者并非等待轮次结束;随着话语展开,他们利用对其发展中的语义的*预期*来预判TRPs,并决定是否接话。本研究探讨这些动态预期能否通过*语义不确定性*进行建模——这是一种基于大语言模型的度量,衡量当前话语对后续合理内容的约束强度。我们通过采样当前话语的可能延续,并利用语义离散度的变化来识别话语*内部*的TRPs。我们在一个基于实时听者反应(而非回溯标注)标注TRP标签的数据集上评估该方法。我们的方法显著优于基于提示和微调的纯文本基线,为“动态语义约束影响非脚本化交互中感知到的轮次交替时机”这一观点提供了实证支持。
## 1 引言
人类通过复杂的轮次交替机制协调发言与倾听(Sacks等, 1974 (https://arxiv.org/html/2609.10934#bib.bib50))。在正式场合中发言顺序可能预先确定,但在非脚本化交互中,发言者的选择是按轮次动态管理的。这取决于对话者对*转换相关位置*(TRPs)的关注:这些位置标志着当前轮次可能被视为结束,听者可以(但非必须)回应(Levinson, 1983 (https://arxiv.org/html/2609.10934#bib.bib32); Selting, 2000 (https://arxiv.org/html/2609.10934#bib.bib54))。一个关键区分在于TRP是否导致发言者切换:若听者接话,TRP发生在轮次*之间*并直接可观测;但许多TRP出现在轮次*内部*,即听者本可回应却未回应(Selting, 2000 (https://arxiv.org/html/2609.10934#bib.bib54))。这些轮次内部TRP是轮次交替系统的重要组成部分,但在记录数据中留下的实证痕迹有限(Umair等, 2024 (https://arxiv.org/html/2609.10934#bib.bib62); Castillo-López等, 2025 (https://arxiv.org/html/2609.10934#bib.bib11))。这对口语对话系统(SDS)构成挑战——此类系统在非脚本化交互中仍常产生时机不当的回应和僵硬的反馈(Algherairy和Ahmed, 2024 (https://arxiv.org/html/2609.10934#bib.bib1); Patamia等, 2025 (https://arxiv.org/html/2609.10934#bib.bib45); Arora等, 2025 (https://arxiv.org/html/2609.10934#bib.bib4))。基于可观测轮次交替行为(如发言者切换、反馈词等)训练的模型,仅能对听者实际行动的TRP进行直接监督,却无法覆盖听者可能感知到的更广泛回应机会(Umair等, 2024 (https://arxiv.org/html/2609.10934#bib.bib62))。这引出一个表征问题:人类依赖哪些信息预判TRPs?这些信息能否用于支持对话系统中的预测?
人类听者并非等待轮次结束才识别可能的完成点,而是提前进行前瞻性识别,这被称为*投射*(Sacks等, 1974 (https://arxiv.org/html/2609.10934#bib.bib50); Schegloff, 1996 (https://arxiv.org/html/2609.10934#bib.bib52))。随着每个新词的出现,可投射的内容随之变化,听者会修正其关于轮次可能延续的*预期*(Magyari和de Ruiter, 2012 (https://arxiv.org/html/2609.10934#bib.bib39); Riest等, 2015 (https://arxiv.org/html/2609.10934#bib.bib49))。我们将这些动态预期操作化为*语义不确定性*:一种基于大语言模型的度量,衡量展开中的话语对后续合理内容的约束程度(Shorinwa等, 2025 (https://arxiv.org/html/2609.10934#bib.bib55))。我们通过采样当前话语的可能延续并测量其语义离散度来估计该信号(Nguyen等, 2025 (https://arxiv.org/html/2609.10934#bib.bib42))。我们探究这种不确定性变化能否比直接基线更准确地预测TRPs。本研究的贡献在于通过实证探讨:仅基于文本显式追踪动态语义约束,是否能支持对非脚本化交互中感知回应机会的预测。
## 2 相关工作
### 2.1 轮次交替与语义的作用
转换相关位置(TRPs)是话语中听者可以(但非必须)发起回应的节点(Sacks等, 1974 (https://arxiv.org/html/2609.10934#bib.bib50))。在这些位置,听者可能接话,当前发言者可能继续发言,或听者可能产生最小贡献如反馈词(如"嗯"、"啊哈";Yngve 1970 (https://arxiv.org/html/2609.10934#bib.bib70))或延续词(如"是的"、"好的";Schegloff 1982 (https://arxiv.org/html/2609.10934#bib.bib51))。根据时机不同,此类回应可能鼓励当前发言者继续或执行特定会话行为(Schegloff, 1982 (https://arxiv.org/html/2609.10934#bib.bib51))。重叠话语也未必具有干扰性;其是否被听为竞争性,部分取决于它相对于展开中轮次的起始位置以及参与者如何处理重叠(Schegloff, 2000 (https://arxiv.org/html/2609.10934#bib.bib53); Drew, 2009 (https://arxiv.org/html/2609.10934#bib.bib14))。尽管轮次时长存在文化差异,但快速发言者切换的基本组织方式在不同语言中广泛共享(Stivers等, 2009 (https://arxiv.org/html/2609.10934#bib.bib59))。鉴于TRPs对协调轮次的重要性,一个核心问题出现:听者如何在话语展开过程中投射TRPs?实验研究表明,除韵律和非言语线索外,轮次发展中词汇-句法结构对投射可能完成点尤为重要(de Ruiter等, 2006 (https://arxiv.org/html/2609.10934#bib.bib13); Levinson, 2016 (https://arxiv.org/html/2609.10934#bib.bib33))。当保留词汇-句法内容但将音高压平时,听者能准确投射轮次结束点;而当词语变得不可识别但保留语调时,表现则下降(de Ruiter等, 2006 (https://arxiv.org/html/2609.10934#bib.bib13))。听者还能预测轮次中即将到来的词语,其准确性与预测轮次结束时机的准确度密切相关(Magyari和de Ruiter, 2012 (https://arxiv.org/html/2609.10934#bib.bib39))。心理语言学理论将投射描述为增量过程:听者不断形成并修正关于轮次可能延续的预期(Riest等, 2015 (https://arxiv.org/html/2609.10934#bib.bib49); Levinson, 2016 (https://arxiv.org/html/2609.10934#bib.bib33); Magyari和de Ruiter, 2012 (https://arxiv.org/html/2609.10934#bib.bib39))。每个新词都会改变听者可能预期的词汇-句法和语义延续(Tanenhaus等, 1995 (https://arxiv.org/html/2609.10934#bib.bib60); Altmann和Kamide, 1999 (https://arxiv.org/html/2609.10934#bib.bib2); Hale, 2001 (https://arxiv.org/html/2609.10934#bib.bib20); Levy, 2008 (https://arxiv.org/html/2609.10934#bib.bib35))。某些词语会收窄这些可能性,而扩展、修复、限定和转向则可能引入新选项,并改变听者对轮次发展的预期(Lerner, 1991 (https://arxiv.org/html/2609.10934#bib.bib31); Schegloff, 1996 (https://arxiv.org/html/2609.10934#bib.bib52); Selting, 2000 (https://arxiv.org/html/2609.10934#bib.bib54); Liddicoat, 2004 (https://arxiv.org/html/2609.10934#bib.bib36))。因此,语义不确定性的变化可能反映轮次过程中合理意义范围的演变:下降表明可能延续的意义趋于一致,上升则表明差异增大。这种变化可能与轮次内部TRP相关,因为语义收敛可能支持对延续的预期,而发散则可能提示需修正或推迟先前的预期(Magyari和de Ruiter, 2012 (https://arxiv.org/html/2609.10934#bib.bib39); Riest等, 2015 (https://arxiv.org/html/2609.10934#bib.bib49))。
多模态线索(如韵律、注视和手势)在TRP投射中也发挥重要的*消歧*作用。这些线索并非独立于展开的语义和语用而被解读(Kendrick等, 2023 (https://arxiv.org/html/2609.10934#bib.bib28)),而是帮助听者区分可能完成与延续,并评估特定位置是否适合回应(Holler和Levinson, 2019 (https://arxiv.org/html/2609.10934#bib.bib22))。在重叠、打断和误解等复杂情境中,它们尤其具有信息价值(Skantze等, 2014 (https://arxiv.org/html/2609.10934#bib.bib58); Bögels和Torreira, 2015 (https://arxiv.org/html/2609.10934#bib.bib8))。
### 2.2 轮次交替的计算模型
计算工作主要通过可观测的交互结果对轮次交替进行建模。TurnGPT从文本和发言者身份预测标记级别的发言者切换概率,RC-TurnGPT则进一步结合候选系统回应进行条件预测(Ekstedt和Skantze, 2020 (https://arxiv.org/html/2609.10934#bib.bib15); Jiang等, 2023 (https://arxiv.org/html/2609.10934#bib.bib26))。由于两者均基于发言者切换数据训练,其目标反映的是轮次间转换而非轮次内部TRP(后者未必导致听者接话)(Threlkeld等, 2022 (https://arxiv.org/html/2609.10934#bib.bib61))。语音活动投射(VAP)模型采用互补方法,通过声学信号预测未来联合语音活动,并从中推导出轮次保持、发言者切换、重叠和相互静默(Ekstedt和Skantze, 2022 (https://arxiv.org/html/2609.10934#bib.bib16))。VAP已扩展至多模态、多方言和多语言场景,并与基于文本的方法结合(Onishi等, 2023 (https://arxiv.org/html/2609.10934#bib.bib44); Inoue等, 2024 (https://arxiv.org/html/2609.10934#bib.bib25); Leishman等, 2024 (https://arxiv.org/html/2609.10934#bib.bib30); Wang等, 2024a (https://arxiv.org/html/2609.10934#bib.bib63); Elmers等, 2025 (https://arxiv.org/html/2609.10934#bib.bib17))。尽管取得这些进展,对话系统仍难以把握回应时机(Algherairy和Ahmed, 2024 (https://arxiv.org/html/2609.10934#bib.bib1); Patamia等, 2025 (https://arxiv.org/html/2609.10934#bib.bib45); Arora等, 2025 (https://arxiv.org/html/2609.10934#bib.bib4))。因此,预测语音活动或发言者切换可能无法完全捕捉回应何时在交互中变得相关(Liesenfeld等, 2023 (https://arxiv.org/html/2609.10934#bib.bib38))。这一差距难以研究,因为许多标注丰富的交互语料库围绕发言者切换组织轮次(Anderson等, 1991 (https://arxiv.org/html/2609.10934#bib.bib3); Jurafsky, 1997 (https://arxiv.org/html/2609.10934#bib.bib27); Calhoun等, 2010 (https://arxiv.org/html/2609.10934#bib.bib9); Reece等, 2023 (https://arxiv.org/html/2609.10934#bib.bib46)),而任务导向语料库采用系统-用户交替模式(Budzianowski等, 2018 (https://arxiv.org/html/2609.10934#bib.bib7); Si等, 2023 (https://arxiv.org/html/2609.10934#bib.bib56))。因此这些资源主要捕捉发言者*实际*回应的位置,而非*可能*回应但未回应的位置。
### 2.3 语义不确定性量化
黑盒不确定性量化通过估计模型输出的变化来推断不确定性,无需访问模型输出分布——而这对于最先进大语言模型可能不可用(Liesenfeld和Dingemanse, 2024 (https://arxiv.org/html/2609.10934#bib.bib37); Shorinwa等, 2025 (https://arxiv.org/html/2609.10934#bib.bib55))。传统度量如归一化预测熵可能将意义变化与词汇形式变化混淆,即将语义等价的转述视为不同结果(Malinin和Gales, 2020 (https://arxiv.org/html/2609.10934#bib.bib40); Kuhn等, 2023 (https://arxiv.org/html/2609.10934#bib.bib29))。基于聚类的语义不确定性方法通过蕴含关系将等价输出归为语义类别,并在这些类别上计算熵,从而解决该问题(Kuhn等, 2023 (https://arxiv.org/html/2609.10934#bib.bib29); Farquhar等, 2024 (https://arxiv.org/html/2609.10934#bib.bib18))。更新的变体用基于核函数(Nikitin等, 2024 (https://arxiv.org/html/2609.10934#bib.bib43))或成对句子嵌入相似度(Nguyen等, 2025 (https://arxiv.org/html/2609.10934#bib.bib42))的渐进相似性替代硬聚类。这些方法主要应用于问答、摘要和翻译等任务(Kuhn等, 2023 (https://arxiv.org/html/2609.10934#bib.bib29); Farquhar等, 2024 (https://arxiv.org/html/2609.10934#bib.bib18); Shorinwa等, 2025 (https://arxiv.org/html/2609.10934#bib.bib55))。目前尚不清楚这些度量能否刻画话语在展开过程中语义约束强度的动态变化。
## 3 研究方法
### 3.1 轮次内部TRP预测任务
遵循Umair等 (2024) (https://arxiv.org/html/2609.10934#bib.bib62),我们将任务定义为预测单个发言者展开中轮次内的*机会*(而非义务)。随着话语展开,无论听者是否实际接话,任务目标是预测该话语是否提供可能的听者回应。形式上,我们将单个发言者的轮次定义为*刺激* S=⟨w1,...,wN⟩S=\\langle w\_\{1\},\\ldots,w\_\{N\}\\rangle,即N个词的序列(不同刺激的词数可变化)。我们将每个刺激进一步分割为一系列*前缀*,其中每个前缀 Pi=⟨w1,...,wi⟩P\_\{i\}=\\langle w\_\{1\},\\ldots,w\_\{i\}\\rangle 包含从第一个词到wi的词序列。我们将从刺激S衍生的所有前缀的有序集合记为 PS=⟨P1,...,PN⟩\\mathcal\{P\}\_\{S\}=\\langle P\_\{1\},\\ldots,P\_\{N\}\\rangle。对于每个前缀Pi,我们关联一个二元*参考标签* Ti∈\{0,1\}T\_\{i\}\\in\\\{0,1\\\},表示其最后一个词wi之后的位置是否被标记为TRP。由此生成的序列 TS=⟨T1,...,TN⟩\\mathbf\{T\}\_\{S\}=\\langle T\_\{1\},\\ldots,T\_\{N\}\\rangle 构成刺激的参考TRP标注,其中TNT\_\{N\}对应轮次结束位置。因此,TRP预测仅基于前序语言材料,反映听者形成TRP判断的*因果*约束。第4.1节 (https://arxiv.org/html/2609.10934#S4.SS1) 描述了从听者反应数据集构建参考标签TS\\mathbf\{T\}\_\{S\}的流程。
算法 1 语义不确定性估计相似文章
HawkesLLM:智能体文本模拟中的语义不确定性传播
本文介绍了HawkesLLM,一个通过结合用于时间影响和记忆选择的多变量Hawkes过程与用于文本生成的语言模型,对多步骤智能体文本模拟中的语义不确定性传播进行建模的框架。在GDELT新闻级联案例研究上的评估表明,在紧凑的提示-记忆约束下,后期语义对齐得到了改善。
多模态大语言模型中的不确定性感知决策
本综述整理了多模态大语言模型中不确定性感知决策的研究,涵盖了不确定性的来源、校准方法,以及提高系统可靠性和安全性的行动。
基于大语言模型的运筹学不确定性感知仿真推断
本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。
SKG-Eval:基于增量语义知识图谱的多轮对话状态化评估
提出SKG-Eval,一种用于多轮对话的准确定性评估框架,利用增量语义知识图谱检测跨轮不一致性、矛盾及主题漂移,实现与人类判断更高的相关性。
将轮次转换与语义解耦:基于有限状态机的全双工对话的解耦数据方法
本文提出一种解耦数据方法,通过从真实口语对话中学习轮次转换,同时利用文本处理语义,借助神经有限状态机框架来增强自然性并保留语义能力。