CobSeg: 对话主题分割中的连贯边界建模

arXiv cs.CL 论文

摘要

CobSeg是一种用于对话主题分割的多分支架构,它建模连贯边界并改进词汇转换检测,在多个基准测试上优于先前的非LLM方法。

arXiv:2605.30668v1 公告类型: 新 摘要: 对话主题分割在许多人类与AI协作的应用中至关重要,它需要识别异质的边界线索,包括话语边缘附近的词汇转换以及跨话语的语义不连续性。现有的话语模型常常稀释这些局部词汇信号。我们提出CobSeg,一种新颖的多分支架构,它将连贯性层面的语义连续性与词汇边界转换分离,并通过方向性边界预测恢复两者。CobSeg进一步使用边界信息量加权来强调高实用性的话语位置,并融合了从语料库中提取的主题连贯性线索与学习到的组合权重。尽管CobSeg是在监督式黄金边界训练和自动诱导边界的伪标签设置下作为紧凑的可训练分割器进行评估的,但它在推理期间无需调用LLM即可执行增强的边界预测。在五个基准测试中,当局部词汇线索突出时,它尤其改善了$P_k$和$W_d$: 在黄金监督下,它在VHF上将$P_k$降低了0.7个点,$W_d$降低了0.6个点,并在DialSeg711上达到了$P_k$为1.0; 在诱导边界下,它将VHF上的$P_k$降低了14.8个点,DialSeg711上降低了1.5个点,TIAGE上降低了1.1个点,优于先前的非LLM方法。
查看原文
查看缓存全文

缓存时间: 2026/06/01 09:27

# CobSeg: 面向对话主题分割的连贯边界建模
来源: https://arxiv.org/html/2605.30668
###### 摘要

对话主题分割在许多人类-AI协作应用中至关重要,它需要识别异质的边界线索,包括话语边缘附近的词汇转换和跨话语的语义不连续性。现有的话语模型常常稀释这些局部的词汇信号。我们提出CobSeg,一种新颖的多分支架构,它将连贯层面的语义连续性与词汇边界转换分离开,并通过方向性边界预测恢复两者。CobSeg进一步使用边界信息量加权来强调高实用性的话语位置,并融合了一个从语料库中提取的、带有学习到的组合权重的主题连贯性线索。尽管CobSeg在监督式金边界训练和带有自动诱导边界的伪标签设置中被评估为一个紧凑的可训练分割器,但它在推理过程中无需调用LLM即可实现增强的边界预测。在五个基准测试中,它在局部词汇线索突出的情况下尤其改进了Pk和Wd指标:在监督式金边界下,它在VHF上将Pk降低了0.7个点,Wd降低了0.6个点,在DialSeg711上达到了1.0的Pk;在诱导边界下,它在VHF上将Pk降低了14.8个点,在DialSeg711上降低了1.5个点,在TIAGE上降低了1.1个点,超越了先前的非LLM方法。

CobSeg: 面向对话主题分割的连贯边界建模

## 1 引言

参见图注 图1: CobSeg的整体结构。对话主题分割识别多轮对话中的主题转换,并将对话划分为连贯的主题单元,使得在客户服务分析、会议回顾、交通通信、监控与管理等实际应用中,长而杂乱无章的对话更易于组织和处理。它支持下游任务,如对话理解(Wang et al.,2020 (https://arxiv.org/html/2605.30668#bib.bib47))、检索(Xu et al.,2021a (https://arxiv.org/html/2605.30668#bib.bib53))和摘要(Qi et al.,2021 (https://arxiv.org/html/2605.30668#bib.bib36))。特别是,它有助于增强船舶交通服务(VTS)和空中交通管制(ATC)系统中的人机协作。近期工作涵盖了基于金边界训练的监督模型(Koshorek et al.,2018 (https://arxiv.org/html/2605.30668#bib.bib22); Jiang et al.,2023 (https://arxiv.org/html/2605.30668#bib.bib21))、从连贯性模式中诱导边界的无监督方法(Gao et al.,2023 (https://arxiv.org/html/2605.30668#bib.bib13); Xing and Carenini,2021 (https://arxiv.org/html/2605.30668#bib.bib51))、利用辅助信号进行伪标签训练(Artemiev et al.,2024 (https://arxiv.org/html/2605.30668#bib.bib1)),以及基于LLM的推理(Lee et al.,2025 (https://arxiv.org/html/2605.30668#bib.bib23); Das et al.,2024 (https://arxiv.org/html/2605.30668#bib.bib7))。

然而,直接使用LLM推理与可训练的分割模型代表了不同的操作模式。基于LLM的方法通常依赖于通用大型模型和测试时的基于提示的推理,而可训练的分割器旨在学习任务特定的边界预测器,训练后可独立部署。这种区别在实际环境中很重要,因为推理成本、延迟、可重复性、本地部署要求以及数据隐私使得反复调用LLM不太理想。

如图̃1 (https://arxiv.org/html/2605.30668#S1.F1)所示,核心挑战是通过整合话语级内容、切割级转换证据和序列级解码,为候选边界分配可靠的决策信号。

现有工作从话语层级建模DTS任务,这引入了局限性。(Devlin et al.,2019 (https://arxiv.org/html/2605.30668#bib.bib8); Liu et al.,2019 (https://arxiv.org/html/2605.30668#bib.bib26))将话语下的句子级编码器压缩成固定向量,对边界相邻的标记和话语中间内容进行平均,从而稀释了标记主题转换的词汇转换。近期的话语对框架(Yang et al.,2025 (https://arxiv.org/html/2605.30668#bib.bib57); Somasundaran et al.,2020 (https://arxiv.org/html/2605.30668#bib.bib41))完全在话语层级运作,无法恢复这些标记级线索。(Li et al.,2018 (https://arxiv.org/html/2605.30668#bib.bib24); Nair et al.,2023 (https://arxiv.org/html/2605.30668#bib.bib31))将容量均匀分配到所有位置,而只有一小部分话语位置承载决定性的转换信号。(Gao et al.,2023 (https://arxiv.org/html/2605.30668#bib.bib13); Park et al.,2023 (https://arxiv.org/html/2605.30668#bib.bib32); Glavaš et al.,2016 (https://arxiv.org/html/2605.30668#bib.bib15); Gong et al.,2022 (https://arxiv.org/html/2605.30668#bib.bib16))使用语料级主题连贯性作为固定的预处理启发式,而不是理解多话语配对的深层模式。

提出的CobSeg通过针对性的设计解决了每个局限性,同时遵循上述可训练分割器范式:它使用紧凑的任务特定模型进行边界预测,推理过程中不需要调用LLM。词汇边界检测器通过在池化前提高话语边缘标记的权重来保留标记级转换证据。话语边界信息量加权(UBIW)学习每个位置的信息量分数,将容量集中在高实用性的切割位置上。来自无监督关键词归纳的主题连贯性线索提供了带有学习系数的统计边界证据,在logit层面注入,使得模型可以在训练期间增强或抑制该信号。方向性边界头部分别建模主题总结和主题启动,反映了这两个信号的不对称性。

主要贡献如下:

- • 我们提出CobSeg,一个紧凑的可训练多分支框架,将词汇转换线索与语义连贯性信号分离开,用于DTS,实现了无需推理时LLM调用的高效边界预测。
- • 我们引入UBIW和方向性预测头,用于对主题转换周围稀疏、不对称的证据进行建模。
- • 我们在五个基准测试上,在监督式和伪标签设置下评估CobSeg,展示了在Pk和Wd指标上的改进,并进行了有针对性的消融实验。

## 2 方法论

### 2.1 整体结构

参见图注 图2: CobSeg的详细架构。给定一个包含T个话语的对话D={u1,...,uT},对话主题分割预测每个相邻话语对是否构成一个主题边界。边界序列定义为y={y1,...,yT−1},其中yt=1表示在ut和ut+1之间存在一个主题边界。因此,每个预测关联到一个切割位置t∈{1,...,T−1},而不是单个话语。CobSeg使用线性链CRF对所有候选切割位置进行结构化边界预测:

y∗=arg⁡maxy∈{0,1}T−1⁡\[∑t=1T−1st(yt;D)+∑t=1T−2Ayt,yt+1\], (1)

其中st(yt;D)是切割位置t处的局部发射分数,A∈R2×2是学习到的转移矩阵。

图̃2 (https://arxiv.org/html/2605.30668#S2.F2)展示了CobSeg的整体架构。该模型从对话的三个互补视角计算每个切割级发射分数:一个连贯性编码器,用于建模跨话语的语义连续性;一个词汇边界检测器,用于保留话语边缘附近标记级的转换线索;以及一个主题结构提取器,用于提供基于语料库的主题连贯性证据。相同的架构用于监督式和伪标签设置;唯一的区别是边界监督的来源。训练最小化CRF在切割位置上的负对数似然,并辅以轻量级的辅助损失,鼓励稀疏的UBIW分数和边界相邻标记的基于间隔的分离(Koshorek et al.,2018 (https://arxiv.org/html/2605.30668#bib.bib22));完整超参数列于表̃7 (https://arxiv.org/html/2605.30668#A3.T7)。

### 2.2 多视角转换表示

对于一个话语ut,令xt(s)∈Rd表示通过均值池化主编码器(Devlin et al.,2019 (https://arxiv.org/html/2605.30668#bib.bib8); Liu et al.,2019 (https://arxiv.org/html/2605.30668#bib.bib26))的隐藏状态得到的连贯性编码器表示。令vt,j∈Rd表示ut中第j个标记的上下文状态,pj其位置嵌入,mt,j∈{0,1}标记掩码,ρt,j∈[0,1]归一化标记位置。遵循TextSeg骨干(Koshorek et al.,2018 (https://arxiv.org/html/2605.30668#bib.bib22)),词汇边界检测器在话语内部应用一个时间敏感的结构进行标记序列建模。双向上下文建模允许编码器从过去和未来的标记中捕获依赖关系(Schuster and Paliwal,1997 (https://arxiv.org/html/2605.30668#bib.bib38))。令Enctok表示一个双向LSTM编码器,用于处理每个话语内的标记序列:

ht,j=Enctok(vt,j+pj), (2)

得到的标记状态使用边缘感知加权规则进行池化:

πt,j=α+(1−α)|2ρt,j−1|γ, xt(w)=Ww∑jmt,jπt,jht,j∑jmt,jπt,j, (3)

这提高了话语边界附近标记的权重。对于主题结构提取器,xt(t)∈Rd表示通过在一个面向连贯性的编码器(Gao et al.,2021 (https://arxiv.org/html/2605.30668#bib.bib14))上对ut进行均值池化得到的静态主题表示。

对于每个分支b∈{s,w,t},CobSeg将话语表示转换为面向切割的转换特征。在切割位置t处,左右话语状态通过下式比较:

zt(b)=[xt(b);xt+1(b);|xt+1(b)−xt(b)|;xt(b)⊙xt+1(b)], (4)

这总结了持续性、变化幅度和特征交互。然后,分支状态通过两个不对称的门控残差适配器更新,它们共享相同的转换映射φb、标量门gb和转换特征zt(b),但锚定在切割的两侧:

rt(b,end)=(1−σ(gb))xt(b)+σ(gb)φb(zt(b)), rt(b,start)=(1−σ(gb))xt+1(b)+σ(gb)φb(zt(b)), (5)

其中rt(b,end)锚定到左话语ut用于建模主题总结,rt(b,start)锚定到右话语ut+1用于建模主题启动。学习到的标量门gb控制转换校正替换每个方向上基础话语表示的程度。

相同的NSP融合和上下文化步骤应用于两个方向性适配器输出。为简洁起见,以下方程中rt(b)代表rt(b,end)或rt(b,start)。在表̃1 (https://arxiv.org/html/2605.30668#S2.T1)中报告的监督式主要结果中,NSP通道被禁用;在这些实验中,rt(b,nsp)=rt(b)且βnsp=0。NSP通道仅在伪标签设置中启用,其中交叉编码器边界概率qt提供额外的连贯性信号,以补偿较嘈杂的训练目标。当可选的NSP通道启用时,相邻话语对由交叉编码器编码,产生一个辅助对表示nt和一个成对边界概率qt(Devlin et al.,2019 (https://arxiv.org/html/2605.30668#bib.bib8))。辅助表示通过下式注入到每个分支:

rt(b,nsp)=rt(b)+σ(λb)nt, (6)

其中λb是每个分支特定的融合门。当NSP通道不存在时,rt(b,nsp)=rt(b)。然后,每个分支通过一个时间敏感的结构在对话级别进行序列建模上下文化,遵循TextSeg架构(Koshorek et al.,2018 (https://arxiv.org/html/2605.30668#bib.bib22))。上下文化器聚合对话序列中的信息,允许每个切割位置访问前后上下文(Schuster and Paliwal,1997 (https://arxiv.org/html/2605.30668#bib.bib38); Vaswani et al.,2017 (https://arxiv.org/html/2605.30668#bib.bib45)):

ft(b)=Cb(r1:T−1(b,nsp),t)+Wbrt(b,nsp), (7)

其中Cb是一个堆叠在转换特征之上的时间敏感序列编码器,残差投影Wb保留了对话级编码后的局部切割位置信号。

### 2.3 话语边界信息量加权

在典型的多轮对话中,只有一小部分话语承载关于主题转换的决定性证据。大多数轮次继续正在进行的主题,不引入词汇转换。将每个话语位置视为同等信息量会稀释模型的表示预算。

CobSeg通过话语边界信息量加权来解决这个问题,它学习为每个切割位置根据其预测的边界预测效用打分,并相应地对分支状态进行重新加权。该模块在每个分支的结束视图和开始视图上独立运作。这允许模型学习不同的话语对于识别主题总结与主题启动可能具有不同的信息量。例如,总结前一个主题的话语对于左向(结束)信号信息量丰富,而开始一个新主题的话语对于右向(开始)信号信息量丰富。

相似文章

基于对比 LLM 微调对齐对话附和信号与语境表征

arXiv cs.CL

KTH Royal Institute of Technology 的研究人员提出了一种两阶段框架,通过在对话转写文本上微调 LLMs,并结合对比学习构建联合嵌入空间,以实现对对话附和信号与语境的精准对齐。结果表明,相较于以往方法,该方案显著提升了语境与附和信号的匹配检索性能。

MedLoCoMo:面向大语言模型的长上下文多会话医疗对话基准

arXiv cs.AI

MedLoCoMo 是一个新基准,用于评估大语言模型在长上下文、多会话医疗对话推理上的表现,基于 MIMIC-IV 数据构建。它测试了单次入院、跨入院以及对抗性不可回答的问题,揭示出即使对于拥有长上下文窗口的模型,跨入院推理仍然具有挑战性。