DiaWhisper-DPO:通过失败挖掘的偏好优化实现临床访谈的角色归因转录
摘要
本文提出DiaWhisper-DPO,一个用于临床访谈转录和角色归因的端到端模型,采用失败挖掘的偏好优化,相比级联基线实现高准确度并减少错误。
arXiv:2609.16661v1 公告类型:新
摘要:从临床访谈中自动筛查抑郁症需要将话语归因给临床医生或患者。我们评估了两个数据集:DAIC-WOZ,其中参与者单独的录音需要重新合成双方以进行受控的双人评估;以及PDCH-HAMD,包含语音转换的真实中文访谈用于跨语言验证。级联系统将说话人日志与角色分配启发式方法结合,因此错误可以在各阶段传播。我们提出一个端到端模型,我们将其命名为DiaWhisper,通过LoRA和辅助帧级角色头对Whisper-large-v3进行微调,用于转录和归因,以及DiaWhisper-DPO,一个失败挖掘的细化方法,使用真正的解码失败作为DPO拒绝完成,无需人工偏好注释。在29个DAIC-WOZ测试会话中,DiaWhisper-DPO实现0.973的角色准确度和0.119的DER,比最强级联基线低72%,并将种子变异从{\sigma} = .205减少到.002。在PDCH-HAMD上重新训练后,它实现0.973的角色准确度,并改进了所有78个会话-种子对。
查看缓存全文
缓存时间: 2026/09/16 08:51
# DiaWhisper-DPO:基于失败挖掘偏好优化的临床访谈角色归属转录
来源:https://arxiv.org/html/2609.16661
###### 摘要
从临床访谈中进行自动化抑郁筛查需要将话语归属于临床医生或患者。我们评估了两个数据集:DAIC-WOZ(其中仅包含参与者录音的数据需要重新合成双方语音以进行可控的双向评估)以及 PDCH-HAMD(由语音转换的真实中文访谈组成,用于跨语言验证)。级联系统将说话人分离与启发式角色分配相结合,因此错误可能在各阶段间传播。我们提出了一种名为 DiaWhisper 的端到端模型,该模型使用 LoRA 和一个辅助的帧级角色头对 Whisper-large-v3 进行微调,用于转录和角色归属;同时提出了 DiaWhisper-DPO,这是一种利用真实解码失败作为 DPO 拒绝完成项(无需人工偏好标注)的失败挖掘优化方法。在 29 个 DAIC-WOZ 测试集会话上,DiaWhisper-DPO 实现了 0.973 的角色准确率和 0.119 的 DER(比最强的级联基线低 72%),并将种子变异从 σ=.205 降低至 .002。在 PDCH-HAMD 上重新训练后,它实现了 0.757 的角色准确率,并在所有 78 个会话-种子对中均有改进。
###### 索引术语:
语音识别,说话人分离,角色归属,参数高效微调,偏好优化
††地址:1 系统与机器人研究所(ISR),LARSyS,生物工程系,里斯本高等技术学院(IST),里斯本大学,1049-001 葡萄牙里斯本;2 贝特里兹·安吉洛医院,葡萄牙天主教大学医学院,2674-514 葡萄牙洛雷斯††脚注:本工作得到 LARSyS 资金支持(DOI: 10.54499/LA/P/0083/2020 和 10.54499/UID/50009/2025)。
## 1 引言
从临床访谈中进行自动化抑郁筛查不仅依赖于准确的转录:还需要知道*谁*说了什么。患者的用词选择、犹豫、反应延迟和话轮转换动态是抑郁症状的公认标志,但只有在正确归属的情况下才具有信息量,并且通常取决于先前的访谈者问题[1 (https://arxiv.org/html/2609.16661#bib.bib7),12 (https://arxiv.org/html/2609.16661#bib.bib17)]。相同的词汇或声学模式,无论来自临床医生还是患者,其临床相关性可能不同,错误归属的话轮会扭曲下游的筛查信号[3 (https://arxiv.org/html/2609.16661#bib.bib8)],使得可靠的角色归属对于下游临床分析至关重要,因为说话人身份直接影响解释。我们在两个互补的语料库上研究这个问题:DAIC-WOZ[13 (https://arxiv.org/html/2609.16661#bib.bib1),21 (https://arxiv.org/html/2609.16661#bib.bib2)](一个广泛使用的英语语料库,其仅包含参与者录音的数据需要重新合成双方语音以进行可控评估(第 2.1 节 (https://arxiv.org/html/2609.16661#S2.SS1)))和 PDCH-HAMD[4 (https://arxiv.org/html/2609.16661#bib.bib24)](真实中文临床访谈的语音转换录音,用于独立的跨语言验证(第 3.1 节 (https://arxiv.org/html/2609.16661#S3.SS1)))。传统流水线使用说话人分离[18 (https://arxiv.org/html/2609.16661#bib.bib18)],然后进行启发式角色分配,但这种级联设计会让错误传播:分离错误会带入角色分配,而两个阶段都无法纠正对方[10 (https://arxiv.org/html/2609.16661#bib.bib9)]。最近的工作则在单个序列转换模型中联合建模转录和角色或说话人归属[10 (https://arxiv.org/html/2609.16661#bib.bib9),15 (https://arxiv.org/html/2609.16661#bib.bib19),24 (https://arxiv.org/html/2609.16661#bib.bib6)],并结合参数高效的 Whisper 适配[22 (https://arxiv.org/html/2609.16661#bib.bib15)]和用于代码转换 ASR 的偏好优化[16 (https://arxiv.org/html/2609.16661#bib.bib16)]。我们结合了这些方向,通过微调 Whisper 以端到端方式生成带角色标签、带时间戳的转录文本,然后使用失败挖掘的 DPO[20 (https://arxiv.org/html/2609.16661#bib.bib5),17 (https://arxiv.org/html/2609.16661#bib.bib20)]对其进行优化,使用真实的解码失败作为拒绝完成项,真实标签作为选中完成项,无需额外的偏好标注。
我们的贡献包括:(i)失败挖掘的偏好优化,表明真实的模型失败提供了比额外 SFT 或人工负样本更强、更稳定的训练信号,且无需额外标注成本;(ii)DiaWhisper,一个经过 LoRA 微调的 Whisper-large-v3 模型,带有辅助的帧级角色分类头,用于无需单独分离的带角色标签、带时间戳的双向转录;(iii)DAIC-WZ 真实与合成语音的验证,量化了重新合成引入的参与者侧领域差距;(iv)DiaWhisper-DPO,在 DAIC-WOZ 上将种子稳定性从 σ=.205 提高至 .002,并将 DER 相对于最强的级联基线降低了 72%;当在语音转换的 PDCH-HAMD 上独立训练和评估时,该方法在所有 78 个匹配的会话-种子对中改进了角色归属,支持其跨语言适用性;(v)带自助法置信区间的角色级 AER 和 DER,覆盖条件准确率,以及预言机角色映射检查,这些揭示了角色和语言特定的错误,同时将真正的归属增益与覆盖或启发式效应区分开来。
请参见标题图 1:训练流水线:阶段 1 产生 DiaWhisper;阶段 2 将其优化为 DiaWhisper-DPO。两者共享第 2.4 节 (https://arxiv.org/html/2609.16661#S2.SS4) 中的推理过程。
## 2 方法
我们构建双向临床访谈数据,调整 Whisper 以通过辅助分离损失联合进行转录、时间戳和角色识别,然后使用来自训练集失败的失败挖掘 DPO 优化 DiaWhisper。两个模型共享相同的推理过程。
### 2.1 数据集构建
我们使用 DAIC-WOZ[13 (https://arxiv.org/html/2609.16661#bib.bib1),21 (https://arxiv.org/html/2609.16661#bib.bib2)]和中文 PDCH 语料库[4 (https://arxiv.org/html/2609.16661#bib.bib24)]作为互补的临床访谈语料库。DAIC-WOZ 仅分发参与者侧的音频,因此我们使用 XTTS[5 (https://arxiv.org/html/2609.16661#bib.bib3),6 (https://arxiv.org/html/2609.16661#bib.bib21)]根据真实转录文本合成医生和患者的语音,重建双向对话,同时保留精确的角色边界和时间戳。对于每个会话,每个角色使用两个 VCTK 语音[23 (https://arxiv.org/html/2609.16661#bib.bib4)]进行交叉组合,形成四个变体,其中一个使用 SHA256(session_id, filename) 确定性地选择,确保大致平衡的语音分配且无跨分割泄露。对于中文验证,我们使用包含抑郁症咨询和汉密尔顿抑郁量表(HAMD)评估的 PDCH 录音;语音经过语音转换以保护隐私,我们的患者级划分防止了说话人身份跨越数据分割。
### 2.2 架构
图 1 (https://arxiv.org/html/2609.16661#S1.F1) 概述了该流水线。我们使用 LoRA[14 (https://arxiv.org/html/2609.16661#bib.bib14)](秩 = 16,α=32,dropout = 0.05)对 Whisper-large-v3[19 (https://arxiv.org/html/2609.16661#bib.bib13)]进行微调,应用于编码器和解码器的自注意力查询/值投影。目标遵循 Whisper 原生的时间戳-标签-文本-时间戳格式,将文本片段替换为带角色标签的片段(<|doctor|>, <|patient|> 或 <|interject|> 用于重叠);只有 3 个角色令牌的嵌入/输出行未被冻结。
我们附加一个辅助角色头 gφ——一个单一的线性层,4 类:Doctor/Patient/Interject/None,仅用于训练,推理时丢弃——到每个编码器帧 ht∈R1280 (t=1,...,T=1500 帧/30秒块)。对于每一帧,一个置信度权重 wt 来自边际 mt——即帧 t 的 CAM++[7 (https://arxiv.org/html/2609.16661#bib.bib11)] 说话人嵌入 et 与会话的医生和患者声纹质心的相似度之差:
mt = cos(et, cDoctor) - cos(et, cPatient) (1)
wt = f(||mt||) (2)
其中 f(·) 将较大的边际映射到较高的置信度(在 5 个分箱中,||mt|| 阈值 0.05/0.15/0.3/0.5,从 0.4(~39% 测量可靠性)到 1.0(~99.8%))。该权重被输入一个独立的损失:
Ldiar = (1/T) * Σ_{t=1}^{T} wt · CE(gφ(ht), rt) (2)
其中 CE 是交叉熵,rt 是真实帧角色;低置信度帧被降权以限制模糊帧的梯度。
### 2.3 训练
在阶段 1(DiaWhisper),我们联合优化:
L_V1 = L_dec + λ · L_diar, λ=0.3 (3)
其中 L_dec 是序列化目标上的教师强制交叉熵,λ 是辅助分离损失的权重。训练使用学习率 1×10^{-4},有效批大小 16,在 3 个种子上训练 3 个周期。
在阶段 2,我们使用 DPO[20 (https://arxiv.org/html/2609.16661#bib.bib5)] 优化 DiaWhisper,得到 DiaWhisper-DPO。从触发 8 个令牌重复标准的训练窗口中,我们每个种子抽取约 500 个形成偏好对(500/500/500 英语;499/500/499 中文),使用模型自身的真正失败作为拒绝项,真实标签作为选中项。阶段 1 的参数被合并并冻结,只优化一个新初始化的策略 LoRA 适配器。使用策略 πθ,冻结的参考 πref,输入 x,选中 y_c,拒绝 y_r:
Δ_θ = log πθ(y_c|x) - log πθ(y_r|x) (4)
Δ_ref = log πref(y_c|x) - log πref(y_r|x) (5)
L_DPO = -log σ(β[Δ_θ - Δ_ref]) (6)
其中 σ(·) 是 sigmoid,β 控制偏好锐度。训练使用 β=0.1,学习率 5×10^{-5},训练 1 个周期,每个种子独立挖掘和训练。
### 2.4 推理和解码
音频被分割成约 29.5 秒的块,边界在 ±2s 内吸附到最近的低能量停顿,因为在推理时没有真实边界。每个块进行贪心解码(束搜索通常会丢失微调的角色/时间戳结构),当出现 8 个连续重复令牌(这也是 DPO 挖掘标准(第 2.3 节 (https://arxiv.org/html/2609.16661#S2.SS3)))或达到令牌预算时停止。在达到完整覆盖之前的重复截断会触发重试(每个块最多 4 次),从估计的点以采样(温度 = 0.5,top-p = 0.9)而不是贪心方式恢复,因为从几乎相同的上下文在贪心解码下恢复会重现循环。输出被解析为(角色,开始,结束,文本)三元组,并按会话连接;DiaWhisper 和 DiaWhisper-DPO 共享此过程,仅检查点不同。
## 3 实验结果与分析
我们评估失败挖掘的偏好优化是否提高了角色归属转录在 DAIC-WOZ 和 PDCH-HAMD 上的准确性和鲁棒性,并对种子敏感性和解码失败进行了额外分析。
### 3.1 实验设置
DAIC-WOZ 使用 132/28/29 个训练/开发/测试会话;我们的 PDCH-HAMD 子集有来自 73 名患者的 100 个会话(49.8 小时),按患者划分 51/11/11,产生 26 个测试会话。我们比较了三个共享相同首说话人启发式和对齐器、仅在分离方法上不同的级联 Whisper-large-v3 基线:ECAPA-TDNN[8 (https://arxiv.org/html/2609.16661#bib.bib10)]、CAM++[7 (https://arxiv.org/html/2609.16661#bib.bib11)] 和 pyannote.audio[2 (https://arxiv.org/html/2609.16661#bib.bib12)]。指标包括时间对齐后的轮次级角色准确率(未匹配的参考轮次计为错误)、WER/CER,以及在匹配参考轮次上的归属错误率(AER)。设 T_r 为角色 r 的参考轮次,D_r = {t ∈ T_r : pred_role(t) ≠ Missing}:
AER_r = |{t ∈ D_r : pred_role(t) ≠ r}| / |D_r| (7)
因此 AER 衡量的是在非缺失轮次条件下的归属;覆盖错误由 DER 捕获。我们还报告了 NIST 风格的说话人分离错误率(DER)[11 (https://arxiv.org/html/2609.16661#bib.bib22)]:
DER = (MD + SC + FA) / TOTAL (8)
其中 MD 是遗漏的参考语音时长,SC 是错误归属的语音时长,FA 是非重叠的预测时长,TOTAL 是总参考语音时长。由于只有医生和患者角色,SC 直接反映角色错误,因此 DER 仅在此任务内解释。我们报告所有系统的 2000 次重采样会话自助法 95% 置信区间;对于 DiaWhisper 和 DiaWhisper-DPO[9 (https://arxiv.org/html/2609.16661#bib.bib23)],在每个采样的会话内合并三个种子。为了量化 DAIC-WOZ 合成数据的差距,我们转录匹配的真实和 XTTS 患者音频:在 189 个会话上的平均 WER 为 0.136 对比 0.106,在测试集上为 0.107 对比 0.099。PDCH-HAMD 提供了语音转换后的真实对话访谈的独立验证。结果显示在表 1 (https://arxiv.org/html/2609.16661#S3.T1)–2 (https://arxiv.org/html/2609.16661#S3.T2) 中,跨数据集和稳定性分析见第 3.3 节 (https://arxiv.org/html/2609.16661#S3.SS3)。
### 3.2 主要结果
表 1 (https://arxiv.org/html/2609.16661#S3.T1) 报告了两个数据集的结果。DiaWhisper-DPO 在角色准确率、DER 和 AER 上领先所有基线。在 DAIC-WOZ 上,较大的 WER 改进主要反映了在消除耗尽重试的重复循环后恢复的覆盖(第 3.3 节 (https://arxiv.org/html/2609.16661#S3.SS3))。其 DER(0.119)大约是最佳基线 0.431 和 DiaWhisper 0.485 的四分之一,而 FA 从基线的约 30% 下降到约 10%。嘈杂的、包含未转录填充词和语音转换语音的 PDCH-HAMD 显示相同的排名但差距较小:DiaWhisper-DPO 实现了 0.313 的 DER,而 Pyannote 为 0.574,FA 为 8-17%,表明错误主要由遗漏或错误归属的语音主导。角色级 AER 在 DiaWhisper-DPO 上保持最低,在 DAIC-WOZ 上为 0.01/0.02,在 PDCH-HAMD 上为 0.26/0.26。预言机角色映射仅将基线准确率改变 0-7 个百分点(各系统数值因篇幅省略);DiaWhisper-DPO 在 DAIC-WOZ 上仍然领先最佳预言机基线 21.5 个百分点,在 PDCH-HAMD 上领先 17.1 个百分点,表明主要是分离错误而非角色分配错误。
表 1:测试集结果,DAIC-WOZ (n=29) 和 PDCH-HAMD (n=26)。CI = 会话自助法 95% CI;DiaWhisper CI 合并了 3 个种子/会话。σ = 种子标准差;AER (D/P) = 医生/患者。
### 3.3 种子稳定性与错误相似文章
TD-DPO: 差异感知偏好优化在临床自闭症干预对话中缓解谄媚行为
本文提出TD-DPO,一种令牌级差异感知偏好优化方法,用于缓解临床自闭症干预对话中大语言模型的谄媚行为,在减少谄媚行为和保持干预能力之间实现了更好的权衡。
面向中英文混合语音识别的音频大语言模型直接偏好优化
本文应用直接偏好优化(DPO)来对齐音频大语言模型,以转录中英文混合语音,在分布内实现了高达89.6%的MER降低,在分布外实现了20%的降低。它识别出三种失败模式——语言遗漏、翻译替代转录以及幻觉——并表明基于偏好的对齐能有效激发多语言音频大语言模型的正确混合转写行为。
超越聊天机器人的直接偏好优化
直接偏好优化(DPO)被应用于聊天机器人之外的OCR任务,显示出在多个模型家族中文本退化的显著减少,平均减少了59.4%。
面向聊天机器人微调的直接偏好优化:一项实证研究
本文对直接偏好优化(DPO)在大型语言模型微调中的应用进行了实证研究,表明DPO简化了训练流程,在实现竞争性性能的同时,也解决了训练不稳定性问题。
GroupDPO:内存高效的分组直接偏好优化
GroupDPO 引入了一种内存高效的分组直接偏好优化算法,该算法利用每个提示的多个候选响应,通过解耦反向传播来减少峰值内存使用。该方法在离线和在线对齐设置中均展现出相比标准 DPO 的持续改进。