医患对话的鲁棒摘要:TalTech系统在Beyond Transcription挑战赛中的方案

arXiv cs.CL 论文

摘要

本文描述了TalTech系统,该系统直接利用医患对话音频生成SOAP笔记,采用通过监督学习和DAPO强化学习微调的Voxtral模型。他们的提交在BeTraC挑战赛的两个赛道均排名第一,实现了高概念准确率和低幻觉率。

arXiv:2607.17230v1 公告类型: 新 摘要: 本文描述了TalTech在Beyond Transcription挑战赛(BeTraC)中的提交方案,该挑战要求直接从长医患对话录音中生成SOAP笔记,无需中间转录。在筛选了开源权重语音LLM的长音频鲁棒性后,我们采用LoRA监督微调,随后通过DAPO强化学习(以挑战指标Open Medical Concept F1作为奖励)对Voxtral Mini(轻量级赛道)和Voxtral Small(重量级赛道)进行了适配。我们的系统在两个赛道均排名第一,独立的LLM-as-a-judge评估显示,在所有提交中我们的幻觉率最低,表明针对概念匹配指标进行强化学习无需牺牲事实可靠性。我们还发现,对文本转录的微调能够很好地迁移到语音输入,并似乎提高了在域外真实录音上的鲁棒性。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:44

# 医患对话的鲁棒摘要:TalTech 在超越转录挑战赛中的系统
来源:https://arxiv.org/html/2607.17230

###### 摘要

本文描述了TalTech团队提交至超越转录挑战赛(BeTraC)的系统。该挑战要求直接从长时间的医患对话录音生成SOAP记录,且不允许中间转录步骤。在筛选了具有长音频鲁棒性的开源语音大语言模型后,我们采用Voxtral Mini(轻量级赛道)和Voxtral Small(重量级赛道),结合LoRA监督微调,随后使用以挑战指标——开放医学概念F1作为奖励的DAPO强化学习进行适配。我们的系统在两个赛道均排名第一,且一项独立的大模型评判评估显示,在所有提交系统中,我们的系统幻觉率最低,这表明针对概念匹配指标进行强化学习不必牺牲事实可靠性。我们还发现,在文本转录本上微调可以很好地迁移到语音输入,并且似乎能提高在域外真实录音上的鲁棒性。

## I. 引言

从医患对话录音生成临床记录极具吸引力,因为它可以在无需单独转录步骤的情况下减轻文档负担。然而,此类系统必须准确保留临床事实,因为任何关于症状、诊断或治疗方案的幻觉都可能使一份原本良好的记录变得不安全。BeTraC挑战正是针对这一场景,要求系统直接从音频生成纯文本的医学SOAP(主观、客观、评估和计划)记录,同时禁止将中间转录作为系统的显式组件[2 (https://arxiv.org/html/2607.17230#bib.bib11)]。

TalTech团队向BeTraC的两个赛道都提交了直接音频到SOAP记录的系统。我们基于Voxtral构建,这是一个具有强大音频和文本能力的开源语音理解模型系列[6 (https://arxiv.org/html/2607.17230#bib.bib1)],选择依据是在验证集上的零样本研究,其中Voxtral在测试的语音大语言模型中显示出最佳的语音到摘要和语音识别行为。随后,我们使用监督微调(SFT)以及随后的DAPO强化学习,将Voxtral Mini适配到轻量级赛道,将Voxtral Small适配到重量级赛道。

## II. 挑战、数据与指标

BeTraC使用SynthDoPaCo语料库,这是一个完全合成的双人医患对话数据集,包含环境噪声、房间混响和压缩伪影[5 (https://arxiv.org/html/2607.17230#bib.bib2)]。它包含8,800段对话,约1,329小时的音频,每段对话约九分钟,分为7,200个训练对话和400个验证对话。最终排行榜基于包含875个音频样本的盲测集。

两个赛道都要求使用开源权重模型,并禁止使用中间转录本;轻量级赛道将总模型大小限制为6B参数,并禁止使用工具或代理流程,而重量级赛道允许最多36B参数。提交结果按开放医学概念F1排名,该指标通过MeSH关键词匹配和基于scispaCy的命名实体识别计算得出;ROUGE-2和ROUGE-3 F1为次要指标[1 (https://arxiv.org/html/2607.17230#bib.bib12)]。

## III. 基座模型选择

在微调之前,我们比较了几个具有语音能力的开源大语言模型在零样本语音到SOAP生成和语音识别方面的表现,考察模型能否仅从音频生成所需的SOAP记录格式,以及是否能够鲁棒地处理长音频以支持任务特定的微调。结果见表I (https://arxiv.org/html/2607.17230#S3.T1)。我们也考虑了Phi-4-multimodal-instruct(因处理长音频时GPU显存需求过高而被拒绝)和Gemma-4-E2B/E4B(仅限30秒音频输入)。

表 I:音频大语言模型的零样本摘要和ASR结果。
| 模型 | C-F1↑ | R-2↑ | 平均WER↓ | 中位数WER↓ |
|---|---|---|---|---|
| **轻量级模型** | | | | |
| Qwen2.5-Omni-3B[9 (https://arxiv.org/html/2607.17230#bib.bib7)] | 0.260 | 0.092 | 39.1 | 43.3 |
| MOSS-Audio-4B-Instruct[10 (https://arxiv.org/html/2607.17230#bib.bib8)] | 0.314 | 0.140 | 10.0 | 2.3 |
| Voxtral-Mini-3B-2507[6 (https://arxiv.org/html/2607.17230#bib.bib1)] | 0.354 | 0.121 | 2.5 | 1.3 |
| **重量级模型** | | | | |
| Qwen2.5-Omni-7B[9 (https://arxiv.org/html/2607.17230#bib.bib7)] | 0.264 | 0.107 | 41.3 | 43.6 |
| Voxtral-Small-24B-2507[6 (https://arxiv.org/html/2607.17230#bib.bib1)] | 0.384 | 0.196 | 2.8 | 0.9 |

尽管BeTraC并非ASR挑战,但转录质量是一个有用的诊断指标:一个无法可靠地跟随长时间临床对话的模型,不太可能生成忠实的SOAP记录。Voxtral较低的验证WER和更强的零样本SOAP输出使其成为两个赛道的明确选择。WER分析也解释了其他模型SOAP生成能力弱的原因:Qwen2.5-Omni仅能大致转录音频的前五分钟,而MOSS-Audio-4B-Instruct的中位数WER低但平均WER高,反映了在某些输入上出现幻觉循环的问题。Voxtral的长音频鲁棒性很可能源于其将输入内部切分为30秒片段,这限制了GPU显存使用,并允许重用Whisper的编码器而无需进行上下文扩展训练。

## IV. 系统描述

### IV-A 监督微调

在SFT阶段,基座模型在提供的训练集上使用交叉熵损失进行微调。Voxtral-Mini在语音输入上微调,Voxtral-Small在标准化后的对话转录本上微调,移除了说话者轮次前缀和“\[叹气\]”等非语音事件标记。微调使用LoRA,并冻结基座Voxtral模型的音频编码器和音频投影器,使得两个模型都可以在单个Nvidia H200 GPU(141 GB显存)上训练。训练使用ms-swift工具包[12 (https://arxiv.org/html/2607.17230#bib.bib4)],通过自定义的Voxtral插件实现;超参数列于表II(a) (https://arxiv.org/html/2607.17230#S4.T2.st1)。训练后,LoRA适配器合并入模型。

表 II:训练超参数。
(a) 监督微调。
(b) 强化学习。

### IV-B 强化学习

在SFT之后,我们应用了强化学习,使用开放医学概念F1作为奖励,使用DAPO作为损失类型。DAPO是GRPO家族[8 (https://arxiv.org/html/2607.17230#bib.bib6)]的改进,通过令牌级损失聚合和修改后的裁剪,提高了长生成响应的学习效率和稳定性[11 (https://arxiv.org/html/2607.17230#bib.bib5)]。这非常适合SOAP记录,因为它足够长,否则响应级别的奖励可能会被稀释到许多令牌中。表II(b) (https://arxiv.org/html/2607.17230#S4.T2.st2)列出了RL特有的超参数;其余与SFT相同。

### IV-C 对比性事实与SOAP模型

我们还探索了轻量级模型的一个增强变体,该变体引入了事实表。对于每个训练对话,DeepSeek-V4-Flash生成一个结构化的表格,包含由简短转录片段支持的临床相关事实,每个事实被分配到一个SOAP相关类别。然后,通过将事实表与参考SOAP记录连接起来形成SFT目标,因此事实表作为模型自身发射的中间推理轨迹,而不是一个流程组件。在随后的RL阶段,奖励仅在SOAP摘要部分计算,因此事实表在监督学习期间塑造模型的内部组织,而RL目标则与官方评分目标保持一致。

### IV-D 验证数据上的结果

表III (https://arxiv.org/html/2607.17230#S4.T3)列出了主要微调阶段后的模型性能,比较了语音输入与对应的文本转录本。我们得出三个结论。首先,尽管两个阶段使用相同的训练样本,RL在SFT基础上带来了持续改进。其次,从文本输入学到的摘要能力可以迁移到语音输入,性能仅略有下降,这与之前关于语音大语言模型中跨模态迁移的研究结果一致[7 (https://arxiv.org/html/2607.17230#bib.bib9), 3 (https://arxiv.org/html/2607.17230#bib.bib10)]。第三,语音输入微调相比文本输入微调仅带来微小的额外增益,这表明当训练成本是主要约束时,对于较大的模型可以省略语音输入微调。

表 III:微调后在验证数据上的结果。主要提交以**粗体**表示;对比性轻量级模型以*斜体粗体*表示。
| 模型 | 输入类型 | C-F1 | R-2 | R-3 |
|---|---|---|---|---|
| **Voxtral Mini** | | | | |
| SFT 转录→SOAP | 转录 | 0.507 | 0.342 | 0.229 |
| SFT+RL 转录→SOAP | 转录 | 0.555 | 0.371 | 0.253 |
| SFT 转录→SOAP | 音频 | 0.486 | 0.320 | 0.210 |
| SFT+RL 转录→SOAP | 音频 | 0.544 | 0.359 | 0.242 |
| SFT 音频→SOAP | 音频 | 0.496 | 0.340 | 0.229 |
| SFT+RL 音频→SOAP | 音频 | 0.547 | 0.364 | 0.247 |
| SFT+RL 转录→事实+SOAP | 音频 | 0.540 | 0.362 | 0.247 |
| **Voxtral Small** | | | | |
| SFT 转录→SOAP | 转录 | 0.537 | 0.382 | 0.268 |
| SFT+RL 转录→SOAP | 转录 | 0.576 | 0.409 | 0.289 |
| SFT+RL 转录→SOAP | 音频 | 0.571 | 0.401 | 0.282 |

基于这些结果,我们选择了SFT+RL 音频→SOAP模型作为轻量级赛道的主要提交,选择了SFT+RL 转录→SOAP(应用于音频)的Voxtral Small模型作为重量级赛道的主要提交;轻量级赛道的对比性提交则使用事实与SOAP模型。

## V. 结果与讨论

### V-A 官方测试集结果

表IV (https://arxiv.org/html/2607.17230#S5.T4)总结了官方的自动评估结果,由组织者根据基于金标对话转录本(由Kimi-K2系统生成)生成的参考记录计算得出[5 (https://arxiv.org/html/2607.17230#bib.bib2)]。盲测集结合了SynthDoPaCo测试集划分(EE,600个合成对话)、来自[4 (https://arxiv.org/html/2607.17230#bib.bib3)]的扮演式医患访谈(mock,272个评分的对话)以及为挑战录制的三个真实对话;提交结果按EE上的概念F1排名。

表 IV:官方测试集结果(每个赛道按排名指标C-F1(EE,600个对话)排列的前3名队伍,加上我们的对比性提交和组织者的基线)。Mock有272个评分的对话,Real.仅有3个;R-2和平均笔记长度涵盖所有875个对话。
| C-F1↑ | 队伍 | EE | Mock | Real. | 全部 | R-2↑ | 字数 |
|---|---|---|---|---|---|---|---|
| **轻量级赛道** | | | | | | | |
| | **TalTech (ours)** | **0.543** | **0.505** | **0.534** | **0.531** | **0.351** | **297** |
| | NTT-HI-CS | 0.540 | 0.511 | 0.487 | 0.531 | 0.370 | 290 |
| | TalTech (contrast) | 0.526 | 0.510 | 0.549 | 0.521 | 0.339 | 306 |
| | KUSLP | 0.515 | 0.465 | 0.431 | 0.499 | 0.355 | 297 |
| **重量级赛道** | | | | | | | |
| | **TalTech (ours)** | **0.563** | **0.555** | **0.607** | **0.560** | **0.395** | **295** |
| | KUSLP | 0.544 | 0.530 | 0.516 | 0.540 | 0.387 | 291 |
| | NTT-HI-CS | 0.539 | 0.517 | 0.510 | 0.532 | 0.368 | 294 |
| | 基线 (Qwen2.5-Omni-3B) | 0.245 | 0.254 | 0.244 | 0.248 | 0.080 | 409 |

我们的主要提交在两个赛道都获得了最高的概念F1(重量级0.563,轻量级0.543)。轻量级赛道与NTT-HI-CS的差距很小(0.543 vs. 0.540),且NTT-HI-CS获得了更高的ROUGE-2,这是我们的RL阶段优化概念F1而非n-gram重叠所预期的副作用。两个系统都将基线的概念F1提高了一倍以上,这与我们在表I (https://arxiv.org/html/2607.17230#S3.T1)中的零样本筛选结果一致。

有两个观察结果值得注意。首先,测试集结果几乎完美地从验证集迁移过来。重量级系统在验证音频上的得分为0.571 C-F1 / 0.401 R-2,在EE上的得分为0.563 / 0.401;轻量级系统则为0.547 / 0.364 vs. 0.543 / 0.366;尽管我们使用了验证集进行模型、检查点和奖励的选择,但几乎不存在泛化差距。其次,模型规模并非决定性因素,因为我们的基于Voxtral Mini的轻量级系统(0.543)实际上与重量级赛道的第二好提交(0.544)持平,并且在我们的配方内,从Voxtral Mini到Voxtral Small的增益(+0.02 C-F1)小于RL本身带来的增益(验证集上+0.04–0.05)。

### V-B 跨测试域的鲁棒性

三个测试子集代表了与合成训练分布的不同距离:EE与之匹配,mock包含真实的扮演式录音,而真实子集则是真实的即兴对话。我们的重量级系统从合成音频转向扮演式音频时,性能下降最少,C-F1下降0.008(0.563→0.555),而我们自己的轻量级主要提交则下降0.038。一个可能的促成因素是,该模型是在标准化后的*转录本*上微调的,音频仅在推理阶段通过冻结的Whisper初始化编码器进入,因此微调不会过拟合到合成的TTS训练音频;而音频微调过的轻量级主要提交缺乏这种保护(尽管模型容量是一个混杂因素)。事实与SOAP对比性提交(第IV-C节 (https://arxiv.org/html/2607.17230#S4.SS3))在域迁移下也表现更好:它在域内(EE上0.526 vs. 0.543)落后于轻量级主要提交,但在mock上与之持平(0.510 vs. 0.505),并且在真实子集上得分更高(0.549);其中间的事实提取步骤似乎也同样不那么依赖于合成域。在真实子集上,重量级系统达到了0.607,尽管只有三个对话,这还不足以得出确切结论。

### V-C 大模型作为评判者的评估

表 V:EE上大模型作为评判者的评分(1-5分,越高越好;幻觉/矛盾率为原子声明的比例,越低越好),针对每个赛道的前3名系统及我们的对比性提交。
组织者还使用大模型作为评判者的流程对所有提交进行了评分[5 (https://arxiv.org/html/2607.17230#bib.bib2)]:每条记录被分解为原子声明,由Gemma 4 31B评判者对照金标转录本(而非Kimi-K2参考记录)进行验证,这使得该评估部分独立于自动指标;表V (https://arxiv.org/html/2607.17230#S5.T5)显示了排名子集上的结果。

我们的重量级系统在所有评分的提交中获得了最低的幻觉率(EE上为0.08%),在其赛道中获得了最佳的覆盖率和简洁性,并且忠实度与最佳系统相差无几(4.80 vs. 4.81);我们的轻量级主要提交在其赛道中获得了最高的忠实度(4.71)和覆盖率(4.49)。

这解决了我们配方的主要风险。直接使用RL优化概念F1可能会诱使模型采取一种退化策略,即枚举所有可能的医学概念以提升召回率,从而产生冗长、混乱的记录。评判分数表明这种情况没有发生。我们的记录保持平均长度(295-297字),概念精确度*高于*召回率(重量级:0.59 vs. 0.54),并且幻觉率保持较低;F1奖励中的精确度项足以防止概念填充。

最后,由于排名指标针对LLM生成的参考资料进行关键词和实体的匹配,人们可能会问,它衡量的是记录质量还是仅仅是表面重叠。在21个被评判的提交中,系统级别的EE概念F1与评判者的忠实度(Spearman ρ=0.91)强相关,并与幻觉率呈负相关(ρ=-0.93),这支持了该指标的选择,尽管这两个信号最终都来自大语言模型,且每条记录的一致性可能较弱。

## VI. 结论

我们介绍了TalTech在BeTraC两个赛道中的获胜系统:通过对Voxtral模型进行LoRA SFT和针对挑战指标的DAPO RL适配,实现直接的音频到SOAP生成。零样本筛选中对长音频鲁棒性的评估是一个有效的模型选择标准;RL在SFT基础上将概念F1提高了0.04-0.05,且未增加记录长度或幻觉;基于转录本的微调可以迁移到语音输入,并且似乎在域迁移下有所帮助;模型规模是次要的。未来的工作包括验证。

相似文章

长期历史感知的医疗对话合成与评估

arXiv cs.CL

本文介绍了一种利用大语言模型(LLMs)合成长期医疗对话数据集的框架,并创建了 MediLongChat,包含三个基准任务,用于评估医疗智能体的记忆与推理能力。实验表明,即使是最先进的 LLMs 也难以完成这些任务。

VoxMind:端到端智能体语音对话系统

Hugging Face Daily Papers

VoxMind 推出具备智能体能力的端到端语音对话系统,通过“先思后言”机制与动态工具管理,将任务完成率从 34.88% 提升到 74.57%,同时保持对话质量。

使用基于评分指导的反事实推荐改善医疗沟通

arXiv cs.CL

本文提出了一种基于语言模型指导的反事实推荐流程,用于改善基于文本的远程医疗中医患沟通。该流程识别出语气和可操作性等可解释特征,并建议在不改变医疗内容的前提下,通过最小化变更来增加患者积极反馈,平均预测积极反馈提升6.41%。