层次化声学-语义建模:全双工SLM的模态分离与语义一致性
摘要
本文介绍了Lychee-FD,一种原生端到端全双工口语语言模型,通过层次化参数分离策略缓解模态干扰,在语音智能和交互流畅性方面取得了显著提升。
arXiv:2607.06540v1 Announce Type: new
摘要:开发无缝、高性能、原生智能的全双工口语语言模型(SLM)仍然是语音和自然语言处理领域的一个关键挑战和长期目标。尽管取得了显著进展,但近期的尝试从根本上受到严重模态干扰的限制,这导致大量知识退化并损害语义完整性——最终使全双工SLM显得不自然且不智能。在本文中,通过对模型优化动态的详尽细粒度分析,我们揭示了这种性能下降的根本原因,发现模态干扰源于声学建模和语义建模在被迫共享深层参数空间时产生的固有梯度冲突。基于这一关键见解,我们提出了Lychee-FD,一种旨在缓解模态干扰的原生端到端全双工框架。重要的是,我们提出了一种层次化参数分离策略,在深层解耦冲突模态,同时通过专用的语义对齐通道保持跨模态一致性。在多个全双工基准上的大量实验表明,我们的方法显著推进了现有技术水平,在语音智能(Spoken QA +7.4%)和全双工交互流畅性(FullDuplexBench 1.5 +28.5%)方面均取得了实质性提升,且不影响推理效率。据我们所知,这项工作是首次实现两个关键进展:1) 揭示并阐明全双工SLM中模态干扰的根本原因,2) 设计一个优雅的层次化模型以及一种实用解决方案,用于实现无缝、高性能的原生智能全双工SLM。
查看缓存全文
缓存时间: 2026/07/08 04:43
# 模态分离与语义一致性用于全双工 SLMs 来源:https://arxiv.org/html/2607.06540 ## 分层声学-语义建模:用于全双工 SLMs 的模态分离与语义一致性 刘振宇 1,2, 李云新 1,2, 张轩宇 1,2, 滕启勋 1, 江圣远 1, 陈浩然, 赵敏君, 孟凡博, 徐宇, 何彦成, 胡宝田 1,2, ✉, 李海洲 2,3, 张民 1,2 1 哈尔滨工业大学(深圳)计算机科学与技术学院 2 深圳环路区域研究所语言、智能与机器中心 3 香港中文大学(深圳)人工智能学院 [https://huggingface.co/HIT-TMG/Lychee-FD](https://huggingface.co/HIT-TMG/Lychee-FD-1.5) [https://github.com/HITsz-TMG/Lychee-FD](https://github.com/HITsz-TMG/Lychee-FD) [https://hitsz-tmg.github.io/Lychee-FD](https://hitsz-tmg.github.io/Lychee-FD) 通讯作者:[email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]) [email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]), [email protected] (https://arxiv.org/html/2607.06540v1/mailto:[email protected]) ###### 摘要 开发无缝、高性能、原生的智能全双工口语语言模型(SLMs)仍然是语音和自然语言处理领域的一个关键挑战和长期目标。尽管取得了显著进展,但最近的努力从根本上受到了严重的**模态干扰**的制约,这导致了大量的知识退化,破坏了语义完整性——最终使全双工 SLMs 显得不自然且不智能。在本文中,通过对模型优化动态的详尽细粒度分析,我们揭示了这种性能退化的根本原因,发现模态干扰源于当两个模态被迫共享深层参数空间时,声学建模和语义建模之间固有的**梯度冲突**。受这一关键洞察的启发,我们引入了 **Lychee-FD**,一个旨在减轻模态干扰的原生端到端全双工框架。重要的是,我们提出了一种分层参数分离策略,该策略在深层解耦冲突的模态,同时通过一个专用的语义对齐通道保持跨模态一致性。在多个全双工基准上的大量实验表明,我们的方法显著推进了现有技术水平,在口语问答任务上带来了大幅提升(Spoken QA 上 +7.4%),在全双工交互流畅性上也取得了显著进步(FullDuplexBench 1.5 上 +28.5%),且不影响推理效率。据我们所知,本工作是首次实现两个关键进展:1)揭示并阐明了全双工 SLMs 中模态干扰的根本原因;2)设计了一个优雅的分层模型以及一个实用的解决方案,用于实现无缝、高性能、原生的智能全双工 SLMs。 ## 1 引言 大型语言模型(LLMs)的快速发展从根本上重塑了我们的日常生活,使它们成为能够进行复杂推理和遵循指令的通用助手。在这一背景下,口语语言模型(SLMs)代表了从基于文本到基于语音交互的重要范式转变。尽管在能够实现无缝语音交互的全模态模型方面取得了最新进展(openai2024gpt4ocard; DBLP:conf/acl/ZhanDYZZLZYZL0F24; li2025uni; DBLP:journals/corr/abs-2001-08361; 10.5555/3600270.3602446; DBLP:journals/pami/XuZC23; DBLP:journals/corr/abs-2501-16327),但人工代理与真实人类对话之间仍然存在一个关键差距。目前,大多数语音交互被限制在僵化的半双工模式下,系统严格地按顺序交替进行听和说。相比之下,真实的人类对话本质上是全双工的,需要能够同时处理传入的音频流并生成响应(73837945-26a5-3e38-a7b9-daf138681621; DBLP:journals/corr/abs-2501-01957; DBLP:journals/corr/abs-2411-13577)。半双工系统强制轮流发言破坏了交互的流畅性,在用户和代理之间制造了人为障碍。 请参阅说明文字 图 1:效率与智能权衡的可视化。现有范式在将半双工 SLM(黑星)扩展到全双工时面临困境。原生端到端模型(蓝钻)牺牲准确性换取效率,而 Thinker-Talker 模型(红钻)保留知识但推理成本过高。相比之下,我们提出的分层框架(绿钻)兼具低延迟和高准确性,显著优于所有全双工 SLM 基线。 为了弥合这一差距,开发原生全双工 SLMs(FDSLMs)已成为语音和自然语言处理社区的关键挑战和长期目标(73837945-26a5-3e38-a7b9-daf138681621; DBLP:journals/tmlr/AroraCCPWADLLW25; DBLP:journals/tacl/NguyenKCAHETASM23; DBLP:conf/kdd/LinWHSSL22)。这种全双工范式需要复杂的语用推理,使代理能够处理自发中断、注入自然的反馈语,并在没有显式系统级触发的情况下动态管理轮次(DBLP:conf/interspeech/HuHCCGZCLBG25; DBLP:conf/chi/LiuSXHYZ025)。因此,实现无缝的全双工通信被广泛认为是人机交互的下一个关键里程碑,有望开启真正自然、流畅且沉浸式的对话体验(DBLP:journals/corr/abs-2502-09940; DBLP:journals/corr/abs-2501-01957; DBLP:journals/corr/abs-2503-04721)。 尽管 FDSLM 开发取得了进展(DBLP:journals/corr/abs-2408-05211; DBLP:conf/iclr/ZengDLZJD025),但当前方法仍然遭受严重的**模态干扰**。如图 1 (https://arxiv.org/html/2607.06540#S1.F1) 所示,将半双工基础模型(黑星)适配为原生端到端架构(蓝钻)会导致显著的知识退化。这种退化进一步被 Moshi(DBLP:journals/corr/abs-2410-00037)等最先进模型所证实,该模型报告了在全双工对齐后语音智能的显著下降(LlamaQ 上 -12.7%)。历史上,这种干扰一直是深度学习中的一个臭名昭著且持久存在的优化瓶颈(DBLP:journals/corr/Ruder17a; Caruana1997; NEURIPS2020_3fe78a8a; NEURIPS2018_432aca3a)。虽然一些方法(DBLP:conf/icml/WangLFZS000M25; chen2025funaudiochattechnicalreport)试图通过采用 Thinker-Talker 架构(红钻)来规避这种干扰,但它们需要复杂的多阶段训练并引入显著的延迟。这些局限性表明现有范式要么在知识保留方面失败,要么在推理效率方面不足。因此,本工作的核心研究问题是:**我们如何解决这种模态干扰,从而在全双工 SLMs 中同时实现高推理效率和稳健的知识保留?** 为了揭示模态干扰的根本原因,我们进行了详尽的细粒度**模型优化动态分析**(如图 2 (https://arxiv.org/html/2607.06540#S2.F2) 所示)。通过量化语义目标和声学目标梯度向量之间的几何关系,我们证明了根本上导致这种干扰的**固有梯度冲突**。首先,通过计算逐层梯度余弦相似度,我们揭示了梯度方向上的严重**优化分歧**。文本和语音目标的梯度方向在浅层是协同的,但在更深层变得越来越正交甚至相反。这从实证角度证明,强制声学和语义建模在共享参数空间内更新不可避免地会破坏优化轨迹。其次,通过评估梯度幅度比率,我们识别出严重的**语义稀释**。稀疏文本 token(例如,3Hz)与密集音频帧(例如,25Hz)通过填充 token 的时间对齐持续抑制所有层中语义梯度的幅度。因此,优化图景被声学建模压倒性地主导,有效地抑制了语义建模。 受这些洞察的启发,我们引入了 **Lychee-FD**,一个原生端到端全双工框架,旨在通过两个架构创新来减轻模态干扰。首先,我们提出了一种**分层参数分离**策略,用于解决深层中的优化分歧。具体来说,我们将深层分离为独立的声学头和语义头。通过并行执行这些头,我们保持了原始模型深度,从而保留了推理效率。其次,为了对抗语义稀释,我们引入了一个**语义对齐通道**来生成连贯的内心独白。通过利用连续的文本监督作为语义锚点,我们在训练期间保持了语义建模的稳健性。大量实验表明,Lychee-FD 实现了最先进的性能,具体在 Spoken QA 任务上平均提升了 7.4%,在 FullDuplexBench 1.5 上提升了 28.5%。最终,我们的方法有效减轻了模态干扰,同时实现了高推理效率和稳健的知识保留。 我们的贡献总结如下: - • **首次揭示了全双工 SLMs 中模态干扰的根本原因**。在详尽的模型优化动态细粒度分析的支持下,我们揭示了这些障碍源于当声学和语义建模被迫进入共享深层参数空间时它们之间的**固有梯度冲突**。 - • **我们提出了 Lychee-FD,第一个完全原生的智能全双工框架**。我们提出了一种分层参数分离策略来解耦声学和语义建模,通过一个优雅设计的语义对齐通道来连接,以保持连贯的内心独白和稳健的语义。 - • **我们在多个全双工基准上推进了最先进水平**。为了推动社区的全双工研究向前发展,我们在 https://github.com/HITsz-TMG/Lychee-FD 开源了我们的框架、训练流程和模型权重。 ## 2 相关工作 ### 2.1 口语语言模型 SLMs 已经从级联的 ASR-LLM-TTS 流程(DBLP:conf/emnlp/ZhangLZZWZQ23; DBLP:journals/corr/abs-2407-04051; DBLP:journals/taslp/BorsosMVKPSRTGTZ23; 10842513; DBLP:journals/taslp/ZeghidourLOST22)发展为统一架构。当前方法主要分为两种范式: #### Thinker-Talker 架构。 这种范式将声学生成与 LLM 骨干解耦以减轻模态干扰(DBLP:journals/corr/abs-2503-20215; DBLP:conf/icml/WangLFZS000M25; DBLP:conf/iclr/FangGZMZ025)。例如,DBLP:journals/corr/abs-2503-20215 采用了双轨自回归架构。尽管这些系统稳定性好,但它们通常需要复杂的多阶段训练课程,并且由于独立的生成模块而遭受推理瓶颈。 #### 原生端到端架构。 相反,这些架构将语音和文本嵌入到共享语义空间中,实现直接的语音到语音推理(li2025perception; DBLP:journals/corr/abs-2408-16725; DBLP:conf/emnlp/MitsuiMWHS24; DBLP:conf/iclr/ZengDLZJD025)。例如,DBLP:journals/corr/abs-2507-16632 引入了潜在音频编码来捕获副语言线索。至关重要的是,虽然现有的 SLMs 仍然从根本上受制于僵化的半双工轮替机制,但我们的工作通过建立一个原生全双工框架来推进该领域。通过实现同时听和说,我们旨在为未来的人机交互解锁真正自然、流畅且沉浸式的范式。 ### 2.2 全双工语音交互 为了实现无轮次且流畅的对话,最近的研究探索了超越僵化轮替的全双工范式。这些努力大致可分为三种范式: #### 全双工对话系统。 早期努力主要利用语音活动检测(VAD)作为对话管理器来控制半双工 SLMs 的说话过程(DBLP:journals/corr/abs-2509-06502; DBLP:journals/corr/abs-2502-13472; DBLP:journals/corr/abs-2509-23938; DBLP:journals/corr/abs-2502-14145)。尽管取得了一些进展,但这些级联系统具有高延迟和错误传播的缺点,促使人们转向统一建模。 #### 时分复用(TDM)。 为了解决这些限制,最近的工作使用 SLM 本身作为对话管理器。TDM 方法将听和说的 token 展平为单个时间序列。然而,这导致计算复杂度增加并限制了长上下文交互(DBLP:conf/acl/ZhangCDCWZLYTDZ25; DBLP:conf/emnlp/VeluriPYGG24; DBLP:conf/emnlp/ZhangCH0XXZ0024; DBLP:journals/corr/abs-2505-17060)。 #### 信道划分复用(CDM)。 与展平不同,CDM 方法显式建模并发输入和输出流,提供了最集成形式的交互(coreteam2025mimoaudioaudiolanguagemodels; DBLP:journals/tacl/NguyenKCAHETASM23; DBLP:journals/corr/abs-2410-11190)。例如,DBLP:journals/corr/abs-2410-00037 和 chen2025funaudiochattechnicalreport 集成了时间对齐的文本和音频流,为语音生成提供显式语义指导。然而,这些完全共享的架构将不同的模态纠缠在单个参数空间中,使它们极易遭受严重的知识退化。 与之前受模态干扰困扰的工作不同,Lychee-FD 为 FDSLMs 中的核心问题提供了第一个基本解决方案。通过解决声学和语义建模之间的固有深层梯度冲突,我们的原生端到端框架成功实现了超低延迟与稳健的知识保留,有力地推动了语音和自然语言处理社区的研究前沿。 请参阅说明文字 (a) 梯度余弦相似度 请参阅说明文字 (b) 梯度幅度比率 图 2:优化动态可视化。(a) 梯度余弦相似度:在深层转换为负值揭示了语义和声学建模之间冲突的优化方向,推动了我们的分层参数分离。(b) 梯度幅度比率:“对齐”(红色)与“密集”(蓝色)相比持续较低的比率表明稀疏对齐稀释了语义监督,推动了我们的语义对齐通道。 ## 3 分层声学-语义建模 ### 3.1 模态干扰的模型优化动态分析 为了实证研究模态干扰的根本原因并理解 FDSLMs 中的学习过程,我们进行了深入的模型优化动态分析,如图 2 (https://arxiv.org/html/2607.06540#S2.F2) 所示。我们使用原生 CDM 架构初始化。
相似文章
BayLing-Duplex: 单一自回归大语言模型实现原生全双工语音对话
BayLing-Duplex是一种原生全双工语音语言模型,使单一自回归大语言模型无需外部VAD模块即可管理轮流发言与打断,实现了高成功率,并相比先前模型提升了回复质量。
释放全双工语音模型中LLM的能力
提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。
从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。
LoMo: 局部模态替换以实现更深层的视觉-语言融合
LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。