交错式语音语言模型在文本空间中隐式工作

Hugging Face Daily Papers 论文

摘要

本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。

语音语言模型(SLM)已被广泛研究,常见范式是结合文本数据和预训练文本语言模型。一种领先的方法是语音-文本交错,即模型在包含语音和文本令牌的序列上进行训练,旨在提升甚至仅语音任务的能力。然而,这两种模态在模型潜在空间中如何交互仍不清楚。在这项工作中,我们通过logit lens的视角,分析了来自不同模型家族和规模的交错语音-文本语言模型,以提供相关洞见。我们发现,这些模型经历了一个隐式转录阶段,在此阶段,尽管未针对语音识别进行训练,但所说话词的文本令牌在中间层变得可解码。该词的转录出现在候选词前列的比例高达77%的数据中。在此阶段之后,模型在文本空间中进行下一个词的预测,然后再转换回语音域。最终,我们分析了交错数据和从文本语言模型初始化在引发该行为中的作用,并考察了这与口语知识能力的相关性。我们的分析揭示了语音和文本模态之间关系的内部机制,可能有助于SLM的优化。
查看原文
查看缓存全文

缓存时间: 2026/06/30 07:35

论文页面 - 交错语音语言模型在文本中隐式工作

来源:https://huggingface.co/papers/2606.22473

摘要

交错语音-文本语言模型表现出一个隐含的转录阶段:文本令牌在中间层变得可解码,随后在语音域转换之前进行基于文本的预测。

语音语言模型(https://huggingface.co/papers?q=Speech%20language%20models)(SLMs)已被广泛研究,常见范式是整合文本数据和预训练的文本语言模型。一种领先的方法是语音-文本交错(https://huggingface.co/papers?q=speech-text%20interleaving),模型在包含语音和文本令牌(https://huggingface.co/papers?q=text%20token)的序列上进行训练,旨在提升甚至纯语音的能力。然而,这两种模态在模型潜在空间中如何交互仍不清楚。在这项工作中,我们通过logit透镜(https://huggingface.co/papers?q=logit%20lens)的视角分析了来自不同模型家族和尺寸的交错语音-文本语言模型,以提供相关洞察。我们揭示这些模型经历了一个隐含的转录阶段:虽然未经过语音识别(https://huggingface.co/papers?q=speech%20recognition)训练,但口语词汇的文本令牌(https://huggingface.co/papers?q=text%20token)在中间层(https://huggingface.co/papers?q=intermediate%20layers)变得可解码。该词的转录出现在候选词前几位的情况高达77%的数据。在此阶段之后,模型在文本空间中预测下一个词,然后转换回语音域。最后,我们分析了交错数据和从文本语言模型初始化在引发这种行为中的作用,以及这与口语知识能力(https://huggingface.co/papers?q=spoken%20knowledge%20abilities)的关联。我们的分析揭示了语音与文本模态之间关系的内部机制,可能有助于优化SLM。

查看arXiv页面(https://arxiv.org/abs/2606.22473) 查看PDF(https://arxiv.org/pdf/2606.22473) 项目页面(https://pages.cs.huji.ac.il/adiyoss-lab/slm_work_in_text/) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22473)

在您的代理中获取此论文:

hf papers read 2606.22473

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有模型链接此论文

请在模型README.md中引用 arxiv.org/abs/2606.22473 以从此页面链接。

引用此论文的数据集 1

slprl/common-sense-facts-audio 查看器 • 更新于5天前 • 281 • 80 • 2 (https://huggingface.co/datasets/slprl/common-sense-facts-audio)

引用此论文的Space 0

没有Space链接此论文

请在Space README.md中引用 arxiv.org/abs/2606.22473 以从此页面链接。

包含此论文的集合 0

没有集合包含此论文

将此论文添加到集合(https://huggingface.co/new-collection)中以从此页面链接。

相似文章

TextLDM:利用连续潜在扩散进行语言建模

Hugging Face Daily Papers

本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。

Latent-IM:用于语音LLM的潜在交互管理

arXiv cs.CL

介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。

语言切换触发器在语言模型中的潜在绕行路径

Hugging Face Daily Papers

本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。