交错式语音语言模型在文本空间中隐式工作
摘要
本文揭示了交错式语音-文本语言模型在中间层隐式地将语音转录为文本,然后在文本空间中进行预测,再转换回语音,揭示了内部模态交互机制。
查看缓存全文
缓存时间: 2026/06/30 07:35
论文页面 - 交错语音语言模型在文本中隐式工作
来源:https://huggingface.co/papers/2606.22473
摘要
交错语音-文本语言模型表现出一个隐含的转录阶段:文本令牌在中间层变得可解码,随后在语音域转换之前进行基于文本的预测。
语音语言模型(https://huggingface.co/papers?q=Speech%20language%20models)(SLMs)已被广泛研究,常见范式是整合文本数据和预训练的文本语言模型。一种领先的方法是语音-文本交错(https://huggingface.co/papers?q=speech-text%20interleaving),模型在包含语音和文本令牌(https://huggingface.co/papers?q=text%20token)的序列上进行训练,旨在提升甚至纯语音的能力。然而,这两种模态在模型潜在空间中如何交互仍不清楚。在这项工作中,我们通过logit透镜(https://huggingface.co/papers?q=logit%20lens)的视角分析了来自不同模型家族和尺寸的交错语音-文本语言模型,以提供相关洞察。我们揭示这些模型经历了一个隐含的转录阶段:虽然未经过语音识别(https://huggingface.co/papers?q=speech%20recognition)训练,但口语词汇的文本令牌(https://huggingface.co/papers?q=text%20token)在中间层(https://huggingface.co/papers?q=intermediate%20layers)变得可解码。该词的转录出现在候选词前几位的情况高达77%的数据。在此阶段之后,模型在文本空间中预测下一个词,然后转换回语音域。最后,我们分析了交错数据和从文本语言模型初始化在引发这种行为中的作用,以及这与口语知识能力(https://huggingface.co/papers?q=spoken%20knowledge%20abilities)的关联。我们的分析揭示了语音与文本模态之间关系的内部机制,可能有助于优化SLM。
查看arXiv页面(https://arxiv.org/abs/2606.22473) 查看PDF(https://arxiv.org/pdf/2606.22473) 项目页面(https://pages.cs.huji.ac.il/adiyoss-lab/slm_work_in_text/) 添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.22473)
在您的代理中获取此论文:
hf papers read 2606.22473
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有模型链接此论文
请在模型README.md中引用 arxiv.org/abs/2606.22473 以从此页面链接。
引用此论文的数据集 1
slprl/common-sense-facts-audio 查看器 • 更新于5天前 • 281 • 80 • 2 (https://huggingface.co/datasets/slprl/common-sense-facts-audio)
引用此论文的Space 0
没有Space链接此论文
请在Space README.md中引用 arxiv.org/abs/2606.22473 以从此页面链接。
包含此论文的集合 0
没有集合包含此论文
将此论文添加到集合(https://huggingface.co/new-collection)中以从此页面链接。
相似文章
重新思考语音-LLM集成用于ASR:通过交错实现有效的联合语音-文本训练
本文提出联合语音-文本交错预训练(JSTIP),这是一种预训练策略,通过构建词级和段级交错的语音-文本序列来提高ASR实体准确率并缩小语音与文本之间的模态差距,在领域自适应和零样本语音问答上展示了有竞争力的性能。
从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型
提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。
TextLDM:利用连续潜在扩散进行语言建模
本文介绍了 TextLDM,这是一种通过将离散标记映射到连续潜在空间,从而将视觉潜在扩散Transformer适配于语言建模的方法。研究表明,该方法在表示对齐的增强下,达到了与 GPT-2 相当的性能,并统一了视觉与文本生成的架构。
Latent-IM:用于语音LLM的潜在交互管理
介绍了Latent-IM,一个从冻结的语音LLM中恢复交互管理的框架,利用基于激活的选择和引导来进行会话动作。相比未引导的主干模型,它将端到端动作准确率提升了12.5个百分点。
语言切换触发器在语言模型中的潜在绕行路径
本文识别了在80亿参数语言模型中语言切换后门的底层电路,其中三个词的拉丁触发器通过注意力头和正交潜在子空间将英语输出重定向为法语,最后一层的MLP将潜在信号转换为法语logits。