StepAudio 2.5 技术报告

Hugging Face Daily Papers 论文

摘要

StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。

统一的音频-语言建模已成为现代语音系统中的一个突出趋势,有望将大型语言模型的推理能力应用于听觉任务。然而,现有的统一基础模型在自动语音识别(ASR)、文本转语音合成(TTS)和实时口语交互方面,往往难以与专门系统的深度相匹配。弥合这一差距仍然是一个开放的挑战。本报告介绍了 StepAudio 2.5,这是一个统一的音频-语言基础模型,在以上三种能力上均达到或超越了专门系统。我们没有将这些任务视为架构上独立,而是基于这样一个前提:一旦文本和音频共享一个多模态表示空间,任务专业化就变成了操作机制的问题:数据构建、优化目标和解码约束。在此洞察的指导下,我们将后训练范式从标准的监督学习推进到针对任务定制的基于人类反馈的强化学习(RLHF),并将其作为定义复杂优化目标的主要机制。我们利用这种以 RLHF 为中心的对齐,结合专门的解码,将共享骨干网络塑造成三种不同的操作模式。具体来说,ASR 分支通过可验证的多令牌解码提高了转录效率;TTS 分支基于偏好的 RLHF 和上下文丰富的监督实现了可控且富有表现力的合成;而实时分支则通过 RLHF 框架内的生成式奖励建模实现了低延迟、角色一致的对话。在标准基准上,StepAudio 2.5 在 ASR、TTS 和实时方面取得了最先进的结果,证明单一音频-语言基础模型能够成功内化语音理解、生成和现场交互的不同部署目标。
查看原文
查看缓存全文

缓存时间: 2026/05/25 06:36

论文页面 - StepAudio 2.5 技术报告

来源:https://huggingface.co/papers/2605.23463 发布于 5月22日

·

提交者 https://huggingface.co/giantPanda0906

Yang (https://huggingface.co/giantPanda0906) 于 5月25日

作者:

摘要

StepAudio 2.5 是一种统一的音频-语言模型,通过使用针对特定任务的人类反馈强化学习来优化不同操作模式下的共享表征,从而在自动语音识别(ASR)、文本转语音合成(TTS)和实时口语交互方面达到专用系统的水平。

统一音频-语言建模(https://huggingface.co/papers?q=Unified%20audio-language%20modeling)已成为现代语音系统的重要趋势,有望将大型语言模型的推理能力引入听觉任务。然而,现有的统一基础模型在自动语音识别(https://huggingface.co/papers?q=automatic%20speech%20recognition)(ASR)、文本转语音合成(https://huggingface.co/papers?q=text-to-speech%20synthesis)(TTS)和实时口语交互方面,往往难以匹配专用系统的深度。弥合这一差距仍是一个开放挑战。本报告介绍了 StepAudio 2.5,一个统一的音频-语言基础模型,其在所有三种能力上均达到或超过了专用系统。我们并未将这些任务视为架构上相互独立,而是基于一个前提:一旦文本和音频共享一个多模态表征空间(https://huggingface.co/papers?q=multimodal%20representational%20space),任务特化就成为操作模式的问题:数据构建、优化目标和解码约束。在这一洞察指导下,我们将后训练范式(https://huggingface.co/papers?q=post-training%20paradigm)从标准监督学习推进到针对特定任务的人类反馈强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning%20from%20Human%20Feedback)(RLHF(https://huggingface.co/papers?q=RLHF)),并将其作为定义复杂优化目标的主要机制。我们利用这种以 RLHF(https://huggingface.co/papers?q=RLHF)为中心的对齐方法,结合专门的解码策略,将一个共享主干模型塑造为三种不同的操作模式。具体而言,ASR分支通过可验证的多token解码(https://huggingface.co/papers?q=verifiable%20multi-token%20decoding)提升了转录效率;TTS分支通过基于偏好的 RLHF(https://huggingface.co/papers?q=preference-based%20RLHF)和丰富上下文的监督,实现了可控、富有表现力的合成;实时分支则在 RLHF(https://huggingface.co/papers?q=RLHF)框架内通过生成式奖励建模(https://huggingface.co/papers?q=generative%20reward%20modeling)实现了低延迟、个性一致的对话。在标准基准测试中,StepAudio 2.5 在 ASR、TTS 和实时交互方面均取得了最先进的结果,证明一个单一的音频-语言基础模型能够成功内化语音理解、生成和实时交互的不同部署目标。

查看 arXiv 页面 (https://arxiv.org/abs/2605.23463) 查看 PDF (https://arxiv.org/pdf/2605.23463) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23463)

在你的代理中获取这篇论文:

hf papers read 2605.23463

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。

引用此论文的数据集0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。

引用此论文的 Spaces0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。

包含此论文的合集0

没有合集包含此论文

将这篇论文添加到一个合集 (https://huggingface.co/new-collection) 中以在此页面建立链接。

相似文章

Fish Audio S2 技术报告

Papers with Code Trending

Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。

dots.tts 技术报告

Hugging Face Daily Papers

dots.tts 提出了一个拥有 2B 参数的连续自回归文本转语音 (TTS) 模型,基于多语言数据进行训练,在 Seed-TTS-Eval 等基准测试上取得了最先进的性能,并通过 CFG-aware MeanFlow 蒸馏实现了低延迟流式生成。该模型、代码和检查点均以 Apache 2.0 许可证发布。

StepFun 3.7 Flash

Reddit r/LocalLLaMA

StepFun 发布了 Step 3.7 Flash,这是一个高效的多模态模型,针对真实世界的智能体任务进行了优化,具有改进的编码基准(SWE-Bench Pro、Terminal-Bench)并兼容多种智能体框架。