StepAudio 2.5 技术报告
摘要
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - StepAudio 2.5 技术报告
来源:https://huggingface.co/papers/2605.23463 发布于 5月22日
·
提交者 https://huggingface.co/giantPanda0906
Yang (https://huggingface.co/giantPanda0906) 于 5月25日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
StepAudio 2.5 是一种统一的音频-语言模型,通过使用针对特定任务的人类反馈强化学习来优化不同操作模式下的共享表征,从而在自动语音识别(ASR)、文本转语音合成(TTS)和实时口语交互方面达到专用系统的水平。
统一音频-语言建模(https://huggingface.co/papers?q=Unified%20audio-language%20modeling)已成为现代语音系统的重要趋势,有望将大型语言模型的推理能力引入听觉任务。然而,现有的统一基础模型在自动语音识别(https://huggingface.co/papers?q=automatic%20speech%20recognition)(ASR)、文本转语音合成(https://huggingface.co/papers?q=text-to-speech%20synthesis)(TTS)和实时口语交互方面,往往难以匹配专用系统的深度。弥合这一差距仍是一个开放挑战。本报告介绍了 StepAudio 2.5,一个统一的音频-语言基础模型,其在所有三种能力上均达到或超过了专用系统。我们并未将这些任务视为架构上相互独立,而是基于一个前提:一旦文本和音频共享一个多模态表征空间(https://huggingface.co/papers?q=multimodal%20representational%20space),任务特化就成为操作模式的问题:数据构建、优化目标和解码约束。在这一洞察指导下,我们将后训练范式(https://huggingface.co/papers?q=post-training%20paradigm)从标准监督学习推进到针对特定任务的人类反馈强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning%20from%20Human%20Feedback)(RLHF(https://huggingface.co/papers?q=RLHF)),并将其作为定义复杂优化目标的主要机制。我们利用这种以 RLHF(https://huggingface.co/papers?q=RLHF)为中心的对齐方法,结合专门的解码策略,将一个共享主干模型塑造为三种不同的操作模式。具体而言,ASR分支通过可验证的多token解码(https://huggingface.co/papers?q=verifiable%20multi-token%20decoding)提升了转录效率;TTS分支通过基于偏好的 RLHF(https://huggingface.co/papers?q=preference-based%20RLHF)和丰富上下文的监督,实现了可控、富有表现力的合成;实时分支则在 RLHF(https://huggingface.co/papers?q=RLHF)框架内通过生成式奖励建模(https://huggingface.co/papers?q=generative%20reward%20modeling)实现了低延迟、个性一致的对话。在标准基准测试中,StepAudio 2.5 在 ASR、TTS 和实时交互方面均取得了最先进的结果,证明一个单一的音频-语言基础模型能够成功内化语音理解、生成和实时交互的不同部署目标。
查看 arXiv 页面 (https://arxiv.org/abs/2605.23463) 查看 PDF (https://arxiv.org/pdf/2605.23463) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23463)
在你的代理中获取这篇论文:
hf papers read 2605.23463
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
包含此论文的合集0
没有合集包含此论文
将这篇论文添加到一个合集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
Fish Audio S2 技术报告
Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。
dots.tts 技术报告
dots.tts 提出了一个拥有 2B 参数的连续自回归文本转语音 (TTS) 模型,基于多语言数据进行训练,在 Seed-TTS-Eval 等基准测试上取得了最先进的性能,并通过 CFG-aware MeanFlow 蒸馏实现了低延迟流式生成。该模型、代码和检查点均以 Apache 2.0 许可证发布。
SwanTale:面向指令和零样本任务的统一多说话人语音与音频生成
本文介绍了SwanTale,一个支持零样本和指令任务的统一多说话人语音与音频生成模型,以及用于数据标注的SwanData-Caption和用于高质量多音频模态生成的SwanVAE。
面向数据高效的代码切换ASR的强化学习
介绍了一种具有可验证奖励的强化学习方案,用于将音频语言模型数据高效地适应到代码切换ASR,在10个语言对上以最少数据实现了显著提升。
StepFun 3.7 Flash
StepFun 发布了 Step 3.7 Flash,这是一个高效的多模态模型,针对真实世界的智能体任务进行了优化,具有改进的编码基准(SWE-Bench Pro、Terminal-Bench)并兼容多种智能体框架。