StepAudio 2.5 技术报告
摘要
StepAudio 2.5 是一个统一的音频-语言模型,通过利用针对任务定制的基于人类反馈的强化学习来优化共享表示,在自动语音识别(ASR)、文本转语音(TTS)和实时口语交互方面取得了最先进的结果。
查看缓存全文
缓存时间: 2026/05/25 06:36
论文页面 - StepAudio 2.5 技术报告
来源:https://huggingface.co/papers/2605.23463 发布于 5月22日
·
提交者 https://huggingface.co/giantPanda0906
Yang (https://huggingface.co/giantPanda0906) 于 5月25日
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
StepAudio 2.5 是一种统一的音频-语言模型,通过使用针对特定任务的人类反馈强化学习来优化不同操作模式下的共享表征,从而在自动语音识别(ASR)、文本转语音合成(TTS)和实时口语交互方面达到专用系统的水平。
统一音频-语言建模(https://huggingface.co/papers?q=Unified%20audio-language%20modeling)已成为现代语音系统的重要趋势,有望将大型语言模型的推理能力引入听觉任务。然而,现有的统一基础模型在自动语音识别(https://huggingface.co/papers?q=automatic%20speech%20recognition)(ASR)、文本转语音合成(https://huggingface.co/papers?q=text-to-speech%20synthesis)(TTS)和实时口语交互方面,往往难以匹配专用系统的深度。弥合这一差距仍是一个开放挑战。本报告介绍了 StepAudio 2.5,一个统一的音频-语言基础模型,其在所有三种能力上均达到或超过了专用系统。我们并未将这些任务视为架构上相互独立,而是基于一个前提:一旦文本和音频共享一个多模态表征空间(https://huggingface.co/papers?q=multimodal%20representational%20space),任务特化就成为操作模式的问题:数据构建、优化目标和解码约束。在这一洞察指导下,我们将后训练范式(https://huggingface.co/papers?q=post-training%20paradigm)从标准监督学习推进到针对特定任务的人类反馈强化学习(https://huggingface.co/papers?q=Reinforcement%20Learning%20from%20Human%20Feedback)(RLHF(https://huggingface.co/papers?q=RLHF)),并将其作为定义复杂优化目标的主要机制。我们利用这种以 RLHF(https://huggingface.co/papers?q=RLHF)为中心的对齐方法,结合专门的解码策略,将一个共享主干模型塑造为三种不同的操作模式。具体而言,ASR分支通过可验证的多token解码(https://huggingface.co/papers?q=verifiable%20multi-token%20decoding)提升了转录效率;TTS分支通过基于偏好的 RLHF(https://huggingface.co/papers?q=preference-based%20RLHF)和丰富上下文的监督,实现了可控、富有表现力的合成;实时分支则在 RLHF(https://huggingface.co/papers?q=RLHF)框架内通过生成式奖励建模(https://huggingface.co/papers?q=generative%20reward%20modeling)实现了低延迟、个性一致的对话。在标准基准测试中,StepAudio 2.5 在 ASR、TTS 和实时交互方面均取得了最先进的结果,证明一个单一的音频-语言基础模型能够成功内化语音理解、生成和实时交互的不同部署目标。
查看 arXiv 页面 (https://arxiv.org/abs/2605.23463) 查看 PDF (https://arxiv.org/pdf/2605.23463) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.23463)
在你的代理中获取这篇论文:
hf papers read 2605.23463
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
引用此论文的数据集0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
引用此论文的 Spaces0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2605.23463 以在此页面建立链接。
包含此论文的合集0
没有合集包含此论文
将这篇论文添加到一个合集 (https://huggingface.co/new-collection) 中以在此页面建立链接。
相似文章
StepAudio 3 Realtime 技术报告
论文介绍了StepAudio3Realtime,一个面向实时语音交互的音频语言基础模型,利用连续的听-说-想-行动循环结合Think-While-Speaking技术,以实现深度推理和低延迟,在MMSU和Full-Duplex Bench等基准测试中达到顶尖性能。
StepAudio 3 Gen 技术报告
StepAudio 3 Gen 是一个通用音频生成模型,它使用残差向量量化令牌,在一个单一的离散自回归框架内统一了文本转语音、声音设计、音效和音乐。
StepAudio 3 Music 技术报告
StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。
Fish Audio S2 技术报告
Fish Audio S2 是一个开源的文本转语音系统,支持多说话人、多轮生成以及指令跟随控制,并由具备低延迟特性的生产级推理引擎提供支持。
VibeVoice-ASR-Streaming 技术报告
VibeVoice-ASR-Streaming 是一个基于LLM的端到端模型,用于流式说话人属性语音识别,通过已发布的1.5B和7B模型权重实现了最先进的性能。