FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
摘要
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。
查看缓存全文
缓存时间: 2026/07/15 16:21
论文页面 - FunAudioLLM:用于人类与LLM自然交互的语音理解与生成基础模型
来源:https://huggingface.co/papers/2407.04051
摘要
FunAudioLLM通过整合SenseVoice(用于多语言语音识别、情感检测和音频事件检测)与CosyVoice(用于跨语言、音色和风格的自然语音生成),显著增强了语音交互能力。
本报告介绍了FunAudioLLM,这是一个旨在增强人类与大型语言模型(LLM)之间自然语音交互的模型家族。其核心包含两个创新模型:SenseVoice,负责处理多语言语音识别、情感识别(https://huggingface.co/papers?q=emotion%20recognition)和音频事件检测(https://huggingface.co/papers?q=audio%20event%20detection);以及CosyVoice,用于促进自然语音生成(https://huggingface.co/papers?q=natural%20speech%20generation),并可控制多种语言、音色、说话风格和说话人身份。SenseVoice-Small支持5种语言的超低延迟ASR,SenseVoice-Large则支持超过50种语言的高精度ASR。而CosyVoice在多语言语音生成(https://huggingface.co/papers?q=multi-lingual%20voice%20generation)、零样本上下文学习、跨语言语音克隆(https://huggingface.co/papers?q=cross-lingual%20voice%20cloning)以及指令跟随能力(https://huggingface.co/papers?q=instruction-following%20capabilities)方面表现出色。与SenseVoice和CosyVoice相关的模型已在ModelScope和Hugging Face上开源,相应的训练、推理和微调代码也已发布在GitHub上。通过将这些模型与LLM集成,FunAudioLLM实现了诸如语音到语音翻译(https://huggingface.co/papers?q=speech-to-speech%20translation)、情感语音聊天(https://huggingface.co/papers?q=emotional%20voice%20chat)、互动播客(https://huggingface.co/papers?q=interactive%20podcasts)以及富有表现力的有声书朗读(https://huggingface.co/papers?q=expressive%20audiobook%20narration)等应用,从而推动了语音交互技术的发展。演示可在https://fun-audio-llm.github.io 获取,代码可访问https://github.com/FunAudioLLM。
查看arXiv页面 (https://arxiv.org/abs/2407.04051)查看PDF (https://arxiv.org/pdf/2407.04051)GitHub22.2kauto (https://github.com/funaudiollm/cosyvoice)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2407.04051)
在你的agent中获取这篇论文:
hf papers read 2407\.04051
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用该论文的模型1
omote-ai/sensevoice-asr 更新于3月6日 (https://huggingface.co/omote-ai/sensevoice-asr)
引用该论文的数据集0
没有与该论文链接的数据集
请在数据集的README.md中引用arxiv.org/abs/2407.04051,以便从本页面链接到它。
引用该论文的Spaces1
包含该论文的收藏集15
浏览包含该论文的15个收藏集 (https://huggingface.co/collections?paper=2407.04051)
相似文章
为LLM智能体设计的音频感知层,拥有随使用而增长的记忆
一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。
@paulabartabajo_:给AI工程师的建议 如果你正在构建语音智能体,别再连接3个独立模型了,用于音频转文本、文本转音频,或文本转文本……
宣布推出 liquid-audio,这是 Liquid AI 端到端语音转语音 LFM 模型(LFM2-Audio-1.5B 和 LFM2.5-Audio-1.5B)的开源仓库,支持交错和顺序生成模式以及微调功能。
释放全双工语音模型中LLM的能力
提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。
大型音频语言模型综述:泛化、可信度与展望
一篇全面综述,回顾了大型音频语言模型(LALMs)的可信度挑战,包括跨模态越狱和声学后门等漏洞,并提出了纵深防御路线图。
Open-LLM-VTuber/Open-LLM-VTuber
Open-LLM-VTuber 是一个开源的语音交互AI伴侣,拥有Live2D虚拟形象,支持实时对话和视觉感知,可完全离线运行。