FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型

Papers with Code Trending 论文

摘要

介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。

这份报告介绍了FunAudioLLM,一个旨在增强人类与大型语言模型(LLM)之间自然语音交互的模型系列。其核心是两个创新模型:SenseVoice,负责多语言语音识别、情感识别和音频事件检测;以及CosyVoice,支持自然语音生成,并可控制多种语言、音色、说话风格和说话人身份。SenseVoice-Small为5种语言提供极低延迟的ASR,SenseVoice-Large支持超过50种语言的高精度ASR,而CosyVoice在多语言语音生成、零样本上下文学习、跨语言语音克隆和指令跟随能力方面表现出色。与SenseVoice和CosyVoice相关的模型已在Modelscope和Huggingface上开源,相应的训练、推理和微调代码也已发布在GitHub上。通过将这些模型与LLM集成,FunAudioLLM实现了语音到语音翻译、情感语音聊天、交互式播客和富有表现力的有声书朗读等应用,从而推动了语音交互技术的边界。演示可在https://fun-audio-llm.github.io获取,代码可在https://github.com/FunAudioLLM访问。
查看原文
查看缓存全文

缓存时间: 2026/07/15 16:21

论文页面 - FunAudioLLM:用于人类与LLM自然交互的语音理解与生成基础模型

来源:https://huggingface.co/papers/2407.04051

摘要

FunAudioLLM通过整合SenseVoice(用于多语言语音识别、情感检测和音频事件检测)与CosyVoice(用于跨语言、音色和风格的自然语音生成),显著增强了语音交互能力。

本报告介绍了FunAudioLLM,这是一个旨在增强人类与大型语言模型(LLM)之间自然语音交互的模型家族。其核心包含两个创新模型:SenseVoice,负责处理多语言语音识别、情感识别(https://huggingface.co/papers?q=emotion%20recognition)和音频事件检测(https://huggingface.co/papers?q=audio%20event%20detection);以及CosyVoice,用于促进自然语音生成(https://huggingface.co/papers?q=natural%20speech%20generation),并可控制多种语言、音色、说话风格和说话人身份。SenseVoice-Small支持5种语言的超低延迟ASR,SenseVoice-Large则支持超过50种语言的高精度ASR。而CosyVoice在多语言语音生成(https://huggingface.co/papers?q=multi-lingual%20voice%20generation)、零样本上下文学习、跨语言语音克隆(https://huggingface.co/papers?q=cross-lingual%20voice%20cloning)以及指令跟随能力(https://huggingface.co/papers?q=instruction-following%20capabilities)方面表现出色。与SenseVoice和CosyVoice相关的模型已在ModelScope和Hugging Face上开源,相应的训练、推理和微调代码也已发布在GitHub上。通过将这些模型与LLM集成,FunAudioLLM实现了诸如语音到语音翻译(https://huggingface.co/papers?q=speech-to-speech%20translation)、情感语音聊天(https://huggingface.co/papers?q=emotional%20voice%20chat)、互动播客(https://huggingface.co/papers?q=interactive%20podcasts)以及富有表现力的有声书朗读(https://huggingface.co/papers?q=expressive%20audiobook%20narration)等应用,从而推动了语音交互技术的发展。演示可在https://fun-audio-llm.github.io 获取,代码可访问https://github.com/FunAudioLLM。

查看arXiv页面 (https://arxiv.org/abs/2407.04051)查看PDF (https://arxiv.org/pdf/2407.04051)GitHub22.2kauto (https://github.com/funaudiollm/cosyvoice)加入收藏 (https://huggingface.co/login?next=%2Fpapers%2F2407.04051)

在你的agent中获取这篇论文:

hf papers read 2407\.04051

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用该论文的模型1

omote-ai/sensevoice-asr 更新于3月6日 (https://huggingface.co/omote-ai/sensevoice-asr)

引用该论文的数据集0

没有与该论文链接的数据集

请在数据集的README.md中引用arxiv.org/abs/2407.04051,以便从本页面链接到它。

引用该论文的Spaces1

包含该论文的收藏集15

浏览包含该论文的15个收藏集 (https://huggingface.co/collections?paper=2407.04051)

相似文章

为LLM智能体设计的音频感知层,拥有随使用而增长的记忆

Reddit r/LocalLLaMA

一个实验性开源框架,使LLM智能体能够使用本地模型(CLAP、Whisper、Silero VAD)和不断增长的概念记忆来感知并识别非语音音频事件。该系统采用事件门控识别、指纹识别和基于符号的推理,目前尚无正式基准测试。

释放全双工语音模型中LLM的能力

Hugging Face Daily Papers

提出Listen-Write-Speak (LWS),一种文本优先的三通道范式,允许单个自回归LLM持续监听、书写可见文本并实时说话,实现无需架构修改的全双工语音交互。

Open-LLM-VTuber/Open-LLM-VTuber

GitHub Trending (daily)

Open-LLM-VTuber 是一个开源的语音交互AI伴侣,拥有Live2D虚拟形象,支持实时对话和视觉感知,可完全离线运行。