text-to-speech

标签

Cards List
#text-to-speech

HybridCodec: 面向高效语音语言模型的离散与连续表示建模

arXiv cs.LG · 2026-06-29 缓存

提出HybridCodec,一种结合时间压缩离散令牌与连续残差的新颖框架,旨在改进语音语言模型中说话人特征的保留,在保持质量的同时减少自回归步骤。

0 人收藏 0 人点赞
#text-to-speech

缩小低资源文本转语音的质量差距:针对高棉语和韩语的VoxCPM2 LoRA微调

arXiv cs.CL · 2026-06-26 缓存

本文研究了VoxCPM2 TTS模型的LoRA微调,以改善低资源语言(如高棉语)的质量,同时显示对于基础模型已处理良好的韩语没有提升。该适配器在极少的参数训练下,显著提高了高棉语的MOS评分。

0 人收藏 0 人点赞
#text-to-speech

audio.cpp: 集成12种音频模型(Qwen3-TTS、PocketTTS、VeVo2等)于一个C++/ggml运行时 — 在CUDA上TTS速度比Python快5倍

Reddit r/LocalLLaMA · 2026-06-25

audio.cpp是一个C++/ggml运行时,集成了包括Qwen3-TTS、PocketTTS和VeVo2在内的12种音频模型,在CUDA上实现TTS速度比Python快5倍。

0 人收藏 0 人点赞
#text-to-speech

owensong/Inflect-Micro-v2

Hugging Face Models Trending · 2026-06-25 缓存

Inflect-Micro-v2 是一个紧凑型文本转语音模型,参数不足1000万,支持CPU/CUDA推理和长文本处理,已在Hugging Face上发布。

0 人收藏 0 人点赞
#text-to-speech

owensong/Inflect-Nano-v2

Hugging Face Models Trending · 2026-06-25 缓存

发布了 Inflect-Nano-v2,这是一个固定语音的英文TTS模型,参数量低于4M,用于本地文本到波形合成,支持CPU或CUDA推理,以及长文本处理。

0 人收藏 0 人点赞
#text-to-speech

Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统

arXiv cs.CL · 2026-06-25 缓存

本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。

0 人收藏 0 人点赞
#text-to-speech

我尝试制作了一个AI世界杯解说员,在比赛节奏变快前听起来很真实。

Reddit r/ArtificialInteligence · 2026-06-23

一次个人实验表明,为世界杯比赛构建的AI解说员在节奏较慢时效果真实,但快速比赛则会出现问题。

0 人收藏 0 人点赞
#text-to-speech

完全本地语音助手搭建指南

Lobsters Hottest · 2026-06-22 缓存

基于树莓派和Platypush搭建完全本地语音助手指南,涵盖热词检测、语音转文字、文字转语音以及家庭自动化集成。

0 人收藏 0 人点赞
#text-to-speech

@LinearUncle: 推荐一家叫模思的中国公司的开源声音克隆仓库: MOSS-TTS 你朗读一段文字,它克隆你的声音,然后就可以用你的声音朗读任意文本,查看帖子详情看我实战如何使用,效果很好,可以以假乱真。 https://github.com/OpenMOS…

X AI KOLs Timeline · 2026-06-19 缓存

MOSS-TTS是模思公司推出的开源声音克隆模型,用户朗读少量文本即可克隆声音,随后可用克隆的声音生成任意语音,效果逼真。

0 人收藏 0 人点赞
#text-to-speech

语音感觉是AI智能体被低估的输出层

Reddit r/AI_Agents · 2026-06-18

本文讨论了语音作为AI智能体输出层未被充分利用的潜力,重点介绍了超越简单文本转语音的实际用例和工作流程挑战。

0 人收藏 0 人点赞
#text-to-speech

@Gorden_Sun: 有道开源Confucius4-TTS 1.3B大小的TTS模型,支持多语言,支持语音克隆,效果不错,速度特别快。 Github:https://github.com/netease-youdao/Confucius4-TTS… 在线使用:…

X AI KOLs Timeline · 2026-06-18 缓存

有道开源了1.3B参数的Confucius4-TTS模型,支持14种语言的零样本语音克隆与跨语言语音合成,速度快且效果优秀。

0 人收藏 0 人点赞
#text-to-speech

@lmsysorg: SGLang-Omni 现已于第0天提供来自 @Open_MOSS 的 MOSS-TTS-Local Transformer v1.5!这是一个开源的 48 kHz 立体声 TTS 模式…

X AI KOLs Timeline · 2026-06-18 缓存

MOSS-TTS-Local Transformer v1.5 是一个开源的 48 kHz 立体声 TTS 模型,具有零样本语音克隆、原生流式传输,并支持31种语言,基于 Qwen3-4B 骨干网构建,通过 SGLang-Omni 提供。

0 人收藏 0 人点赞
#text-to-speech

@MosiAI_Official: MOSS-TTS Local Transformer v1.5 现已推出。克隆任意声音。说任何语言。听到每一个细节。30多种语言,48 kHz …

X AI KOLs Following · 2026-06-18 缓存

MosiAI发布了MOSS-TTS Local Transformer v1.5,这是一款支持语音克隆、30多种语言以及48 kHz高质量输出的文本转语音模型。

0 人收藏 0 人点赞
#text-to-speech

我发布了Inflect-Nano,一个极致微小的463万参数TTS模型。

Reddit r/LocalLLaMA · 2026-06-17

Inflect-Nano,一个极致微小的463万参数文本转语音模型,已经发布。

0 人收藏 0 人点赞
#text-to-speech

@_philschmid: 语音生成的体验提升!现在你可以从Gemini TTS流式传输音频,无需等待。构建语音助手…

X AI KOLs Following · 2026-06-17 缓存

Google的Gemini TTS现在支持流式音频生成,开发者可以构建即时响应的语音应用,无需等待完整音频输出。

0 人收藏 0 人点赞
#text-to-speech

@FakeMaidenMaker: 炸裂!这个开源项目免费文字转无 AI 味人声,还能克隆任何人的嗓音,并且用文字调整音色! GitHub 狂揽 30K star,出自面壁智能 OpenBMB,VoxCPM 之前拿过 GitHub 和 HuggingFace 双榜第一。 做…

X AI KOLs Timeline · 2026-06-17 缓存

VoxCPM2是OpenBMB开源的语音合成模型,采用无分词器的扩散自回归架构,支持30种语言、语音设计和可控语音克隆,仅需一句话即可克隆音色,或用文字创建全新声音,输出48kHz高质量音频,可商用。

0 人收藏 0 人点赞
#text-to-speech

owensong/Inflect-Nano-v1

Hugging Face Models Trending · 2026-06-16 缓存

Inflect-Nano-v1 是一个极小的英文文本转语音模型,总推理参数(包括其声码器)为 4.63M,专为本地高效的语音合成实验而设计。

0 人收藏 0 人点赞
#text-to-speech

@HuggingModels: 想象一个听起来如此自然的文本转语音模型,拥有8200万参数和超过1100万次下载。Kokoro-82M来了,一个…

X AI KOLs Timeline · 2026-06-16 缓存

Kokoro-82M是一个高度自然的文本转语音模型,拥有8200万参数和超过1100万次下载,代表了AI语音生成的重大进步。

0 人收藏 0 人点赞
#text-to-speech

@svpino: 这样的表现之后,呼叫中心不可能继续存在。听听这段对话,你分辨不出我是在和一个……

X AI KOLs Following · 2026-06-15 缓存

Cartesia 发布了 Sonic-3.5(文本转语音)和 Ink-2(语音转文本),声称它们是语音助手领域排名第一的流式模型,有可能颠覆呼叫中心。

0 人收藏 0 人点赞
#text-to-speech

哪个更好的本地移动TTS:Kokoro 还是 Supertonic?

Reddit r/LocalLLaMA · 2026-06-14

比较两个本地运行的移动TTS模型——Kokoro和Supertonic,质疑它们在初始演示之外的生产质量。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈