speech-to-speech

标签

Cards List
#speech-to-speech

@amitiitbhu:设计实时语音 AI 智能体,点击阅读:

X AI KOLs Timeline ↗ · 4天前 缓存

Outcome School 发布了一篇详细教程,讲解如何设计实时语音 AI 智能体,涵盖级联管道(STT→LLM→TTS)、端到端 Speech-to-Speech 模型与混合方案、延迟预算、打断处理(barge-in)、工具调用、记忆与上下文、电话系统集成、规模化部署、边缘情况、可观测性、安全与成本估算。

0 人收藏 0 人点赞
#speech-to-speech

利用随机化引导在Tandem Speech-to-Speech模型中学习自然对话行为

arXiv cs.CL ↗ · 6天前 缓存

本文介绍了随机化引导作为Tandem Speech-to-Speech模型的高效训练方法,使其能够直接从真实对话中学习自然对话行为,无需模拟后端LLM行为。

0 人收藏 0 人点赞
#speech-to-speech

恰逢其时:基于LLM的同步语音到语音翻译的因果感知框架

arXiv cs.CL ↗ · 6天前 缓存

本文提出了一种基于LLM的同步语音到语音翻译的因果感知框架,引入了新颖的数据管道和自适应策略,以改善质量-延迟权衡,以较低的延迟实现最先进的成果。

0 人收藏 0 人点赞
#speech-to-speech

Gemini 3.8 Live 搭配 Live Avatar(1分钟阅读)

TLDR AI ↗ · 2026-09-25 缓存

Gemini 3.8 Live 搭配 Live Avatar 为对话式AI带来了实时视觉呈现,允许企业通过动态化身和多语言支持创建更自然、交互性更强的数字体验。

0 人收藏 0 人点赞
#speech-to-speech

Gemini 实时音频

Simon Willison's Blog ↗ · 2026-09-15 缓存

Google 推出了 Gemini 3.8 Live 和 3.8 Live Extended Thinking 这两款新的语音到语音AI模型,作者利用这些模型开发了一个用于语音对话的网页界面工具。

0 人收藏 0 人点赞
#speech-to-speech

推出 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking

Google DeepMind Blog ↗ · 2026-09-15 缓存

Google 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这是一组先进的AI模型,专为实时推理和语音代理设计,在各项基准测试中均取得了最高分。

0 人收藏 0 人点赞
#speech-to-speech

GPT-Live-1 在电话代理中的应用 - 指令遵循问题

Reddit r/AI_Agents ↗ · 2026-09-13

本文报道了OpenAI的GPT-Live-1模型在电话代理中的实际测试,重点介绍了在生产场景中指令遵循、字母数字错误和语言处理方面的问题。

0 人收藏 0 人点赞
#speech-to-speech

SpaceXAI 在 Agent Builder 上推出 Grok Voice Think Fast 2.0(2分钟阅读)

TLDR AI ↗ · 2026-07-30 缓存

xAI 推出了 Grok Voice Think Fast 2.0,这是一个改进的语音到语音模型,具有更高的转录准确性和更低的延迟,在基准测试中优于竞争对手。

0 人收藏 0 人点赞
#speech-to-speech

@xiangxiang103: B站一兄弟做的赛博女友,太有感觉了! 纯本地运行的 AI 女友,不联网,不用 API key。 VAD:Silero VAD v5 STT:Whisper LLM:本地 llama.cpp TTS:Qwen3-TTS 四个模型全部塞进 1…

X AI KOLs Timeline ↗ · 2026-07-25 缓存

介绍了一个B站开发者制作的纯本地运行AI女友项目,集成Silero VAD、Whisper、llama.cpp和Qwen3-TTS四个模型,全部塞入15G显存并可热切换。

0 人收藏 0 人点赞
#speech-to-speech

@googlegemma: 无需等待的语音AI!感谢Hugging Face和Cerebras,开发者现在可以用Gemma 4 31B模型作为……

X AI KOLs Timeline ↗ · 2026-07-20 缓存

Google Gemma宣布,借助Hugging Face和Cerebras实现超快推理,开发者现在可以将Gemma 4 31B模型用作语音AI的大脑,这是开源级联语音到语音堆栈的一部分。

0 人收藏 0 人点赞
#speech-to-speech

@HuggingApps: NVIDIA Nemotron 刚刚推出了一个原生音频模型,它能感知世界,而不仅仅是文字转录、翻译、声音识别……

X AI KOLs Following ↗ · 2026-07-20 缓存

NVIDIA 发布了 Nemotron,一个原生音频模型,能够进行转录、翻译、声音识别、音频问答、TTS 以及完整的语音到语音转换,开放 2B 和 30B 参数权重。

0 人收藏 0 人点赞
#speech-to-speech

@iluciddreaming: 语音助理的四层架构:VAD → 语音识别 → LLM → 语音合成,这四层常常来自不同服务商。想换掉其中一家,往往得整组管线重写。 Hugging Face 开源了 speech-to-speech,把这四层模块化,让你像换零件一样替换其…

X AI KOLs Timeline ↗ · 2026-07-13 缓存

Hugging Face 开源了模块化的语音转语音(speech-to-speech)工具,将 VAD、语音识别、LLM 和语音合成四层分离并支持替换,允许用户灵活更换组件或本地运行,无需重写整个管线。

0 人收藏 0 人点赞
#speech-to-speech

@Thom_Wolf: 大多数人都应该更新他们对开源语音到语音技术现状的认知。老实说,这有点令人…

X AI KOLs Following ↗ · 2026-07-02 缓存

Thom Wolf 和 Cerebras 发布了一个完全开源、带有模型和代码的实时语音演示,展示了最先进的语音到语音能力。

0 人收藏 0 人点赞
#speech-to-speech

基于参考的口语对话系统韵律与节奏评估

arXiv cs.CL ↗ · 2026-07-01 缓存

本文提出了一种基于参考的评估协议,用于评估语音到语音AI系统的韵律和节奏,通过匹配人类对话数据提供可解释的行为合理性检查。

0 人收藏 0 人点赞
#speech-to-speech

Hugging Face和Cerebras将Gemma 4引入实时语音AI

Hugging Face Blog ↗ · 2026-07-01 缓存

Hugging Face和Cerebras展示了一个实时语音到语音流水线,结合了开源模型(Nvidia的Parakeet、Gemma 4、Qwen3TTS)与Cerebras的快速推理,实现了自然的对话式AI,并为Reachy Mini等机器人提供动力。

0 人收藏 0 人点赞
#speech-to-speech

Dziri Voicebot:面向阿尔及利亚方言的端到端低资源语音对话系统

arXiv cs.CL ↗ · 2026-06-25 缓存

本文提出了一种模块化的端到端语音对话系统,适用于低资源的阿尔及利亚方言,集成了ASR、NLU、RAG和TTS,并使用了专用数据集和微调模型。

0 人收藏 0 人点赞
#speech-to-speech

Gemma 4 12B 原生无编码器语音输入利用建议?

Reddit r/LocalLLaMA ↗ · 2026-06-14

讨论利用 Gemma 4 12B 的无编码器架构实现原生语音输入,寻找现成的低延迟流式音频摄入解决方案。

0 人收藏 0 人点赞
#speech-to-speech

Gemini 3.5 Live Translate

Product Hunt ↗ · 2026-06-09

Gemini 3.5 Live Translate 是一款全新的音频模型,用于实时语音到语音翻译。

0 人收藏 0 人点赞
#speech-to-speech

@GoogleDeepMind: 3.5 Live Translate 可以将语音转换为超过70种语言,并在流式传输时进行处理——同时保留语调、节奏…

X AI KOLs ↗ · 2026-06-09 缓存

Google DeepMind 宣布推出 Live Translate 功能,该功能可实时将语音转换为超过70种语言,同时保留语调、节奏和音高,以实现更自然的对话。

0 人收藏 0 人点赞
#speech-to-speech

借助 Gemini 3.5 Live Translate 实现流畅自然的语音翻译

Google DeepMind Blog ↗ · 2026-06-09 缓存

Google 发布了 Gemini 3.5 Live Translate,这是一款音频模型,支持超过 70 种语言的近乎实时的语音到语音翻译,并保留说话者的语调和节奏。该功能正在 Google 产品中逐步推出,包括 Gemini Live API、Google Meet 和 Google Translate。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈