Is there an uncanny valley for AI voices?

Reddit r/ArtificialInteligence 新闻

摘要

Bland团队探讨AI语音的恐怖谷效应,并开发能模拟人类不完美特质的TTS模型,以提升电话交互的自然感和人性化体验。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/27 23:35

# 是否存在AI语音的“恐怖谷”效应?Bland团队的探索与见解 > **TL;DR:** Bland团队认为,完美的TTS系统会引发“恐怖谷”效应,他们正在开发一种能生成自然人类不完美特质(如呼吸、停顿和语气词)的语音模型,以通过电话测试并提供更人性化的交互体验。 ## 为何追求不完美?Bland的TTS哲学 Bland的核心观点是,他们不想要一个生成完美、流畅语音的TTS系统。他们需要的是一个能模仿人类说话中“不完美”特质的系统。 这种追求源于对用户体验的深刻理解。正如团队成员杰克所说:“我们都经历过与IVR(交互式语音应答)或机器人通话的情况,光是听到机器人对你说话的声音就让人恼火。” 他们希望通过让AI代理的声音更自然、更具表现力,来提供与其他电话代理完全不同的体验,让电话另一端的人相信正在与一个真人交流。 ## Bland是什么? Bland是一个企业级语音AI平台。他们自行托管所有模型,包括TTS(文本转语音)、ASR(自动语音识别)和LLM(大语言模型)。这种全栈控制使得他们能够满足每个企业客户的不同需求,有时客户需要不同的模型和微调来应对特定用例。 ## 构建富有表现力的TTS模型 Bland的文本转语音模型旨在生成一种超级自然、逼真的语音。其表现力不仅来自流畅的语句,更来自语音之外的部分: * **非语言发声:** 包括呼吸声、笑声、轻笑等。 * **声音事件:** 比如背景中的狗叫、关门声,甚至电视播放的声音。 * **人类不完美特质:** 如停顿、使用“嗯”、“呃”等语气词,让句子听起来不是像一个词一个词蹦出来的。 研究员乔林指出:“我们不想要一个生成完美、完美语音的TTS系统…我们需要一个有人类不完美特质的系统,对吧?我们人类不是照本宣宣科的,不是完美的,而这正是我们希望在电话另一端拥有的:自然、更人性化的东西。” ## 技术实现:数据管道、解耦与评估 ### 高质量数据集的构建 为了训练这样的模型,他们构建了一个高度精选的数据集。佩德罗描述了这个极具挑战性的过程:他们从数百万小时的音频数据开始,必须将其缩减为5到30秒的短片段,且需要确保每个片段只有一个说话者、音频清晰、能听懂内容。起初,评估方法非常基础,佩德罗通过手动听取数百个片段来判断质量,然后不断迭代优化数据收集和标注的各个组件,以提高高质量片段的比例。 ### 模型架构:解耦控制 他们的全新TTS引擎能够直接从任意给定文本建模语音。团队内部经常讨论“解耦”的概念,这允许他们对语音的不同方面进行精细控制: * **韵律(Prosody):** 节奏、重音和语调。 * **声学部分(Acoustics):** 语音中的频率特征。 * **身份特征(Identity):** 说话者的声音特质。 这种解耦避免了将复杂模型作为一个整体训练时可能出现的不可控性。 ### 从自回归到LLM骨干 在当前的LLM时代,TTS模型也采用了类似风格,将语音离散化为标记(通过音频编解码器模型),然后使用LLM进行自回归建模。更重要的是,他们的TTS模型建立在LLM骨干之上。这意味着模型能够理解句子的语义。因此,当生成一句悲伤的台词(如“哦,我真的很抱歉”)时,模型能通过其预训练对“悲伤”概念的理解,自动应用相应的语调,即使训练数据中没有完全相同的样本。 ## 情感表达与未来挑战 ### 基于统计的情感推断 目前,模型主要通过模式识别从数据中提取情感。如果训练数据中大多数“恭喜”都用兴奋的语调说出,模型就会学习这种模式。这是一种基于数据分布的统计推断。 ### 实现更精确的情感控制 然而,有时需要打破常规情感关联(例如,用愤怒的语调说出通常认为开心的话)。佩德罗指出,这更像是一个“研究赌注”,因为难以从真实数据中找到这类样本。未来,他们可能需要研究如何合成生成具有这些特定情感特征的数据。 ## 对话式AI的未来:从级联管道到全双工建模 目前,大多数对话AI使用的是**级联管道**:用户说话 -> ASR转录为文本 -> LLM处理 -> 文本生成回答 -> TTS转换为语音。这种方法存在信息压缩损失(如丢失语气、真实情绪)和高延迟的问题。 未来的方向是**全双工模型**研究,旨在整个对话过程中保持语音媒介,让一切都在语音标记或向量中进行。代理能直接感知语音输入,并同时输出语音,无需模态转换,从而更自然地模拟人类对话流,包括反馈、犹豫等自然互动方式,而无需在提示中硬编码这些行为。 --- **Source:** [Is there an uncanny valley for AI voices? (YouTube)](https://www.youtube.com/watch?v=aSoIJVbIwAc)

相似文章

Natural Conversations with GPT-Live

YouTube AI Channels

OpenAI 展示新版语音模型在个性化和自然度上的突破,能够进行自然的头脑风暴式对话,表现出共情和适时插话能力,接近人类对话节奏。

恐怖谷效应

Reddit r/ArtificialInteligence

一篇讨论恐怖谷概念的文章,即类人机器人或人工智能引发的不安感。

AI的声音

Reddit r/AI_Agents

文章讨论了语音技术在人工智能中的重要性。

GPT新语音模型简直太疯狂了。

Reddit r/singularity

OpenAI 的新 GPT 语音模型实现了高度逼真、低延迟的实时语音对话,并具备情感表达能力,标志着 AI 语音交互的一次重大飞跃。