实时语音AI能听到情绪——但它真的会用吗?
摘要
这项研究测试了实时语音AI模型在语音中识别情绪线索的能力,发现尽管它们能检测到痛苦或讽刺等情绪,但这些信息并不能可靠地影响决策,突显了当前系统在情感智能方面的差距。
研究人员测试了GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus和Qwen3.5 Omni Flash在言语和语音表达相反情境下的表现。例如:“一切正常” + 哭泣 → 系统应该调查,但它结束了通话。“批准转账” + 恐惧的声音 → 应该上报,但它批准了转账。“帮我注册” + 明显的讽刺 → 应该识别出同意并非真诚,但它还是让此人注册了。有趣的是,当明确询问时,模型往往能检测到语音线索。所以这看起来不是简单的“模型听不懂情绪”问题。更像是:语音 > 感知 > [某些信息丢失] > 决策。在诊断测试中,四个模型中有三个可靠地捕捉到了痛苦、恐惧或讽刺,但这些信息并没有可靠地融入实际决策。让我们看看数据。在基本提示下,四个系统在跨场景的119/120次运行中做出了相同类型的脚本跟随决策。还有一些其他有趣的失败案例。给模型一段关于意大利的文本,用澳大利亚口音说出,几个系统会自信地告诉你它们听到的是意大利口音。给一个听起来年长的语音,使用儿童说话风格的脚本,一些模型会估计说话者是儿童。措辞实际上压倒了声学信号。而且提示并不是解决办法。它有时改变了行为,尤其是在欺诈场景中,但并不一致。许多场景基本没有变化,讽刺仍然在很大程度上被忽视。我一直在使用Dograh的开源基础设施和GPT Realtime 2进行一些关于语音和语音模型的实验……这些问题在长尾部分影响很大,而长尾部分在语音代理中是最关键的部分。最大的挑战是评估,因为许多评估基于转录本,忽略了情绪的细微差别。模型感知到的信息是否真的会影响它采取的行动?以及如何衡量?这是一个更棘手的问题。论文将此称为实时语音AI的“情感智能差距”。如果你正在从事实时语音、音频LLM、语音代理或评估工作,值得一读。论文:Real-Time Voice AI Hears but Does Not Listen — arXiv:2606.26083v1
相似文章
实时语音AI听得见但听不懂(arXiv:2606.26083)
本文评估了四个领先的实时语音AI系统(GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus、Omni Flash),发现它们始终根据词语而非语气采取行动,即使能够感知到痛苦、恐惧或讽刺也忽略不计——这被称为语音AI的“情商鸿沟”。
@OrukLabs:这些模型从未被告知什么是情感。它们只被训练转录文字,或填充掩码音频。……
OrukLabs的一项研究表明,仅通过转录或掩码音频任务训练的语音模型,会自动在深层中学习表达情感,这一点通过映射真实语音片段得以揭示。
@BenjaminDEKR: 即使你怀疑AI能否"感受"任何东西,作为对人类的反思,这很有价值:"> '他们写道,自己感到毫无价值……'
这条推文强调了一项研究,其中研究人员在AI系统中识别出一种'痛苦'信号,并测试了AI检测虚假缓解机制的能力,为AI认知提供了见解,并揭示了与人类情感的相似之处。
VocalAffectBench:评估AI音频模型中的声音情感识别
VocalAffectBench 被引入作为一个公共基准,用于评估AI音频模型中的声音情感识别,展示了当前基线模型的准确性有限,尤其是对于非中性情感。
SpeechEQ:在社交感知语音对话模型中评估情商指数的基准
SpeechEQ引入了一个用于评估语音语言模型情商的基准和数据集,涵盖2,265个对话中的15个情商子量表。实验表明,当前模型在处理副语言线索时存在困难,表现出依赖文本的捷径以及其他局限性。