实时语音AI能听到情绪——但它真的会用吗?

Reddit r/ArtificialInteligence 论文

摘要

这项研究测试了实时语音AI模型在语音中识别情绪线索的能力,发现尽管它们能检测到痛苦或讽刺等情绪,但这些信息并不能可靠地影响决策,突显了当前系统在情感智能方面的差距。

研究人员测试了GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus和Qwen3.5 Omni Flash在言语和语音表达相反情境下的表现。例如:“一切正常” + 哭泣 → 系统应该调查,但它结束了通话。“批准转账” + 恐惧的声音 → 应该上报,但它批准了转账。“帮我注册” + 明显的讽刺 → 应该识别出同意并非真诚,但它还是让此人注册了。有趣的是,当明确询问时,模型往往能检测到语音线索。所以这看起来不是简单的“模型听不懂情绪”问题。更像是:语音 > 感知 > [某些信息丢失] > 决策。在诊断测试中,四个模型中有三个可靠地捕捉到了痛苦、恐惧或讽刺,但这些信息并没有可靠地融入实际决策。让我们看看数据。在基本提示下,四个系统在跨场景的119/120次运行中做出了相同类型的脚本跟随决策。还有一些其他有趣的失败案例。给模型一段关于意大利的文本,用澳大利亚口音说出,几个系统会自信地告诉你它们听到的是意大利口音。给一个听起来年长的语音,使用儿童说话风格的脚本,一些模型会估计说话者是儿童。措辞实际上压倒了声学信号。而且提示并不是解决办法。它有时改变了行为,尤其是在欺诈场景中,但并不一致。许多场景基本没有变化,讽刺仍然在很大程度上被忽视。我一直在使用Dograh的开源基础设施和GPT Realtime 2进行一些关于语音和语音模型的实验……这些问题在长尾部分影响很大,而长尾部分在语音代理中是最关键的部分。最大的挑战是评估,因为许多评估基于转录本,忽略了情绪的细微差别。模型感知到的信息是否真的会影响它采取的行动?以及如何衡量?这是一个更棘手的问题。论文将此称为实时语音AI的“情感智能差距”。如果你正在从事实时语音、音频LLM、语音代理或评估工作,值得一读。论文:Real-Time Voice AI Hears but Does Not Listen — arXiv:2606.26083v1
查看原文

相似文章

实时语音AI听得见但听不懂(arXiv:2606.26083)

Reddit r/artificial

本文评估了四个领先的实时语音AI系统(GPT Realtime 2、Gemini 3.1 Flash Live、Qwen3.5 Omni Plus、Omni Flash),发现它们始终根据词语而非语气采取行动,即使能够感知到痛苦、恐惧或讽刺也忽略不计——这被称为语音AI的“情商鸿沟”。