语音信号补充LLMs在速配中的人际吸引力预测

arXiv cs.CL 论文

摘要

本文研究了语音信号是否能补充基于LLM的对话记录人际吸引力预测,使用了日本速配数据。结果显示,结合语音和基于文本的模型时,预测准确性有条件的提升。

arXiv:2607.23037v1 公告类型:新 摘要:大型语言模型(LLMs)能够从对话记录中预测人际吸引力,但尚不清楚语音预测器在仅基于文本的LLM预测之外能提供什么额外信息。我们利用日本速配对话,结合仅基于文本的LLM预测和基于监督学习的语音预测器,来估计参与者对伴侣的喜欢程度。我们发现,语音可以补充仅基于文本的LLM预测,但这种补充是有条件的,而非普遍的。在所有评估条件下,结合两种预测在成对排序准确率上显著优于仅使用基于文本的LLM。相比之下,每个参与者皮尔逊 $r$ 的提升在不同对话轮次和评分方向上有所变化,且经校正后均不显著。回顾来看,这些 $r$ 的提升集中在那些语音预测器更为准确的参与者身上。因此,即使LLM能从文本中预测吸引力,语音仍能保留其预测价值。相关问题并非仅仅是语音是否有帮助,而是其互补性在何处显现。
查看原文
查看缓存全文

缓存时间: 2026/07/28 06:27

# 语音信号补充大语言模型在快速约会中预测人际吸引力的作用
来源:https://arxiv.org/html/2607.23037
\(2026\)

###### 摘要

大语言模型(LLMs)可以从对话文本记录中预测人际吸引力,但目前尚不清楚语音预测器在仅基于文本记录的 LLM 预测之外能增加什么。我们利用日语快速约会对话,结合仅基于文本记录的 LLM 预测和受监督的语音预测器,来估计参与者对伴侣的喜爱程度。我们表明,语音可以补充仅基于文本记录的 LLM 预测,但这种互补性是有条件的,而非普遍的。在所有评估条件下,将这两种预测结合起来,相比仅使用文本记录的 LLM,能显著提高成对排名准确性。相比之下,每位参与者的 Pearson r 增益在不同对话轮次和评分方向上有所不同,且在修正后均不显著。回顾来看,这些 r 增益集中在语音预测器更准确的参与者身上。因此,即使 LLM 能从文本记录中预测吸引力,语音仍可能保留其预测价值。相关的问题并非简单地在于语音是否有帮助,而在于其互补性出现在哪里。¹¹¹代码可在 github.com/yurikomium/speech-llm-complementarity 获取 (https://github.com/yurikomium/speech-llm-complementarity)

人际吸引力;快速约会;大语言模型;语音处理;多模态融合

††journalyear:2026††copyright:cc††conference:国际多模态交互会议;2026年10月05日至09日;意大利那不勒斯††booktitle:国际多模态交互会议 (ICMI ’26),2026年10月05日至09日,意大利那不勒斯††doi:10.1145/3776574.3831151††isbn:979-8-4007-2318-6/2026/10††ccs:以人为本的计算 协作与社交计算中的实证研究††ccs:应用心理学††ccs:计算方法 自然语言处理

## 1. 引言

初次接触形成的人际吸引力可以决定一段关系是否会继续发展 (Berscheid and Reis,1998 (https://arxiv.org/html/2607.23037#bib.bib8))。快速约会提供了一个自然的环境来研究初始吸引力如何形成:参与者会见多个潜在伴侣,并报告他们对每个人的喜爱程度。在这种环境中,对话行为可以提供信息。例如,音高趋同会随着说话者如何看待伴侣的外貌吸引力和整体可喜欢程度而变化 (Michalsky and Schoormann,2017 (https://arxiv.org/html/2607.23037#bib.bib2))。这些发现激励了从交互数据中构建人际吸引力的计算模型。

从对话中自动预测人际结果的研究主要沿着两条独立的路线发展。一条路线使用大语言模型(LLMs)从文本记录中推断结果。在一项直接针对快速约会的研究中,LLMs 从对话文本记录中预测了互动成功的客观和主观指标 (Matz et al.,2026 (https://arxiv.org/html/2607.23037#bib.bib17))。另一条路线使用受监督的模型,利用词汇、语音、对话和视觉信号来预测社会判断和结果 (Ranganath et al.,2009 (https://arxiv.org/html/2607.23037#bib.bib13); Veenstra and Hung,2011 (https://arxiv.org/html/2607.23037#bib.bib14))。这些路线共同提出了一个广泛的问题:哪些对话信号在仅基于文本记录的 LLM 预测之外仍然有用。我们针对快速约会中的吸引力提出一个更具体的问题:一个受监督的语音预测器能否在仅基于文本记录的 LLM 预测之外提供额外的预测价值,以及这种价值出现在哪里?

我们使用多模态快速约会语料库 (Ishii et al.,2023 (https://arxiv.org/html/2607.23037#bib.bib15)) 来研究这个问题,该语料库包含日语快速约会对话,包括文本记录、针对说话者的音频以及对话后的喜爱评分。我们的任务是预测每位参与者报告的对伴侣的喜爱程度,重点是区分参与者自己的伴侣集。我们将*语音衍生的互补性*定义为受监督的语音预测器在评估的仅基于文本记录的 LLM 预测之外贡献的额外预测价值,而不声称语音预测器捕捉到了文本记录中根本上不存在的信息。

对于主要分析,仅基于文本记录的预测器是 Claude Sonnet 4.6(禁用扩展思维,以下简称为 Claude),采用零样本提示进行评估。受监督的语音预测器基于冻结的 HuBERT-Large 表示(以下简称为 HuBERT)。我们通过加权的分数级延迟融合来组合它们的标量预测,如图 1 (https://arxiv.org/html/2607.23037#S1.F1) 所示。这种故意简单的组合方式作为诊断额外预测价值的手段,而非一种新的融合架构。我们评估了在两次对话轮次、两个评分方向和参与者之间的互补性。两种接收文本记录和音频的多模态 LLM 作为辅助的直接输入比较。

总之,我们阐明了受监督的语音预测器在何处能为快速约会吸引力预测提供超出评估的仅基于文本记录的 LLM 的预测价值。我们通过跨评估指标、对话轮次和评分方向以及参与者来检验这种附加价值,并仅使用分数级延迟融合作为诊断手段。支持性分析通过量化评分者内的预测重叠和相互的增量关联,来评估仅基于文本记录的 LLM 和语音预测器是否做出了冗余预测。这些分析共同将问题从语音平均而言是否有帮助转变为它的互补性出现在哪里。

与 Claude 相比,融合在所有四种轮次-评分方向设定中显著提高了成对排名准确性。然而,每位参与者的 Pearson r 增益在这些设定中有所不同,并且在校正后没有一个是统计显著的。回顾来看,参与者的 r 增益在 HuBERT 更准确的情况下更大,尽管这种关联部分是因为 HuBERT 预测进入了融合分数。Claude 和 HuBERT 的预测在评分者内共享的方差很小,并且每个预测解释的样本内增量方差大致相当,互不相让。作为支持背景,在所有四种设定中,Claude 的每位参与者 r 高于每个测试的受监督文本模型。

综合来看,这些发现并不支持一个笼统的主张,即添加语音能普遍改善吸引力预测。相反,它们表明,即使 LLM 能从文本记录中预测吸引力,语音仍可能保留其预测价值。对于多模态社会预测,相关的问题因此并非简单地在于语音是否有帮助,而在于其互补性出现在哪里。

图 1:F2M(女性评价男性)和 M2F(男性评价女性)的预测流程。Claude Sonnet 4.6(禁用扩展思维,使用零样本提示)从完整的两人文本记录中预测喜爱度,而冻结的 HuBERT 和受监督头部从评分者方的语音进行预测。加权的分数级融合使用折选权重 w 来组合预测。一次快速约会对话后喜爱度的预测流程。F2M 表示女性参与者评价男性伴侣,M2F 表示男性参与者评价女性伴侣。对话分为两个分支。上方分支将完整的两人文本记录发送给 Claude Sonnet 4.6(零样本提示,禁用扩展思维),得到仅基于文本记录的预测。下方分支将评分者方的音频通过冻结的 HuBERT 和受监督的预测头部,得到 HuBERT 预测。两个预测使用权重 w 和 1-w 进行组合,以产生融合的预测喜爱度分数。

## 2. 相关工作

### 2.1. 用于人际推理的 LLMs

除了吸引力之外,LLMs 还被评估为基于文本的对话中共情沟通的评判者。当为每个评估框架提供标准和专家标注的例子时,在四个评估框架中,LLM 与专家的一致性接近专家之间的一致性 (Kumar et al.,2026 (https://arxiv.org/html/2607.23037#bib.bib16))。

与本文最直接相关的是,Matz 等人 (Matz et al.,2026 (https://arxiv.org/html/2607.23037#bib.bib17)) 将 ChatGPT 应用于快速约会文本记录,以预测相互联系方式交换以及主观结果和体验。ChatGPT 与这些标准的相关系数适中(r=0.12–0.23)。特别是对于相互联系方式交换,其表现与仅基于文本记录的人类评判者相当(r=0.12 对比 r=0.13)。在此工作基础上,我们测试受监督的语音预测器是否能在仅基于文本记录的 LLM 预测之外,为连续喜爱度和参与者内部伴侣排名提供额外的预测价值。

### 2.2. 人际结果的多模态预测

长期以来,人际结果一直通过使用对话中的言语和非言语特征进行计算研究。简短的表达行为观察可以支持准确的人际判断,而非言语交流包括面部、声音、身体、触摸和人际空间中的线索 (Ambady and Rosenthal,1992 (https://arxiv.org/html/2607.23037#bib.bib7); Hall et al.,2019 (https://arxiv.org/html/2607.23037#bib.bib4))。在快速约会中,受监督模型已使用韵律、对话和词汇特征来检测调情 (Ranganath et al.,2009 (https://arxiv.org/html/2607.23037#bib.bib13)),并使用来自视频的位置、接近度和运动特征来预测联系方式交换和外貌吸引力 (Veenstra and Hung,2011 (https://arxiv.org/html/2607.23037#bib.bib14))。补充性的统计分析将对话行为与快速约会相遇中的感知联系联系起来 (McFarland et al.,2013 (https://arxiv.org/html/2607.23037#bib.bib12)),并将功能词语言风格匹配与相互浪漫兴趣联系起来 (Ireland et al.,2011 (https://arxiv.org/html/2607.23037#bib.bib11))。说话者的音高趋同也随着他们对伴侣外貌吸引力和整体可喜欢程度的感知而变化 (Michalsky and Schoormann,2017 (https://arxiv.org/html/2607.23037#bib.bib2))。在日语快速约会数据上,Ishii 等人 (Ishii et al.,2023 (https://arxiv.org/html/2607.23037#bib.bib15)) 利用交互前可获得的信息(包括资料、面部特征和心理测量指标)预测了交互后的喜爱度分数。最近,冻结的自监督语音表示(包括 HuBERT)已有效迁移到副语言任务,如情感识别 (Hsu et al.,2021 (https://arxiv.org/html/2607.23037#bib.bib27); Yang et al.,2021 (https://arxiv.org/html/2607.23037#bib.bib38))。

Santana 等人 (Santana et al.,2025 (https://arxiv.org/html/2607.23037#bib.bib19)) 为我们的受监督分支提供了最接近的结构先例。他们的 Speech-to-Joy 框架在冻结的预训练文本和音频嵌入上训练独立的预测器,使用加性注意力池化和模态特定的回归头。然后,该框架对两个预测器的输出分数进行平均,以预测人机对话中的愉悦度。我们采用了这种受监督分支架构,但我们的主要比较是将语音预测器与仅基于文本记录的 LLM 预测配对,而不是与受监督的文本预测配对。

### 2.3. 多模态预测中的 LLM 集成

多模态融合方法传统上分为特征级早期融合和分数级晚期融合。当预测器在不同的训练机制下训练时,晚期融合特别合适,因为每个预测器可以独立优化。最近的工作以多种方式将 LLMs 集成到多模态预测流程中。一些方法在提示中将非言语模态文本化 (Ma et al.,2025 (https://arxiv.org/html/2607.23037#bib.bib20); Hasan et al.,2023 (https://arxiv.org/html/2607.23037#bib.bib21)),或使用 LLM 对传统模型输出进行事后精炼 (Singh and Villalba,2025 (https://arxiv.org/html/2607.23037#bib.bib22))。其他方法使用 LLM 以自然语言而非加权分数级组合来集成模态特定的预测 (Demirel et al.,2025 (https://arxiv.org/html/2607.23037#bib.bib24))。

在任务层面,Pereira 等人 (Pereira et al.,2024 (https://arxiv.org/html/2607.23037#bib.bib18)) 将 LLM 衍生的愉悦度评分与时间、视觉和声学特征结合起来,用于人机对话中的受监督模型,并分别比较了仅文本和视频加音频的 LLM 输入。他们的受监督目标是第三方的愉悦度标注。LLM 分数与模态描述符一起进入受监督模型,而不是与单独训练的模态特定预测器的输出在分数级融合。

有两项先前的工作更具体地将分数级晚期融合与 LLMs 结合,但都没有将仅基于文本记录的 LLM 预测视为独立分支。在 Amin 等人 (Amin et al.,2023 (https://arxiv.org/html/2607.23037#bib.bib23)) 中,ChatGPT 作为一个辅助文本生成器,其输出与原始文本一起被特征化,因此所有融合分支都采用文本输入。在 ZS-Fuse (Kataria and Hu,2026 (https://arxiv.org/html/2607.23037#bib.bib25)) 中,其“零样本大模型加受监督专家模型”的结构与我们相似,但零样本分支本身是音频驱动的,而非文本驱动。另一个独立方向是将音频直接集成到 LLMs 中:原生音频模型如 SALMONN (Tang et al.,2024 (https://arxiv.org/html/2607.23037#bib.bib32)) 将预训练的语音和音频编码器与 LLM 集成,并使其直接对音频输入进行推理。我们将这一方向作为辅助比较纳入,使用 MLLM 基线 Gemini 2.5 Flash 和 GPT-audio-mini(输入为文本加音频)。

这些研究共同留下了一个问题:一个单独训练的语音预测器是否能够改善超越仅基于文本记录的 LLM 的人际吸引力预测。我们将通过零样本提示获得的仅基于文本记录的 LLM 预测和单独训练的受监督语音预测器视为独立分支,通过加权分数级晚期融合来组合它们的输出。我们使用这种传统的融合方法来诊断语音预测器在仅基于文本记录的预测之外的额外预测价值。原生音频的 MLLMs 形成了一条单独的直接输入路径,我们在本研究中仅将其作为辅助比较纳入。

## 3. 语料库与任务定义

### 3.1. 快速约会语料库

我们使用多模态快速约会语料库 (Ishii et al.,2023 (https://arxiv.org/html/2607.23037#bib.bib15))。它是在快速约会范式中收集的,这是一个经过方法学验证的、在受控且生态有效的条件下观察初始浪漫吸引力的环境 (Finkel et al.,2007 (https://arxiv.org/html/2607.23037#bib.bib10))。该语料库记录了男女配对之间的面对面对话,涉及 147 名母语为日语的参与者:75 名女性参与者和 72 名男性参与者。他们的年龄范围为 19 至 60 岁,平均年龄为 31.9 岁,标准差为 8.6 岁。所有参与者都表示对结识未来伴侣有浓厚兴趣。

参与者被分配到年龄平衡的小组,每组由 5 名女性和 5 名男性成员组成。每个小组进行了所有 25 种可能的男女配对对话;一些参与者参加了多个小组。该语料库组织为两次对话轮次,名义持续时间为 5 分钟(第 1 轮)和

相似文章

如何利用合成语音构建基于LLM的ASR系统?

arXiv cs.CL

本文研究了基于LLM的ASR系统中合成语音与真实语音之间的分布差距,定位了LLM区分两者的层位置,并提出使用层选择与RIR增强方法,以更少的真实数据匹配真实数据基线。