FriendBench:在人类和多模态大语言模型中基准测试二元熟悉度推断
摘要
FriendBench 是一个新的基准测试,用于评估人类和多模态大语言模型是否能够从一段20秒的破冰对话视频片段中推断出两个人是熟人还是陌生人。结果表明,最佳模型在准确率上与人类相当,但在偏差上有所不同,并且只有人类能从更丰富的视觉行为中受益。
arXiv:2607.29602v1 公告类型:新
摘要:解读社交情境往往依赖于行为,而不仅仅是言语。我们引入了 FriendBench,这是一个基准测试,用于从一段20秒的二元破冰对话片段中推断两个人是已经熟悉还是初次见面。每一对对话者都回答相同类型的提示,因此只有互动方式才能揭示答案。我们跨越文本、音频和视频,将来自七家公司的26个模型与匹配的人类评审组在96个平衡的二元对话上进行比较。在每种模态中,最佳模型和人类群体在准确率上统计上无显著差异,但达到这一结果的方式不同:人类保持两种答案之间的平衡,而最强模型倾向于“陌生人”——这是有效先验的差异,而非区分能力的差异。更丰富的通道对两者的帮助不均衡,并且只有人类能从可见行为叠加言语中获益。我们公开了刺激材料、人类评分和模型预测。
查看缓存全文
缓存时间: 2026/08/03 07:37
# 对人类与多模态大语言模型的二元熟悉度推断进行基准测试 来源:https://arxiv.org/html/2607.29602 Jeffrey M\. Girard, Jason Z\. Zheng, Jacqueline R\. Vertino, Antony D’Avirro, Benjamin Peloquin Fluid Concepts Research 通讯邮箱:jeff@fluidconcepts\.ai (https://arxiv.org/html/2607.29602v1/mailto:[email protected]) ###### 摘要 理解社交情境往往依赖于行为,而不仅仅是言语。我们引入了 FriendBench,一个通过 20 秒的双人破冰对话片段来推断两人是早已熟悉还是初次见面的基准测试。每一对参与者都回答相同类型的提示,因此只有互动方式才能揭示答案。在文本、音频和视频三种模态下,我们将来自七家公司的 26 个模型与匹配的人类评审小组在 96 对均衡的二人组合上进行了比较。在每种模态下,最佳模型与人类大众在准确率上统计上无显著差异,但达到这一准确率的方式不同:人类在两个答案之间保持平衡,而最强模型则偏向“陌生人”——这是有效先验的差异,而非区分力的差异。更丰富的通道对两者的帮助不均衡,并且只有人类能从可见行为中获得额外增益。我们发布了刺激材料、人类评分和模型预测。 FriendBench:在人类和多模态大语言模型中基准测试二元熟悉度推断 Jeffrey M\. Girard, Jason Z\. Zheng, Jacqueline R\. Vertino, Antony D’Avirro, Benjamin Peloquin Fluid Concepts Research 通讯邮箱:jeff@fluidconcepts\.ai (https://arxiv.org/html/2607.29602v1/mailto:[email protected]) ## 1 引言 社会智能,即理解他人及其所处情境的能力,是人类认知的核心组成部分 (Adolphs,2003 (https://arxiv.org/html/2607.29602#bib.bib18); Frith and Frith,2007 (https://arxiv.org/html/2607.29602#bib.bib19))。它也是 AI 系统日益重要的需求,这些系统如今在从陪伴代理到会议助手和护理监测等角色中观察、调解和参与人类互动 (Mathuret al\.,2024 (https://arxiv.org/html/2607.29602#bib.bib20); Sapet al\.,2019 (https://arxiv.org/html/2607.29602#bib.bib21))。此类系统必须对人们所处的社交情境进行推理,而这种推理在很大程度上依赖于多模态行为线索,而非明确的言语内容,例如人们如何协调、回应和彼此定向 (Tickle\-Degnen and Rosenthal,1990 (https://arxiv.org/html/2607.29602#bib.bib4))。一个只读取对话语义内容的系统,仅仅捕捉了社交理解所需的一部分。 我们研究社会智能的一个具体实例:从一段简短的互动样本中识别两个人之间关系的能力。具体而言,我们研究观察者能否在未被事先告知且不依赖对话内容的情况下,判断两个人是早已熟悉还是初次见面。这一判断之所以是行为社会感知的干净探针,原因有二。首先,由于我们拥有真实关系标签,其答案是一个事实问题而非解释问题:许多相关的社会智能研究针对意图、情绪或信念 (Premack and Woodruff,1978 (https://arxiv.org/html/2607.29602#bib.bib22); Sapet al\.,2019 (https://arxiv.org/html/2607.29602#bib.bib21)),其正确答案往往有争议,而先前的熟悉程度具有明确无误的真实标准(即,两人要么见过,要么没有)。其次,在简短的互动中,熟悉度往往未被言明,因此必须从行为中推断。该任务因此排除了仅靠阅读语义内容就能成功的可能性,而先前研究表明,人类能从简短的行为样本中做出准确的社会判断——即所谓的*薄片* (Ambady and Rosenthal,1992 (https://arxiv.org/html/2607.29602#bib.bib2))。 我们将该任务操作化为 FriendBench:从一段 20 秒的双人破冰对话片段中进行二元分类,区分“熟悉”与“陌生人”,并分别在文本、音频和视频模态下进行评估。每一对参与者,无论熟悉与否,都回答相同类型的破冰提示,因此对话主题在两个类别间是匹配的,其本身无法揭示答案,留给互动方式作为主要信号。 除了所基准测试的核心能力之外,我们还研究了人类和模型如何利用这三种模态,以及每种方式如何达到其准确率——是通过区分两类(*区分力*)还是通过不考虑证据而更频繁地回答某一类(*反应偏向*)。有两个模式很突出。首先,更丰富的通道对模型和人类都有帮助,但不均衡:音频在文本之上为两者都增加了可靠的信号,然而只有人类从视觉通道中获得了进一步的可靠增益,而最强模型从音频到视听则保持平稳——它们未能充分利用人类能解读的可见行为。其次,人类在每种模态下都保持接近两个类别之间的平衡,而模型则表现出更大且更特异的类别偏向,在纯文本条件下最为明显。这两个模式都关乎人类和模型*如何*解决任务,而不仅仅是他们是否成功(§5 (https://arxiv.org/html/2607.29602#S5))。 #### 贡献。 - • 我们引入了 FriendBench,一个多模态基准测试,用于从破冰片段中推断双人组合的先验熟悉度(熟悉 vs\. 陌生人)。该基准测试中每对参与者都回答相同类型的提示,其构建基于 Seamless Interaction 数据集 (Agrawalet al\.,2025 (https://arxiv.org/html/2607.29602#bib.bib1))。111基准刺激、人类评分和模型预测公开可获取于 https://huggingface.co/datasets/fluid-concepts/friend-bench。 - • 我们发布了该任务的匹配人类评分数据集,覆盖 96 对双人组合的文本、音频和视频模态,每种模态约有 90 名评分者。 - • 我们评估了来自七家公司——OpenAI、Google、Anthropic、Alibaba、Mistral、Thinking Machines 和 Meta——的 26 个模型,涵盖专有和开放权重系统,跨越所有三种模态。 - • 我们在匹配条件下对相同刺激评估了人类和模型。在准确率上,最佳模型和人类大众在每种模态下统计上无显著差异。但相同的准确率并非类人的感知。最强模型通过倾向于“陌生人”来达到这一准确率,而人类评分者保持平衡。使用信号检测理论,我们将此表征为有效先验的差异,而非区分力的差异(§5 (https://arxiv.org/html/2607.29602#S5))。 - • 我们发现两种评分者类型仅部分遵循的模态顺序:文本对两者携带的信号都很弱,音频增加了可靠的区分力,但视听通道给*人类*带来了进一步的可靠增益,却使最强模型保持平稳——当前模型捕捉到了声音信号,但未能充分利用人类观察者所解读的可见行为(§5\.3 (https://arxiv.org/html/2607.29602#S5.SS3))。 ## 2 相关工作 #### 熟悉度的薄片感知。 人类观察者能从非常短暂的行为暴露中形成关于人和关系的准确判断。Ambady 和 Rosenthal 的 (1992 (https://arxiv.org/html/2607.29602#bib.bib2)) 元分析发现,基于五分钟以下(通常 30 秒以下)观察的判断能预测客观结果,其 r≈.39r\\approx\.39,更长的暴露几乎没有增加。熟悉度尤其能在薄片中可读,友谊是研究得最充分的案例:观察者能从无声视频 (Latifet al\.,2014 (https://arxiv.org/html/2607.29602#bib.bib30)) 或简短音频 (Bryantet al\.,2020 (https://arxiv.org/html/2607.29602#bib.bib23)) 中区分朋友和陌生人,而诸如回合间时序等线索则可以区分二者 (Templetonet al\.,2023 (https://arxiv.org/html/2607.29602#bib.bib34))。对我们的设计至关重要的是,Dunbaret al\. (2022 (https://arxiv.org/html/2607.29602#bib.bib25)) 表明,即使在数字上移除词汇内容后,关系质量仍可从语音中推断——关系信号不一定来自所说内容。这为我们的任务和 20 秒窗口提供了动机,根据这些证据,20 秒是足够的。 #### 从行为识别关系。 一条工作线通过监督分类从图像或视频预测关系*类型*:PISC (Liet al\.,2017 (https://arxiv.org/html/2607.29602#bib.bib5)) 将图像标记为亲密、非亲密或无关系,PIPA (Sunet al\.,2017 (https://arxiv.org/html/2607.29602#bib.bib7)) 在相册中标注了十六种细粒度关系,而近期工作从实时互动的时序动态中分类非对称关系 (Tanget al\.,2026 (https://arxiv.org/html/2607.29602#bib.bib33))。另一条平行线从对话的*语义内容*推断关系——基于电话呼叫的声学-词汇分类器 (Katerenchuket al\.,2014 (https://arxiv.org/html/2607.29602#bib.bib27)) 以及基于电影脚本对话的语言模型,从诸如 DDRel (Jiaet al\.,2021 (https://arxiv.org/html/2607.29602#bib.bib26)) 这样的关系分类数据集到 LLM 评估(GPT\-4o 能远高于随机水平地推断说话者关系 (Kimet al\.,2026 (https://arxiv.org/html/2607.29602#bib.bib28)))。这两条线都与我们的任务有两个不同:它们推断关系类型而不是是否存在先前的熟悉度,并且它们依赖外表、场景或语义内容(特别是对于脚本化对话)。我们则固定对话提示,从而控制了这些方法所依赖的语义内容。 #### 多模态模型中的社会推理。 多模态模型越来越多地被测试用于社会理解:Social\-IQ (Zadehet al\.,2019 (https://arxiv.org/html/2607.29602#bib.bib6)) 提出关于社交视频的问题,而 SIV\-Bench (Konget al\.,2026 (https://arxiv.org/html/2607.29602#bib.bib29)) 和 PIVOTSBench (Zhanget al\.,2026 (https://arxiv.org/html/2607.29602#bib.bib35)) 则探索关于社交场景和细粒度关系的推理。HumanSense (Qinet al\.,2026 (https://arxiv.org/html/2607.29602#bib.bib32)) 与我们的设置最为接近;其子任务之一要求模型判断视频中两人彼此熟悉到何种程度。有三点使我们的基准测试与众不同:(1) 每一对参与者都回答相同类型的提示,因此话题本身不能泄露答案;(2) 标签是客观的,记录了两人是否实际见过,而不是观察者判断他们有多亲近;(3) 我们收集了文本、音频和视频中匹配的人类评分,以进行直接比较。我们的刺激材料来自 Seamless Interaction 语料库 (Agrawalet al\.,2025 (https://arxiv.org/html/2607.29602#bib.bib1))。其他双人语料库也记录了熟识度——UDIVA (Palmeroet al\.,2021 (https://arxiv.org/html/2607.29602#bib.bib31)) 将每对标记为认识或不认识,NoXi (Cafaroet al\.,2017 (https://arxiv.org/html/2607.29602#bib.bib24)) 评估了搭档彼此熟悉的程度——但将其视为元数据,而不是用于预测的标签。 ## 3 方法 ### 3\.1 基准构建 样本取自 Seamless Interaction 数据集 (Agrawalet al\.,2025 (https://arxiv.org/html/2607.29602#bib.bib1)),限于来自三个录制地点(数据集的*vendor*字段)的自然互动,每个地点贡献了相当的二人组合比例。我们排除了数据集中即兴创作的互动,在这些互动中参与者被分配一种关系并被要求表演出来,因为我们的目标是在真实、非脚本化的行为上测量这项任务,而不是在表演行为上。由于该基准仅用于零样本评估,从不用于训练,我们将数据集所有预定义划分中的二人组合合并,而不是仅限于一个,以最大化质量过滤和分层设计(见下文)可从中抽取的池。 Seamless Interaction 会话包含许多不同的互动类型;我们仅使用 Either\-Or (EO) 破冰游戏,这是一个简短任务,其中一名参与者提出一个强制选择的假设性问题(例如,“你宁愿拥有飞翔能力还是隐身能力?”),然后二人讨论他们的答案。我们选择 EO 有三个原因:它标准化了对话背景,因为熟悉和陌生组合做的是同样的事情,任何信号必须来自二人如何回应,而不是他们讨论什么;它始终是会话中的第一次互动,因此每一对参与者都从他们互动历史的同一点取样;其内容携带的关于关系状态的信息很少,因此该任务不能仅从语义内容解决。相比之下,在自由对话中,状态可能通过内容泄露——对于熟悉者是共同历史和内部知识,对于陌生人则是结识的基础——这些线索是共同假设性问题在很大程度上抑制的。 EO 互动虽然围绕一个二选一的问题,但通常会持续几分钟。我们为每对参与者从该互动中抽取一个 20 秒片段,取自其早期或晚期部分(在关系和录制地点之间平衡),边界被吸附到(±5s)最近的回合开始处,使片段不会在话语中间开始或结束。渲染的视频刺激保留片段的音频轨道,因此视频条件是视听结合——可见行为连同语音——而音频和文本条件各自隔离单一通道;因此,人类评分者和视频模型在视频条件下都会同时接收到声音和画面。 最终集合完全交叉了录制地点、关系(熟悉/陌生人)和性别构成(同性别/混合性别组合),每个单元格 8 对(共 96 对),并且是参与者不相交的:没有任何个体出现在多于一组的二人组合中。交叉设计排除了录制地点和性别构成作为混杂因素(§4 (https://arxiv.org/html/2607.29602#S4))。不相交性使每一对二人组合成为独立观察,并防止识别泄漏:由于人类评分者在一次会话中会看到多个刺激,一个共享的个体可能会从较早的项目中被认出,让这种识别成为线索而不是关系本身。222这对我们的模型不是风险,因为它们在零样本下评估,没有学习身份的训练过程。 互动和片段级别的过滤(最少回合数、窗口内说话者平衡、音频轨道同步、互动长度、提示完整性;阈值见附录 A (https://arxiv.org/html/2607.29602#A1) 的表 A1 (https://arxiv.org/html/2607.29602#A1.T1))排除了无论关系如何都无法支持任务的片段,例如,一名参与者只说了几秒钟或音频轨道不同步。额外的基于 LLM 的审计检查每个互动的记录提示标签是否与其内容匹配。 ### 3\.2 人类评分 为了建立人类表现基线,我们在众包研究中收集了对关系类型的人类评分。对于每个刺激,评分者做出强制选择:熟悉或陌生人。在评分之前,每位评分者会阅读一个简短的说明屏幕。说明解释他们将阅读、收听或观看(取决于模态)来自真实对话的片段,其中两人正在玩“Either Or”破冰游戏,然后判断这对人以前是否见过(*熟悉*)还是第一次见面(*陌生人*)。完整的说明文本在附录 C (https://arxiv.org/html/2607.29602#A3) 中重现。 评分者通过 Prolific 招募,并在 GORILLA 上完成任务。我们进行了三个实验,每种模态一个(文本、音频、视频),每个实验约有 90 名评分者(94 名文本、94 名音频、92 名视频)。Prolific 预筛选和配额匹配确保了在美国居住的性别平衡的参与者池。
相似文章
Video-IFBench:评估多模态大语言模型在视频理解场景中的指令遵循能力
Video-IFBench 介绍了一个综合基准,用于评估多模态大语言模型在视频理解任务中遵循多样化指令的能力,涵盖多种约束条件和任务类型。
WorldBench:一个具有挑战性且视觉多样化的多模态推理基准
介绍WorldBench,一个视觉多样化的多模态推理基准,揭示了当前多模态大语言模型在视觉理解方面的显著局限性。
MCBench: 面向全模态大语言模型的多语境安全评估基准
MCBench是一个新基准,用于评估全模态大语言模型在视觉、音频和文本模态下的安全性。它包含1196个场景,并发现当前模型难以进行跨模态安全推理。
OmniAssistBench: 针对全能大语言模型的助理式交互基准测试
OmniAssistBench 是一个用于评估作为实时视频助理的全能大语言模型的基准测试,揭示当前模型在视觉提示、上下文保持和及时响应方面存在困难。
MemLens:大规模视觉-语言模型中多模态长期记忆的基准测试
MemLens是一个新的基准测试,通过多轮对话评估大规模视觉-语言模型的记忆能力。它比较了长上下文和记忆增强方法,揭示了二者的局限性,并推动了混合架构的发展。