The Unwritten Benchmark: 多模态机器学习在抽象感知推理中的新挑战

arXiv cs.AI 论文

摘要

本文介绍了The Unwritten Benchmark,这是一个用于评估多模态AI模型抽象感知推理能力的新挑战,揭示了人类与当前模型如GPT-4o和Gemini 2.5-Pro之间的显著性能差距。

arXiv:2608.14558v1 宣布类型:新 摘要:当前多模态模型在识别静态视觉和听觉内容方面表现出色。然而,它们在抽象感知推理方面的能力,即从动态、生成过程中推断未见信息,仍然是一个关键且尚未充分探索的前沿。本文介绍了The Unwritten Benchmark,这是一个旨在探测这种抽象感知和认知能力的新挑战。我们将核心任务定义为声动学词语推断:模型必须仅凭笔划音频和手部运动视频,在没有任何可见墨迹痕迹的情况下,解读出不同书写风格的单词。我们的评估结果揭示了人类与机器性能之间的巨大差距:人类参与者达到了高排序字母准确率(超过80%),而领先的多模态机器学习模型,包括GPT-4o和Gemini 2.5-Pro,却表现不佳,准确率未能超过10%。此外,我们发现模型中存在一种矛盾的融合效应,即同时提供两种模态信息往往会降低性能而非提升。这一发现表明,它们在此认知任务中合成互补感知线索的能力存在根本性缺陷。这些发现突显了跨模态因果推理和对微观运动学理解的显著局限性,而这些对于此类认知和直觉感知推理至关重要。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:41

# 隐形基准:抽象感知推理对多模态机器学习的新挑战
来源:https://arxiv.org/html/2608.14558
作者:Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang(亚利桑那州立大学)\{arya\.yadav, nyilmaz3, yz\.yang\}@asu\.edu 项目主页:(https://riri-y.github.io/unwritten-benchmark/)

###### 摘要

当前多模态模型在识别静态视觉和听觉内容方面已展现出卓越能力。然而,它们进行抽象感知推理的能力——即从动态、生成性过程中推断未见信息——仍是一个关键且未充分探索的前沿。本文我们提出“隐形基准”,这是一个旨在检验这种抽象感知与认知能力的新挑战。我们将核心任务定义为声动词推理:模型必须仅凭笔尖刮擦的音频和手部动作的视频,在完全看不见墨迹的情况下,破译三种不同书写风格下书写的单词。评估结果揭示了人类与机器表现之间的巨大鸿沟:人类参与者能达到超过80%的有序字母准确率,而领先的多模态机器学习模型(包括GPT-4o和Gemini 2.5-Pro)表现挣扎,准确率均未超过10%。此外,我们发现模型中存在一种矛盾的融合效应:同时提供两种模态信息往往会使性能下降而非提升。这表明模型在此类认知任务中综合互补感知线索的能力存在根本性缺陷。这些发现凸显了跨模态因果推理以及理解此类认知和直觉感知推理所需微观运动学的显著局限性。

## 1引言

多模态机器学习领域已取得显著进展,主要得益于开发出能够实现感知的模型。这些模型在视觉问答(VQA)\[2 (https://arxiv.org/html/2608.14558#bib.bib1)\]和图像描述\[30 (https://arxiv.org/html/2608.14558#bib.bib15)\]等任务中表现优异,其主要挑战是将一种模态中明确的静态特征(如狗的图像)与另一种模态中相应的概念(“狗”这个词)关联起来。这一成功建立在识别、描述和关联不同感官输入中共现内容的基础之上。尽管功能强大,但这种范式主要测试模型在识别和描述任务上的性能,关联的是数据中已明确存在的描述性特征。

然而,一种更深层次、更具人类本质的感知形式涉及“生成过程的感知”:观察动态的生成过程并推断其正在创造的抽象结果\[19 (https://arxiv.org/html/2608.14558#bib.bib30)\]。这种认知能力超越了静态关联,因为从动态物理过程中推断抽象结果需要关于因果关系、运动和意图的推理。它要求模型综合来自不同感官的一系列微弱的时序线索,以理解正在创造的是什么,即使最终产物本身是不可见的。人类不断地进行这种直觉推理;我们从细微的语调变化和肢体语言中推断说话者的意图,或通过将预备动作的视觉信息与其相关声音结合起来理解行动的目标\[1 (https://arxiv.org/html/2608.14558#bib.bib33)\]。

我们认为,这种关键能力在现代人工智能中仍是一个显著的盲区。这种差距持续存在的主要原因在于缺乏旨在隔离和衡量这种特定感知-认知技能的基准测试。现有基准擅长测试对显式内容的识别,但未能探究模型从创造的物理过程中推断抽象概念的能力。因此,当前机器感知与人类面向过程的直觉之间的巨大鸿沟在很大程度上尚未得到解决。

(参见图注)
图1:隐形基准概述。单词通过组合单个字母的视听记录合成。每个样本以三种模态呈现:静音视频、仅音频和音频+视频(融合音频)。视频与音频+视频的提示词相同,仅输入不同。人类能可靠地识别书写单词,而多模态大语言模型(MLLMs)常常失败。
为应对这一局限,我们引入了隐形基准,这是一项新型诊断任务,将挑战从静态识别转向动态推理。声动词推理任务要求模型在完全看不到墨迹的情况下破译正在书写的单词。唯一提供的信息是手部运动的实时运动学(视频)和笔在纸上刮擦的相应听觉反馈(音频)。这个对人类认知上直观的任务,对于当前最先进的多模态大语言模型(MLLMs)来说却极其困难。我们的主要贡献如下:

- • 一个新型多模态基准:我们提出了一个包含三种书写风格同步音频和视频记录的新颖数据集,记录中没有可见墨迹,为抽象多模态感知创造了独特挑战。
- • 一个可扩展的数据集生成框架:我们详细描述了一种方法,通过程序化拼接一个包含高质量、实时录制字母原始样本的基础库,来创建大规模、鲁棒的单词数据集。这种模块化设计确保了一致性,并允许研究人员生成新的单词列表,甚至将该基准扩展到使用拉丁字母的其他语言。
- • 揭示模型的重大局限性:我们证明,包括GPT-4o和Gemini 2.5-Pro在内的最先进模型在此任务上始终且彻底地失败。最佳模型的有序字母准确率低于10%,这凸显了其推理能力与超过80%的人类表现之间存在巨大差距。
- • 识别多模态融合中的悖论:我们提供证据表明,对于这种声动词任务,融合音频和视频模态并不能一致地提升AI性能,甚至可能有害。这种“矛盾的融合效应”表明,当前架构不适合综合复杂的、因果关联的时序线索。

## 2相关工作

**手写识别基准及其局限性**:离线手写数据集,如IAM数据库\[25 (https://arxiv.org/html/2608.14558#bib.bib16)\]、NIST\[8 (https://arxiv.org/html/2608.14558#bib.bib3)\]和EMNIST\[15 (https://arxiv.org/html/2608.14558#bib.bib19)\],由静态的书写文本图像组成,用于光学字符识别。这些语料库对于评估手写识别、书写者识别和单词定位\[18 (https://arxiv.org/html/2608.14558#bib.bib2)\]等任务具有重要作用,但它们将书写视为静态图像而非动态过程。相比之下,在线手写数据集,如IAM-OnDB\[21 (https://arxiv.org/html/2608.14558#bib.bib18)\]和UNIPEN项目\[16 (https://arxiv.org/html/2608.14558#bib.bib17)\],捕捉了笔随时间变化的轨迹,记录了带有时间和笔抬起/按下事件的坐标序列\[18 (https://arxiv.org/html/2608.14558#bib.bib2)\]。这种时序线索可以通过揭示笔画顺序和速度来使识别更容易\[17 (https://arxiv.org/html/2608.14558#bib.bib13)\]。然而,基于轨迹的模型假设能完全访问笔路径,并依赖数字平板或运动传感器等专用硬件,这在许多现实场景中并不实用。如果笔画数据有噪声、部分缺失或不可用,其性能会急剧下降。此外,纯粹基于轨迹的方法忽略了人类使用的其他线索——例如笔在纸上的刮擦声或上下文场景线索。一些新兴工作已开始探索这些替代信号:例如,WritingHacker系统\[31 (https://arxiv.org/html/2608.14558#bib.bib20)\]表明,智能手机捕获的笔在纸上的音频可用于部分推断书写的文本。虽然前景看好,但此类旁路方法仍处于初步阶段。总之,现有的手写基准并未解决必须在没有任何可见墨迹痕迹的情况下理解书写场景的问题。我们的基准提供了此类首个挑战,要求模型仅从手部运动和笔声音的间接声动线索推断书写的单词,完全移除了显式的视觉痕迹。

**多模态动作与声音识别**:除了手写,许多多模态数据集结合视觉和听觉流来识别动作。视频基准,如Kinetics\[5 (https://arxiv.org/html/2608.14558#bib.bib4)\]和EPIC-Kitchens\[9 (https://arxiv.org/html/2608.14558#bib.bib5)\],提供日常活动的片段(通常带有对应音频)用于动作分类。大型精选音频集合,如AudioSet\[11 (https://arxiv.org/html/2608.14558#bib.bib6)\],涵盖数百种声音事件类别,而音视频集合,如VGG-Sound\[7 (https://arxiv.org/html/2608.14558#bib.bib7)\],则将视频片段与其同步声音配对。更专业的数据集提供了更丰富的上下文:Ego4D\[13 (https://arxiv.org/html/2608.14558#bib.bib10)\]是一个自我中心的视频语料库,支持情节记忆回忆和预测等任务;CREMA-D\[4 (https://arxiv.org/html/2608.14558#bib.bib11)\]包含标注有情绪的人脸视频和语音片段;近期的数据集,如VGG-Sound Source\[6 (https://arxiv.org/html/2608.14558#bib.bib12)\]和STARSS23\[28 (https://arxiv.org/html/2608.14558#bib.bib14)\],增加了空间视听标注以识别声音来源。这些基准推动了多感官学习,但其任务涉及将可观察线索直接映射到标签。相比之下,我们的工作引入了一项新任务,将挑战从识别可观察事件转向推断抽象的、符号性的结果——单词,该单词本身从未可见或可闻。

**多模态融合策略与挑战**:为利用多种模态,研究人员开发了各种融合策略。早期融合在特征层整合模态,在输入模型之前拼接音频和视觉特征,而晚期融合则在决策层结合特定模态的预测\[3 (https://arxiv.org/html/2608.14558#bib.bib8)\]。更复杂的是跨模态或中期融合方法\[23 (https://arxiv.org/html/2608.14558#bib.bib31)\],其中模态通过注意力机制或在中间层联合训练进行交互。然而,融合方法的一个共同问题是它们依赖统计相关性,这常常导致模型抓住训练数据中存在的巧合模式,而不是学习信号为何共现\[10 (https://arxiv.org/html/2608.14558#bib.bib32)\]。例如,一个多模态模型可能仅仅因为存在特征性声音就错误地预测一个动作,即使在给定场景中该声音的来源与此无关。这种失败表明模型学会了“X和Y经常一起发生”,而不是“X是由Y引起的”。这些静态相关性可能使模型偏向于表面线索\[20 (https://arxiv.org/html/2608.14558#bib.bib9)\]。确实,标准的融合策略,无论是早期特征集成还是晚期预测合并,通常鼓励学习巧合模式而非真正的跨模态推理\[3 (https://arxiv.org/html/2608.14558#bib.bib8),20 (https://arxiv.org/html/2608.14558#bib.bib9)\]。因此,模型可能抓住表面的视听线索,在需要更深层次推理时失败。值得注意的是,现有的音视频基准都没有迫使模型从给定模态推断未观察到的事件或状态。隐形基准旨在填补这一关键空白,挑战模型超越统计相关性,通过从运动和声音这两个不同的、微妙的、因果关联的表现中推断出隐藏的抽象产物(单词),来进行因果综合。

## 3数据集与方法

我们的工作——隐形基准——核心是一个新颖、精心构建的多模态数据集,旨在严格测试AI的抽象推理能力(见图5 (https://arxiv.org/html/2608.14558#A1.F5))。它包含无可见墨迹痕迹的手写同步音频和视频记录。以下详述的数据集创建过程确保了数据的一致性、完整性和可复现性。

### 3.1数据收集

我们数据集的基础是实时录制的单字母大小写样本集合。我们招募了三名参与者,每人拥有独特且一致的书写风格,遵循美国标准字母表和英国草书的标准笔画模式。参与者书写字母时遵循的笔画模式,是从美国和英国小学生提供的标准字母描红练习纸上复制而来的(见附录A.4)。对于前两名参与者,我们以他们偏好的书写风格(美国标准或英国草书)录制了英语字母表全部26个大写和小写字母。第三名参与者贡献了一个专门的“重描”集,包含17个具有高笔画方差和笔画重复的字母,如‘a’、‘o’、‘i’、‘p’等,以专门测试模型在常见手写异常值和特殊书写风格上的表现。总之,在三种模态(音频、静音视频和同步音频+视频)下,收集了以下书写风格:

1. 1\. 标准体:传统的、非连笔的字母风格。
2. 2\. 草书体:经典的、流畅的、连笔的风格。
3. 3\. 重描体:笔画有意重复描写的风格,代表常见的手写习惯和异常值。

至关重要的是,录制是使用干笔在空白白纸上进行的,确保视觉模态仅包含手部运动的运动学信息,没有可见墨迹。音频和视频使用靠近笔尖的高分辨率相机和高保真麦克风同步捕获。为实现亚毫秒级精度,每个实时录制的音频和视频文件对都经过手动同步,这一过程保证了我们基础多模态数据的完整性。这产生了一个包含409个单字母级别文件的基础集,构成了我们合成单词数据集的构建块。

除了字母原始样本,我们还录制了一组较小的、完全自然的完整单词集,作为我们合成数据的验证集,以及未来分析自然协同发音效应的基础。这产生了309个实时录制的单词文件集合,同样涵盖所有三种风格和模态。

### 3.2合成隐形基准数据集

为创建一个鲁棒且可扩展的单词级基准,我们开发了一个半合成数据集,通过程序化拼接我们的实时录制字母片段。这种方法使我们能够从一组较小的高质量、实时录制的原始样本生成大规模、一致的单词级数据集。

令 \mathcal{L}=\{'a','b',\dots,'z'\} 为所有小写英文字母的集合。
令 \mathcal{S}=\{\text{Standard, Cursive, Retrace}\} 为书写风格的集合。
令 \mathcal{M}=

相似文章

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

PerceptionBench:评估多模态大语言模型中的原子视觉感知

Hugging Face Daily Papers

PerceptionBench 是一个基准测试,旨在评估多模态大语言模型(MLLMs)的原子视觉感知能力,采用了由十种原子感知能力组成的自底向上分类法。对16个前沿MLLM的测试结果显示,没有任何模型达到60%的准确率,表明视觉感知问题在很大程度上仍未解决。

推进大型多模态模型中的创造性物理智能

arXiv cs.AI

本文介绍了MM-CreativityBench,这是一个用于在物理约束环境下评估大型多模态模型创造性工具使用的基准,并提出了基于功能可见性的对齐方法,利用直接偏好优化来减少幻觉并提高基于事实的推理。