从模态到命题:一种以语言为中心的多模态智能框架

arXiv cs.AI 论文

摘要

本文提出将多模态数据(图像、视频、文本)表示为原子命题(例如'人拿着杯子')的包,通过全局语义码本统一,实现可解释、组合化和跨模态理解。该框架在自动驾驶和开放世界数据上进行了演示。

arXiv:2607.16560v1 公告类型:新 摘要:我们提出了一种多模态数据的语言表示,其中任何观察(无论是图像、视频还是文本)都被表示为原子命题的包,即关于场景中实体、动作和关系的简单陈述。全局语义码本将这些统一为规范原子命题的共享词汇表,将每种模态和观察置于一个可解释的空间中,该空间涵盖从细粒度事实到高层概念,并可组合成更丰富的内容。这带来了可解释性与推理、跨模态理解与检索,以及组合性,从而支持复杂的多模态理解、丰富的数据策展和复杂的结构化检索。我们在自动驾驶和开放世界数据上演示了该框架。
查看原文
查看缓存全文

缓存时间: 2026/07/21 06:38

# 从模态到命题:一种面向多模态智能的语言中心框架
来源:https://arxiv.org/html/2607.16560
Maying ShenNVIDIA,Shizhe DiaoNVIDIA,Jialiang WangNVIDIA,Jingde ChenNVIDIA,Thomas BreuelNVIDIA,Pavlo MolchanovNVIDIA,Rafid MahmoodNVIDIA,University of Ottawa,Jose AlvarezNVIDIA

###### 摘要

我们提出一种用于多模态数据的语言表示方法,其中任何观察结果(无论是图像、视频还是文本)都被表示为一组原子命题,即关于场景中实体、动作和关系的基本声明。一个全局语义码本将这些原子命题统一为一个共享的标准命题词汇表,将每种模态和每次观察都置于一个可解释的空间中——这个空间既能涵盖细粒度事实,也能表达高层概念,并且可以组合成更丰富的表示。这带来了可解释性与推理能力、跨模态理解与检索功能,以及支持复杂多模态理解、丰富数据筛选和复杂结构化检索的组合性。我们在自动驾驶和开放世界数据上展示了该框架的有效性。

参考图注1:基于命题的语义表示流水线概览。上方:原子命题(AP)表示的优势。中间:框架概览。一个观察结果由MLLM处理,提取出一组自然语言原子命题,描述场景、物体、动作和事件。这些提取出的AP构成一个AP包,捕捉观察的语义内容。每个AP随后被映射到全局语义码本中最接近的标准条目,该码本是所有观察和模态共享的标准AP词汇表。最终的标准AP包提供了一种紧凑、可解释且可组合的表示,支持覆盖度分析、推理、检索和下游机器学习任务,同时随着新概念引入而保持可扩展性。下方:从观察结果中提取AP的流水线。

## 1 引言

学习表示多模态数据是现代人工智能的基础组成部分。视觉语言模型和多模态语言模型(MLLMs)学习共享的嵌入空间,能够捕捉图像、文本、音频和视频中的丰富语义信息,从而在识别、检索、生成和推理任务中表现优异[radford2021learning, liu2023visual, bai2023qwenvl, liang2026comprehensive]。尽管取得了成功,这些表示在很大程度上是不透明的[bommasani2021opportunities, kazmierczak2025explainability]。语义概念分布在高维嵌入中,使得难以识别相关信息、解释模型行为或进行结构化推理[elhage2022toy, bereska2024mechanistic]。这一局限性至关重要,因为现实世界理解本质上是组合性的,涉及实体、属性、动作和关系,这些组合成更高层次的语义[thrush2022winoground, changposition],而单一的表示混淆了这种丰富性。

受自然语言处理中经典的词袋(BoW)表示[jurafsky2009speech]启发,我们提出使用命题作为原子单位来表示来自任何模态(例如图像、视频、文本或音频)的观察数据样本。我们将“原子命题袋”(BoAP)定义为一组基本语义声明,例如“人拿着杯子”、“狗追球”或“车停在建筑物旁”。类似于BoW通过文档包含的单词来表示文档,BoAP通过观察结果引发的原子命题来表示该观察结果,从而将所有模态统一到一个共享的语义词汇表中。

将观察结果分解为这些可重用的语义原语,暴露了其组合结构。具体而言,复杂情况可以表示为简单概念的组合。因此,高层概念可以直接从我们可解释的原子命题中组合出来,从而实现显式的组合推理,而不是依赖于隐藏在密集嵌入空间中的隐式关系进行推理[cai2025naver, morishita2024enhancing]。BoAP并非取代密集嵌入,而是作为其补充。嵌入捕捉细粒度的感知信息,但仍然不透明,而AP暴露了可检查、可组合的显式语义结构。将两者结合,既保留了嵌入的感知鲁棒性,又增加了符号表示的可解释性和组合性。

在本文中,我们介绍了一个框架,该框架利用MLLM从多模态观察中提取原子命题(AP),并处理AP以处理语义相似和冗余的命题。由于同一概念可以用多种方式表达,我们将等价的AP归一化为单一的标准形式。这产生了一个全局语义码本,即共享的标准原子命题词汇表。图1展示了我们的框架概览。

我们展示了AP表示在自动驾驶和开放世界视频中的优势。这两种场景都有多样化的智能体、环境、基础设施和条件,这些组合成复杂的行为和交互。我们重点关注三个优势。首先是所有模态和观察结果的**描述统一**,使用单一的共享命题词汇表。因此,语义等价的情况无论其数据来源如何,都会映射到相同的AP。第二个是**组合性**,能够将复杂情况表达为AP的组合并进行推理。第三个是识别**知识覆盖度**的能力。通过将训练集和评估集都表示为AP包,我们可以识别模型在部署时必须处理但在训练中很少或从未见过的概念知识差距。由于AP是可组合的,我们可以在一个频谱上揭示这些差距,从对应于单个AP的高度细粒度差距到对应于AP组合的高度复杂差距。以这种方式量化覆盖度,可以实现有针对性的数据收集、数据混合、针对不可收集数据的合成数据生成,最终实现更鲁棒的模型。

## 2 从观察到命题:一个组合框架

我们的框架包含两个互补的组成部分。第一部分从单个多模态观察中提取语义原子命题。第二部分构建全局语义码本,统一整个数据集中语义等价的AP。这些组件共同将异构的多模态输入转换为一个共享的、可解释的语义表示。

图1展示了完整的流水线。我们从任何模态的观察开始,例如视频、图像、文本日志或传感器流。多模态大语言模型(MLLM)首先用自然语言描述观察结果,然后我们从该描述中提取一组AP,为观察结果生成一个AP包(BoAP)。接着,我们将每个AP映射到全局语义码本中的标准形式,该码本是一个在整个语料库中共享的标准AP词汇表。结果是标准AP包,它将每次观察都置于一个共同的、可解释的语义空间中。本节剩余部分将详细说明每个组件。第2.1节描述如何从单个观察中提取AP,第2.2节描述如何跨语料库构建码本。

### 2.1 从多模态输入中提取命题

考虑一个跨越多种模态(如图像、视频、文本、音频或传感器流)的多模态观察 $x$。我们的目标是提取一组捕捉其语义内容的AP,其中每个AP都是一个基本的语义声明,描述观察中的实体、属性、动作、事件或关系。这种表示保留了语义上显著的信息,同时丢弃了对场景理解无贡献的干扰细节。

我们的提取流水线以观察结果的自然语言描述作为输入。如图1所示,它包括三个阶段:(i) 蒸馏,将描述缩减为一组声明;(ii) 命题转换,将这些声明转换为AP;(iii) 干扰过滤,移除与任务无关的修饰语。当在数据集上操作时,得到的AP在所有观察之间对齐,以使语义等价的概念共享一种共同的表示。

#### 2.1.1 蒸馏

蒸馏将输入描述转换为一组简单的、单从句的陈述句,每个陈述句表达一个单一事实。这一步去除了叙述和风格上的复杂性,分离了嵌套从句,同时保留了显著内容。例如,描述“一个行人正在穿过一条湿漉漉的街道,同时一辆车在红灯前等待”被蒸馏为“行人在过马路”、“街道是湿的”、“车在等待”和“交通灯是红色的”。我们对每个描述使用一次Gemini-2.5-Pro调用来执行蒸馏,使用附录中的提示(图9)。单个模型效率高,在实践中效果良好;在计算资源允许的情况下,可以通过集成或对比多个LLM来使该阶段更鲁棒。

#### 2.1.2 命题转换

命题转换将每个蒸馏后的句子转换为一个或多个AP。AP是最小的自包含声明,表达一个单一事实,捕捉一个实体、属性、动作、事件或关系,不能再进一步拆分而不失去意义。每个AP由LLM生成和处理,我们将其视为一个离散的语义标记,可以在观察、模态和领域之间重用。形式上,我们将AP写作

$$p = (r, a_1, \ldots, a_k),$$  (1)

其中 $r$ 是关系或谓词,$a_i$ 是其名词锚定的参数,即它所关联的实体或属性。整个观察结果由其AP集合表示:

$$P(x) = \{p_1, p_2, \ldots, p_n\}.$$  (2)

我们使用LLM通过结构化分解提示来生成AP。该提示通过将并列结构展开为单独的AP并解析代词和对实体名称的引用,将每个蒸馏后的句子重写为一个或多个AP。

在实践中,我们通过两遍提示使用Gemini-2.5-Pro实现这一点。首先,我们识别出显著的实体,然后识别它们之间的主谓宾关系,主语和宾语被限制在提取的实体列表中。每个观察的输出是一个三元组的JSON集合,每个三元组被视为一个AP。

继续进行中的示例,蒸馏后的句子“行人在过马路”、“街道是湿的”、“车在等待”、“交通灯是红色的”被转换为AP集合:

$$
\begin{split}
P(x) = \{& \text{行人过马路},\ \text{街道是湿的},\\ & \text{车在等待},\ \text{交通灯是红色}\}.
\end{split}
$$  (3)

每个AP还可以被分配到一个语义类别,例如天气、运行设计领域、智能体行为、传感器状态、智能体交互或道路基础设施,从而可以系统地组织和推理AP。对于自动驾驶,我们将其归入一个类型化的本体,包括智能体、动作、环境、基础设施、交互和意图。最后,请注意,与场景描述或自由形式描述不同,AP是独立的且可组合的。因此,同一个AP可以在许多观察和模态中重复出现,并在语料库层面上进行聚合。

参考图注2:用于标准AP生成的全局语义码本构建。从语料库中所有观察中提取的已处理AP首先根据频率、短语长度和词典序进行聚合和排序。然后,一种基于领导的聚类策略迭代地选择高排名AP作为群组领导,并使用基于嵌入的相似度来识别语义相似的邻居。随后由一个LLM验证可能的相似AP,检查这些AP是否与领导语义等价,并拒绝错误分配的AP。经过验证的群组被整合为标准聚类,其中领导充当代表共享语义概念的标准AP。最终的群组领导集合形成一个全局语义码本,提供一个语料库范围的标准AP词汇表,可用于将观察级别的AP映射到一个统一且可解释的语义表示。
#### 2.1.3 干扰过滤

命题转换倾向于完整性,因此提取出的AP通常带有与任务无关的修饰语,例如颜色、大小和数量。难点在于,什么算是干扰本身是任务特定的,难以明确界定。同一个属性可能对一个任务是噪声,对另一个任务却至关重要。例如,颜色通常无关紧要,但在任务涉及红色交通灯或紧急车辆时则至关重要。因此,决定移除什么需要任务知识,我们将默认的修饰语集合(即颜色、大小和数量)视为一种实用且可配置的选择,而非普遍规则。

干扰过滤有两个目标。首先,它从AP中移除干扰修饰语。其次,它规范化细微变化,例如冠词、复数形式和专有名词(例如特定汽车品牌)。这些共同移除了大量词汇重复。我们收集所有跨提取AP的实体参数,并使用Gemini-2.5-Pro来剥离非必要的修饰语(提示见附录图10)。我们仅对实体参数应用此去噪处理,保留谓词部分的原始形式。

### 2.2 全局语义码本构建

同一概念往往有不同的表述方式。例如,“行人过马路”、“人在过马路”和“行人步行穿过街道”都表示同一类事件。这种冗余使命题空间碎片化,削弱了检索、覆盖度分析和表示学习等下游任务。为了移除这种冗余,我们构建一个全局语义码本,将每个AP映射到整个语料库共享的标准形式。

算法1详细说明了我们的过程步骤,如图2所示。首先,候选收集根据出现频率、特异性和字典序对所有命题进行排序。其次,基于领导的聚类使用嵌入相似度来围绕每个高频AP收集一个候选变体集合。第三,基于LLM的验证检查哪些候选真正共享其含义。最后,幸存下来的代表形成标准码本。前两步倾向于召回,低成本地收集可能的变体,而验证则保证精度,确保只有真正等价的AP被合并。本节剩余部分将依次详细说明每个步骤。

#### 2.2.1 候选收集

令

$$\mathcal{P} = \bigcup_{x \in \mathcal{C}} P(x),$$  (4)

表示从语料库 $\mathcal{C}$ 中提取的所有过滤后的AP的多重集。候选收集将这个池子转换为一个单一的排序列表,以便在形成码本时首先考虑最频繁的概念。对于每个唯一的命题 $p_i \in \mathcal{P}$,我们计算其在语料库中的频率。

相似文章

视觉的代价:在单一范式中实现可信的多模态推理

Hugging Face Daily Papers

本文挑战了当前视觉语言模型忠实地融合多模态数据的假设,提出了一种基于信息论的 Modality Translation Protocol,并引入了新指标(Toll、Curse、Fallacy of Seeing)来评估可信度,而非传统的多模态增益。

超越NL2Code:多模态代码智能的结构化综述

Hugging Face Daily Papers

本综述论文系统性地回顾了从截图和图表等视觉输入中生成和推理代码的多模态代码智能系统,将方法归类到图形用户界面、科学可视化、结构化图形以及新兴框架中,同时提出了以验证为中心的未来研究方向。

超越文本主导:理解全模态大语言模型的模态偏好

Hugging Face Daily Papers

# 论文页面 - 超越文本主导:理解全模态大语言模型的模态偏好 来源:[https://huggingface.co/papers/2604.16902](https://huggingface.co/papers/2604.16902) ## 摘要 研究发现,原生全模态大语言模型表现出相对于文本的视觉偏好,模态偏好在模型中后层逐步涌现,并可用于诊断跨模态幻觉。原生[全模态大语言模型](https://huggingfa

人工神经网络中的多模态神经元

OpenAI Blog

OpenAI 在 CLIP 中发现了多模态神经元,它们在不同模态(视觉、符号、文本)中对同一概念做出响应,这与生物神经元的行为相似,解释了该模型在困难视觉任务上的鲁棒性。这项可解释性研究为我们理解视觉-语言模型如何组织和表示抽象概念提供了深刻见解。