LatentVerse:一种理解多模态潜在表示中共享和模态特定信息的框架

arXiv cs.LG 论文

摘要

LatentVerse 是一个框架,提供基于网络的可视化分析平台和命令行界面,用于分析多模态潜在表示,实现将嵌入分解为共享和模态特定组件,特别适用于生物医学应用。

arXiv:2609.12364v1 Announce Type: new 摘要:潜在嵌入已成为现代机器学习中的核心数据抽象,尤其在生物医学领域,基础模型越来越多地用于编码多模态数据,如临床文本、医学图像、组学和生理信号。然而,这些表示的效用和价值取决于对其质量、结构和所编码信息的理解。现有评估表示的分析工作流仍分散在自定义脚本、孤立指标中,最重要的是缺乏多模态分析,限制了可访问性和可重复性。我们提出 LatentVerse,一个表示分析资源,结合了基于网络的可视化分析平台用于可访问的、报告驱动的探索,以及命令行界面用于可扩展的技术工作流。LatentVerse 统一了对各种表示质量指标的诊断,并通过将嵌入分解为共享和模态特定组件扩展到多模态设置。我们通过受控的单模态和多模态模拟、针对真实生物医学嵌入的发现导向分析,以及跨越多样用例的用户研究来评估 LatentVerse。通过支持对潜在空间的全面和可解释评估,LatentVerse 使得基础模型表示在生物医学和数据科学应用中更易于理解。
查看原文
查看缓存全文

缓存时间: 2026/09/14 08:42

# 1引言
来源:https://arxiv.org/html/2609.12364
LatentVerse:用于理解多模态潜在表征中共享与模态特定信息的框架

Majd Alafrange1,2,3, Samuel Friedman1, John Kitonyo1, Sana Tonekaboni1,2,3,†, Mahnaz Maddah1,∗,†

1麻省理工学院与哈佛大学Broad研究所健康机器学习中心(ML4H),美国马萨诸塞州剑桥市 2麻省理工学院,美国马萨诸塞州剑桥市 3施密特中心,麻省理工学院与哈佛大学Broad研究所,美国马萨诸塞州剑桥市 †共同指导 ∗通讯作者

通讯作者:Mahnaz Maddah,博士 高级主任,健康机器学习 麻省理工学院与哈佛大学Broad研究所 美国马萨诸塞州剑桥市Main街415号,邮编02142 邮箱:[maddah@broadinstitute\.org](mailto:[email protected]) 电话:\(617\) 714\-7000

###### 摘要

潜在嵌入已成为现代机器学习中的核心数据抽象,尤其在生物医学领域,基础模型正被越来越多地用于编码临床文本、医学影像、组学数据和生理信号等多模态数据。然而,这些表征的效用和价值取决于对其质量、结构以及所编码信息的理解。现有的表征评估分析流程仍分散于各种定制脚本、孤立的度量指标之中,更重要的是缺乏多模态分析能力,这限制了其可访问性和可重复性。我们提出了LatentVerse,一个表征分析资源,它结合了一个基于网络的、可访问且支持报告驱动的探索性可视化分析平台,以及一个用于可扩展技术工作流程的命令行接口。LatentVerse统一了各种表征质量指标的诊断方法,并通过将嵌入分解为共享组件和模态特定组件,将其扩展到多模态场景。我们通过受控的单模态与多模态模拟、基于真实生物医学嵌入的探索性分析,以及涵盖多种用例的用户研究对LatentVerse进行了评估。通过支持对潜在空间进行深入且可解释的评估,LatentVerse使得基础模型表征在生物医学和数据科学应用中更易于理解。

## 1引言

潜在表征(嵌入)已成为现代机器学习中的标准数据抽象,其应用范围涵盖自然语言处理到计算机视觉[3 (https://arxiv.org/html/2609.12364#bib.bib3)]。特别是,近期向大规模预训练后再进行特定任务适应的范式转变,进一步提升了其重要性[4 (https://arxiv.org/html/2609.12364#bib.bib4),1 (https://arxiv.org/html/2609.12364#bib.bib1)]。嵌入支持知识发现[14 (https://arxiv.org/html/2609.12364#bib.bib14)],可在不同任务中复用[21 (https://arxiv.org/html/2609.12364#bib.bib21),2 (https://arxiv.org/html/2609.12364#bib.bib2)],在零样本设置中跨模型和检查点进行比较[15 (https://arxiv.org/html/2609.12364#bib.bib15)],并在原始数据不易访问时于团队或机构间共享[11 (https://arxiv.org/html/2609.12364#bib.bib11)]。因此,理解嵌入空间的质量已成为现代机器学习工作流的重要组成部分。

当仅靠下游评估不足时,这种需求尤为迫切[33 (https://arxiv.org/html/2609.12364#bib.bib33)]。从业者通常需要在昂贵的微调之前比较表征,并评估在有限标签、噪声输入或领域偏移情况下嵌入是否仍然可靠。在多模态场景中,这些挑战更为严峻,因为多模态在现实机器学习应用中正日益普遍。与单模态嵌入不同,多模态表征可能纠缠来自不同来源的信息,然而目前缺乏系统评估这种结构的成熟工具。因此,以表征为中心的诊断提供了一种更直接评估潜在空间的方法,使用诸如聚类能力、解纠缠性、鲁棒性、表达能力和可预测性等指标,来刻画信息在单模态和多模态嵌入中是如何组织、保存和暴露的。

近期科学机器学习资源凸显了可访问且可重复分析平台日益增长的价值,但现有工具仅部分解决了表征评估问题。通用的嵌入查看器,如TensorBoard嵌入投影仪[25 (https://arxiv.org/html/2609.12364#bib.bib25)]、Emblaze[24 (https://arxiv.org/html/2609.12364#bib.bib24)]、WizMap[31 (https://arxiv.org/html/2609.12364#bib.bib31)]和Embedding Atlas[22 (https://arxiv.org/html/2609.12364#bib.bib22)]支持交互式投影和邻域探索,而特定领域的系统,如Latent Space Explorer及其他科学网络应用,在特定模态或应用领域内提供引导式分析[17 (https://arxiv.org/html/2609.12364#bib.bib17),6 (https://arxiv.org/html/2609.12364#bib.bib6),19 (https://arxiv.org/html/2609.12364#bib.bib19)]。与此同时,基准测试和数据平台更强调下游任务性能或大规模数据访问,而非以表征为中心的诊断[13 (https://arxiv.org/html/2609.12364#bib.bib13),7 (https://arxiv.org/html/2609.12364#bib.bib7),9 (https://arxiv.org/html/2609.12364#bib.bib9)]。综上所述,这些工具确立了交互式探索和可访问基础设施的价值,但没有任何工具提供一个统一的、与模型无关的工作流,用于系统性的潜在空间评估,该评估需跨越单模态和多模态设置,并能定位信息在不同模态中的分布。

为填补这一空白,我们提出了LatentVerse,一个基于原始LatentVerse工具包[29 (https://arxiv.org/html/2609.12364#bib.bib29)]构建的表征分析工具。LatentVerse将一系列表征诊断方法整合到一个统一的、与模型无关的框架中,并通过信息解耦[30 (https://arxiv.org/html/2609.12364#bib.bib30),28 (https://arxiv.org/html/2609.12364#bib.bib28)]将其扩展到多模态表征,将共享的潜在信息与模态特定的潜在信息分离,以便独立分析每个组件。这使得直接推断多模态系统中有用信息的位置,以及不同表征组件如何贡献于性能和可解释性成为可能。

我们从三个轴评估LatentVerse:通过受控的单模态与多模态模拟,测试其诊断方法能否恢复已知结构;通过真实生物医学嵌入分析,展示其在探索发现中的效用;以及通过用户研究,评估其在实际分析工作流中的价值。通过将这些能力整合到单一工作流中,LatentVerse有助于弥合表征学习研究与应用实践之间的鸿沟。

## 2 LatentVerse框架

LatentVerse是一个与模型无关的框架,由网络应用程序和命令行接口组成,用于评估潜在表征。用户提供一个或多个表征矩阵及可选标签,选择一项诊断测试,然后收到一份结构化报告,该报告结合了量化指标、交互式可视化及描述性摘要。该框架支持单模态评估以及第2.4节(https://arxiv.org/html/2609.12364#S2.SS4)描述的多模态分析。图1(https://arxiv.org/html/2609.12364#S2.F1)提供了系统和用户工作流的概览。高层框架在以下章节描述,有关实现、部署和界面工程的更多细节见附录A.1(https://arxiv.org/html/2609.12364#A1.SS1)。

参考说明图1:LatentVerse框架概览。A) 系统架构图,展示了共享的评估流程,从通过Web和Python库访问,到数据摄取、表征诊断、多模态分解以及报告生成。B) 用户工作流,从选择评估测试并上传嵌入,到通过可导出的报告和AI生成的摘要检查结果并交流发现。### 2.1表征质量维度

LatentVerse评估潜在表征的五个互补属性:聚类能力、解纠缠性、表达能力、下游可预测性和鲁棒性。这些共同提供了超越仅下游任务准确性的多维度表征质量视图。LatentVerse为每个评估类别使用既定的指标和测试,以提供一致的工作流程。指标的详细描述和定义见附录A.3(https://arxiv.org/html/2609.12364#A1.SS3)。

##### 聚类能力。
聚类能力测试评估表征在潜在空间中是否形成紧凑且分离良好的组。LatentVerse结合了内在指标(包括轮廓系数[23 (https://arxiv.org/html/2609.12364#bib.bib23)]和Davies-Bouldin指数[10 (https://arxiv.org/html/2609.12364#bib.bib10)])以及标签感知度量(如归一化互信息[26 (https://arxiv.org/html/2609.12364#bib.bib26)]和聚类可学习性[18 (https://arxiv.org/html/2609.12364#bib.bib18)])。生成的报告帮助用户判断嵌入是否支持有意义的分组结构,以及该结构是否与已知标签对齐。

##### 解纠缠性。
解纠缠性测试评估不同的变化因素是否被编码在独立且可解释的潜在维度中。LatentVerse报告互补的指标,包括DCI框架[12 (https://arxiv.org/html/2609.12364#bib.bib12)]、互信息差[8 (https://arxiv.org/html/2609.12364#bib.bib8)]、分离属性可预测性[16 (https://arxiv.org/html/2609.12364#bib.bib16)]和总相关性[32 (https://arxiv.org/html/2609.12364#bib.bib32)]。这些输出帮助用户区分那些信息被清晰分解的表征和那些相关信息分散在许多相关维度中的表征。

##### 表达能力。
表达能力测试评估预测信息在潜在维度中分布的效率。为测量这一点,LatentVerse执行维度消融,逐步移除最高方差的维度,并测量预测性能的相应下降,通过紧凑性和内在维度来总结这一行为。这使用户能够评估有用信号是集中的、冗余的还是扩散分布的。

##### 下游可预测性。
下游可预测性测试测量可以从潜在空间中恢复多少任务相关信息。LatentVerse评估一系列复杂度递增的监督探针,从线性模型到多层感知机,并根据任务报告标准的预测指标,如准确率、AUROC、宏F1和$R^{2}$。这区分了直接可预测的表征、需要更复杂解码器的表征以及包含少量可用于目标标签的有效信号的表征。

##### 鲁棒性。
鲁棒性测试评估表征在扰动下保持稳定的程度。LatentVerse向潜在空间注入高斯噪声,并跟踪基于聚类或探针性能的相应退化情况。相应的退化曲线揭示了嵌入在噪声下是具有韧性还是脆弱,提供了表征可靠性的实用视角。

### 2.2统一的评估工作流

该框架围绕一个三步工作流程组织。首先,用户选择他们想要评估的表征类型(单模态或多模态)以及一个评估测试及其特定选项。其次,他们上传一个或多个表征文件,以及可选的标签和比较设置。然后,LatentVerse执行请求的分析,并将结果呈现为一份报告,该报告包含交互式可视化、指标表、可导出输出以及可选的描述性摘要。至关重要的是,相同的流程驱动单模态和多模态分析,并通过网络应用程序和命令行接口以相同的方式暴露,因此分析可以在易于访问的探索和可扩展的、可脚本化的工作流之间切换,而无需更改底层的诊断方法。一个一致性测试套件验证了两个接口在相同输入上产生数值相同的结果——相对容差为$10^{-9}$——因此可以在交互式环境中开发分析,然后从脚本中重新运行而无需更改。支持在大型嵌入矩阵上实际使用、可扩展摄取、异步作业执行和可恢复上传的实现细节描述于附录A.1(https://arxiv.org/html/2609.12364#A1.SS1)。

### 2.3可视化分析和报告生成

该界面旨在支持技术和非技术用户。引导式配置、内置文档、示例报告和上下文解释降低了入门门槛,而比较卡片、高级选项和导出功能则支持更详细的分析工作流程。每份报告结合了三个协调视图:指标表、特定测试的交互式可视化,以及点击即得的自然语言摘要,使数字证据、视觉证据和解释得以共同呈现,而非作为孤立的产物。在所有测试中,目标都是使潜在空间的特性更易于检查、比较和解释。摘要由服务器端、模板约束的查询生成,查询对象是一个大型语言模型;可视化类型和摘要机制的详细信息见附录A.2(https://arxiv.org/html/2609.12364#A1.SS2)。

### 2.4多模态分析

LatentVerse最显著的能力在于其对多模态表征的处理。现代机器学习系统越来越多地整合文本、图像、音频或临床测量等多模态源数据,由此产生的嵌入可能比单模态的更具信息量。然而,它们也更难解释,因为单个融合向量可能纠缠了跨模态共享的信息与各模态特有的信息。

在分解多模态表征学习的先前工作中,提出了信息解耦作为提高可解释性的一种方法,通过分离捕捉跨模态一致性的共享因子与保留每个输入流独特信息的模态特定因子[30 (https://arxiv.org/html/2609.12364#bib.bib30),27 (https://arxiv.org/html/2609.12364#bib.bib27)]。LatentVerse将这一能力集成到其工作流中,以分离多模态表征中的共享信息和模态特定信息,并将用于单模态情况的同系诊断方法不仅应用于融合的多模态嵌入,也应用于分解后的组件。

为了获得这种分解,LatentVerse利用了MultiLoReFT框架[28 (https://arxiv.org/html/2609.12364#bib.bib28)],这是一种轻量级的微调方法,用于分离多模态表征中的共享信息和私有信息。MultiLoReFT将每个模态独有的信息与跨模态共享的信息隔离开来,从而能够独立评估每个组件的表征。我们实验的细节报告于附录A.4(https://arxiv.org/html/2609.12364#A1.SS4),表1(https://arxiv.org/html/2609.12364#A1.T1)。

这种分解改变了对多模态表征可以提出的问题类型。不再仅仅询问*预测性*如何。

相似文章

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。