基于信息融合的文档分类模式识别:多模态与多视图表示方法的系统综述
摘要
本系统综述对139项研究进行了分析,提出了一个统一的框架和元分析,用于通过多模态和多视图信息融合进行文档分类,发现融合提高了准确性(平均提升+5.28个百分点),但也揭示了可重复性挑战。
arXiv:2605.23910v1 公告类型:新
摘要:信息融合被广泛应用于通过集成多个数据源(多模态)或表示(多视图)来改进文档分类。然而,该领域缺乏统一的框架、对其有效性的定量综合以及给实践者的明确指导。本系统综述通过分析139项主要研究来弥补这些空白。本文引入了一个正式框架来构建该领域,展示了定性分析的结果以识别关键趋势,并进行了随机效应元分析(据我们所知,这是首次专注于文档分类的元分析)以量化性能提升。我们的元分析表明,多模态融合显著提高了准确率(平均提升+5.28个百分点,p=0.0016)——F1分数的影响方向为正,但在我们的主要模型中统计上不显著。多视图融合在准确率(+4.67%)、F1分数(+3.08%)和召回率(所有p<0.05)方面提供了持续但适度的增益。关键在于,我们的定性综合揭示了方法学严谨性方面的可重复性挑战:只有11.8%(多模态)和23.3%(多视图)的研究使用了统计检验来验证其发现,这削弱了其许多结果的可靠性。本综述的主要贡献包括一个统一的框架、首个定量证据库以及数据驱动的指南。本综述得出结论,信息融合的成功并不取决于算法复杂性,而取决于融合方法与任务上下文的战略对齐以及对更严格验证的承诺。
查看缓存全文
缓存时间: 2026/05/26 08:58
# 基于信息融合的文档分类模式识别:多模态与多视角表示方法的系统综述 来源:https://arxiv.org/abs/2605.23910 查看 PDF (https://arxiv.org/pdf/2605.23910) > **摘要**:信息融合通过整合多数据源(多模态)或多表示(多视角),被广泛用于改进文档分类。然而,该领域缺乏统一框架、缺乏对其有效性的量化综合,也缺乏给实践者的明确指导。本系统综述通过分析139项主要研究填补了这些空白。它提出了一个形式化框架来结构化该领域,展示了定性分析结果以识别关键趋势,并执行了随机效应元分析(据我们所知,这是首个专注于文档分类的元分析)以量化性能提升。我们的元分析揭示,多模态融合显著提升了准确率(平均提升+5.28个百分点,$p=0.0016$)——F1分数的效应方向为正,但在我们的主模型中统计学不显著。多视角融合在准确率(+4.67%)、F1分数(+3.08%)和召回率(所有$p<0.05$)上提供了持续但适度的提升。关键的是,我们的定性综合发现了方法严谨性方面的可重复性挑战:仅11.8%(多模态)和23.3%(多视角)的研究使用统计检验来验证其发现,这削弱了许多结果的可靠性。本综述的主要贡献是一个统一框架、首个定量证据基础以及数据驱动的指南。本综述得出结论:成功的信息融合不依赖于算法复杂性,而依赖于融合方法与任务背景的战略性对齐,以及对更严格验证的承诺。 ## 提交历史 来自:Marcin Mirończuk Mirończuk [查看电子邮件](https://arxiv.org/show-email/2797ee5a/2605.23910) **\[v1\]** 2026年4月7日 星期二 08:49:20 UTC(2,208 KB)
相似文章
分离、细化、整合:为情感分析分解多模态融合
一篇研究论文,提出了SeRIn,一种多模态融合方案,将模态特定细化与跨模态交互分离,在CH-SIMS和CMU-MOSEI情感分析基准上取得了最先进的结果。
ClinFusion:面向全面医疗理解的以视觉为中心的多模态大语言模型系统
ClinFusion 是一个以视觉为中心的多模态大语言模型,用于全面医疗理解,它使用级联视觉编码器统一了 2D 和 3D 医学图像分析。它在 24 个基准测试中的 20 个上达到了最先进的结果,并在 16 个基准测试中的 13 个上超越了 GPT-5.2 和 Gemini-3-Flash 等专有模型。
通过 Inverted Asymmetric Fusion 缓解多模态学习中的强模态坍缩
本文识别了多模态学习中的强模态坍缩现象,其中融合会降低主导模态的性能,并提出了 Inverted Asymmetric Fusion (IAF) 来保留主导模态,从而在单模态基线上取得改进。
CL-DMDF:基于对比学习的动态多模态数据融合模型
本文提出了CL-DMDF,一种基于对比学习和双维度注意力机制的动态多模态数据融合模型,用于处理缺失模态并提升判别学习能力。
基于Token的双视角融合与大视觉模型在乳腺癌分类中的适配
本文提出了一种以Token为中心的双视角学习框架,在冻结的视觉Transformer中统一了基于提示的适配和跨视角融合,以改善基于乳腺X线图像的乳腺癌分类,在VinDr-Mammo和CMMD数据集上取得了一致的性能提升。