基于信息融合的文档分类模式识别:多模态与多视图表示方法的系统综述

arXiv cs.CL 论文

摘要

本系统综述对139项研究进行了分析,提出了一个统一的框架和元分析,用于通过多模态和多视图信息融合进行文档分类,发现融合提高了准确性(平均提升+5.28个百分点),但也揭示了可重复性挑战。

arXiv:2605.23910v1 公告类型:新 摘要:信息融合被广泛应用于通过集成多个数据源(多模态)或表示(多视图)来改进文档分类。然而,该领域缺乏统一的框架、对其有效性的定量综合以及给实践者的明确指导。本系统综述通过分析139项主要研究来弥补这些空白。本文引入了一个正式框架来构建该领域,展示了定性分析的结果以识别关键趋势,并进行了随机效应元分析(据我们所知,这是首次专注于文档分类的元分析)以量化性能提升。我们的元分析表明,多模态融合显著提高了准确率(平均提升+5.28个百分点,p=0.0016)——F1分数的影响方向为正,但在我们的主要模型中统计上不显著。多视图融合在准确率(+4.67%)、F1分数(+3.08%)和召回率(所有p<0.05)方面提供了持续但适度的增益。关键在于,我们的定性综合揭示了方法学严谨性方面的可重复性挑战:只有11.8%(多模态)和23.3%(多视图)的研究使用了统计检验来验证其发现,这削弱了其许多结果的可靠性。本综述的主要贡献包括一个统一的框架、首个定量证据库以及数据驱动的指南。本综述得出结论,信息融合的成功并不取决于算法复杂性,而取决于融合方法与任务上下文的战略对齐以及对更严格验证的承诺。
查看原文
查看缓存全文

缓存时间: 2026/05/26 08:58

# 基于信息融合的文档分类模式识别:多模态与多视角表示方法的系统综述  
来源:https://arxiv.org/abs/2605.23910  
查看 PDF (https://arxiv.org/pdf/2605.23910)  

> **摘要**:信息融合通过整合多数据源(多模态)或多表示(多视角),被广泛用于改进文档分类。然而,该领域缺乏统一框架、缺乏对其有效性的量化综合,也缺乏给实践者的明确指导。本系统综述通过分析139项主要研究填补了这些空白。它提出了一个形式化框架来结构化该领域,展示了定性分析结果以识别关键趋势,并执行了随机效应元分析(据我们所知,这是首个专注于文档分类的元分析)以量化性能提升。我们的元分析揭示,多模态融合显著提升了准确率(平均提升+5.28个百分点,$p=0.0016$)——F1分数的效应方向为正,但在我们的主模型中统计学不显著。多视角融合在准确率(+4.67%)、F1分数(+3.08%)和召回率(所有$p<0.05$)上提供了持续但适度的提升。关键的是,我们的定性综合发现了方法严谨性方面的可重复性挑战:仅11.8%(多模态)和23.3%(多视角)的研究使用统计检验来验证其发现,这削弱了许多结果的可靠性。本综述的主要贡献是一个统一框架、首个定量证据基础以及数据驱动的指南。本综述得出结论:成功的信息融合不依赖于算法复杂性,而依赖于融合方法与任务背景的战略性对齐,以及对更严格验证的承诺。

## 提交历史

来自:Marcin Mirończuk Mirończuk [查看电子邮件](https://arxiv.org/show-email/2797ee5a/2605.23910) **\[v1\]**  
2026年4月7日 星期二 08:49:20 UTC(2,208 KB)

相似文章