KITE:一种融合文本、图像和知识图谱的三模态Transformer用于假新闻检测

arXiv cs.LG 论文

摘要

介绍了KITE,一种联合建模文本、图像和知识图谱的三模态Transformer框架,用于假新闻检测,在基准数据集上优于单模态和双模态基线。

arXiv:2606.07651v1 公告类型:new 摘要:随着多模态虚假信息日益复杂,无缝融合欺骗性文本、操纵性视觉内容和事实错误主张,传统的假新闻检测方法逐渐落后。大多数先前工作专注于文本-图像融合,或仅将外部知识作为后处理步骤应用,限制了其检测更深层语义不一致的能力。在本文中,我们提出了KITE(知识集成文本-图像编码器),一种联合建模文本、视觉和事实知识表示的三模态假新闻检测框架。KITE利用Roberta [23,14] 和 CLIP [24] 进行语言和视觉编码,同时使用图注意力网络(GAT)处理从Wikidata检索的结构化事实。KITE在多模态Transformer中使用跨模态注意力 [9] 来整合文本、视觉和知识特征,帮助理解每种模态之间的关系。在最终预测的同时生成模态特定的置信度分数,通过指出哪个输入类型对决策影响最大来提供可解释性。在基准数据集上的评估表明,KITE显著优于单模态和双模态基线,特别是在涉及图像-文本不匹配或与外部知识矛盾的情景中。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:52

# KITE:三模态Transformer融合文本、图像与知识图谱的假新闻检测方法
来源:https://arxiv.org/abs/2606.07651
查看PDF(https://arxiv.org/pdf/2606.07651)

> 摘要:随着多模态虚假信息日益复杂,无缝融合欺骗性文本、篡改图像与事实错误主张,传统假新闻检测方法已力不从心。现有研究大多聚焦于文本-图像融合,或将外部知识仅作为后处理步骤引入,这限制了其对深层语义不一致性的检测能力。本文提出KITE(知识集成文本-图像编码器),一种联合建模文本、视觉与事实知识表征的三模态假新闻检测框架。KITE采用Roberta [23,14]和CLIP [24]分别进行语言与视觉编码,同时利用图注意力网络(GAT)处理从Wikidata检索的结构化事实。通过多模态Transformer内部的跨模态注意力机制[9],KITE融合文本、视觉与知识特征,从而理解各模态间的关联。在最终预测的同时,生成模态特定置信度分数,通过指示哪种输入类型对决策影响最大,提供可解释性。在基准数据集上的评估表明,KITE显著优于单模态与双模态基线模型,尤其在涉及图像-文本不匹配或与外部知识相矛盾的场景下表现突出。

## 提交历史

来自:Shashi Bhushan Jha [查看邮件](https://arxiv.org/show-email/0ef97bd3/2606.07651) **\[v1\]** 2026年6月2日星期二 18:03:17 UTC(680 KB)

相似文章

多模态大语言模型能否生成并检测多模态社交媒体假新闻?

arXiv cs.CL

EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。