KITE:一种融合文本、图像和知识图谱的三模态Transformer用于假新闻检测
摘要
介绍了KITE,一种联合建模文本、图像和知识图谱的三模态Transformer框架,用于假新闻检测,在基准数据集上优于单模态和双模态基线。
arXiv:2606.07651v1 公告类型:new
摘要:随着多模态虚假信息日益复杂,无缝融合欺骗性文本、操纵性视觉内容和事实错误主张,传统的假新闻检测方法逐渐落后。大多数先前工作专注于文本-图像融合,或仅将外部知识作为后处理步骤应用,限制了其检测更深层语义不一致的能力。在本文中,我们提出了KITE(知识集成文本-图像编码器),一种联合建模文本、视觉和事实知识表示的三模态假新闻检测框架。KITE利用Roberta [23,14] 和 CLIP [24] 进行语言和视觉编码,同时使用图注意力网络(GAT)处理从Wikidata检索的结构化事实。KITE在多模态Transformer中使用跨模态注意力 [9] 来整合文本、视觉和知识特征,帮助理解每种模态之间的关系。在最终预测的同时生成模态特定的置信度分数,通过指出哪个输入类型对决策影响最大来提供可解释性。在基准数据集上的评估表明,KITE显著优于单模态和双模态基线,特别是在涉及图像-文本不匹配或与外部知识矛盾的情景中。
查看缓存全文
缓存时间: 2026/06/09 08:52
# KITE:三模态Transformer融合文本、图像与知识图谱的假新闻检测方法 来源:https://arxiv.org/abs/2606.07651 查看PDF(https://arxiv.org/pdf/2606.07651) > 摘要:随着多模态虚假信息日益复杂,无缝融合欺骗性文本、篡改图像与事实错误主张,传统假新闻检测方法已力不从心。现有研究大多聚焦于文本-图像融合,或将外部知识仅作为后处理步骤引入,这限制了其对深层语义不一致性的检测能力。本文提出KITE(知识集成文本-图像编码器),一种联合建模文本、视觉与事实知识表征的三模态假新闻检测框架。KITE采用Roberta [23,14]和CLIP [24]分别进行语言与视觉编码,同时利用图注意力网络(GAT)处理从Wikidata检索的结构化事实。通过多模态Transformer内部的跨模态注意力机制[9],KITE融合文本、视觉与知识特征,从而理解各模态间的关联。在最终预测的同时,生成模态特定置信度分数,通过指示哪种输入类型对决策影响最大,提供可解释性。在基准数据集上的评估表明,KITE显著优于单模态与双模态基线模型,尤其在涉及图像-文本不匹配或与外部知识相矛盾的场景下表现突出。 ## 提交历史 来自:Shashi Bhushan Jha [查看邮件](https://arxiv.org/show-email/0ef97bd3/2606.07651) **\[v1\]** 2026年6月2日星期二 18:03:17 UTC(680 KB)
相似文章
F2IND-IT! -- 基于图像和文本的多模态模糊虚假印度新闻检测
提出FIND-IT!,一种多模态虚假新闻检测框架,用于印度新闻。该框架利用ResNet-50提取视觉特征,DistilBERT处理文本,并采用带有注意力融合的自适应神经模糊推理系统(ANFIS)将新闻分类为虚假或真实。
多模态大语言模型能否生成并检测多模态社交媒体假新闻?
EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。
弥合差距:面向统一多任务用户意图推断的双知识图谱框架
本文提出了DKG-MTI,一种双知识图谱框架,通过结构感知的知识对齐增强基于大语言模型的推理,以联合预测方面评分并从在线旅游评论中生成用户意图陈述。
动荡回响:用于假新闻与暴力驱动暴乱活动早期预警的多模态NLP框架
本文介绍了一个多模态NLP框架,融合了XLM-RoBERTa和CLIP以及地理空间和讽刺特征,用于检测假新闻和预测暴力驱动的暴乱活动,在一个包含138,256个样本的孟加拉语/英语数据集上实现了98%的测试准确率。
@itarutomy: 一篇从头重建AI Agent研究"知识基础设施"的论文 (https://arxiv[.]org/html…
本文介绍了Agents-K1,一个基于246万篇论文构建的知识图谱系统,通过整合文本、图形、表格和方程式,以及五级引用分类,提升了AI Agent研究。它显著提高了Gemini-3和GPT-5.2等顶级模型在基准测试中的表现,表明优化知识结构比扩大模型规模更有效。