标签
MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。
本文提出了一种用于机械系统故障检测的多模态异常检测框架,该框架采用自监督跨模态重构和自适应阈值设置,以提高在分布偏移下的鲁棒性。
Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。
OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。
本文介绍了Tri-PvP,这是一个基准测试,揭示了全模态大语言模型中的视觉偏差和非对称证据形式偏好,表明深层模态偏差可以从早期层线性解码,并且难以通过表面干预缓解。
本文介绍了HalluPrism,这是一种针对多模态大语言模型的行为诊断方法,它使用视觉扰动探针来识别幻觉故障模式,改进了仅基于置信度的故障类别分类方法。
VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。
本文介绍了The Unwritten Benchmark,这是一个用于评估多模态AI模型抽象感知推理能力的新挑战,揭示了人类与当前模型如GPT-4o和Gemini 2.5-Pro之间的显著性能差距。
本文介绍了HC-RAG,一个面向10-K文件的以证据为中心的金融问答的分层跨模态检索增强生成框架,以及一个新的基准Multi-Doc-2025。它在金融问答基准上优于RAPTOR和GraphRAG,尤其是在长文档和表格相关查询方面。
This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.
本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。
介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。
本文介绍了Kontrast,一种利用Text-to-SPARQL和LLM推理自动检测Wikipedia文本、表格和Wikidata知识图谱之间知识不一致性的框架。
提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。
OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
提出PEACE框架,一种基于知识引导的框架,通过标签条件对比对齐将成人心电图解释迁移至儿科人群,在有限监督下取得显著改进。
介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。
VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。
本文提出了一种跨模态生成框架,利用跨模态注意力和膨胀卷积从胎儿-母亲心电图合成胎儿多普勒超声波形,提高了合成质量,并量化了母胎耦合的影响。