cross-modal

标签

Cards List
#cross-modal

MME-Safety:一个用于MLLMs安全评估的细粒度基准

arXiv cs.CL ↗ · 2026-09-21 缓存

MME-Safety 是一个经过严格验证的基准,用于评估多模态大语言模型的安全性,具有四维标注框架和一个分层框架,以评估风险场景、危害严重程度和特定模态的隐蔽性水平。

0 人收藏 0 人点赞
#cross-modal

通过自监督跨模态重构实现机械多模态时间序列的鲁棒故障检测

arXiv cs.LG ↗ · 2026-09-16 缓存

本文提出了一种用于机械系统故障检测的多模态异常检测框架,该框架采用自监督跨模态重构和自适应阈值设置,以提高在分布偏移下的鲁棒性。

0 人收藏 0 人点赞
#cross-modal

Omni-Streaming Thinking

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

Omni-Streaming Thinking 通过推迟声明直到跨模态验证来改进流式全模态推理,减少过早承诺和听觉幻觉。

0 人收藏 0 人点赞
#cross-modal

OmniHallu:用于多模态大语言模型中跨模态理解与生成的统一幻觉检测

arXiv cs.CL ↗ · 2026-09-11 缓存

OmniHallu引入了一个统一的幻觉检测框架,适用于多模态大语言模型,涵盖图像、视频和音频模态的理解与生成任务,并包括一个基准测试和多智能体架构。

0 人收藏 0 人点赞
#cross-modal

Tri-PvP:通过感知-命题证据冲突揭示全模态大语言模型中的模态偏差

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文介绍了Tri-PvP,这是一个基准测试,揭示了全模态大语言模型中的视觉偏差和非对称证据形式偏好,表明深层模态偏差可以从早期层线性解码,并且难以通过表面干预缓解。

0 人收藏 0 人点赞
#cross-modal

HalluPrism:当多模态不确定性应进行诊断而非决策时

arXiv cs.LG ↗ · 2026-09-01 缓存

本文介绍了HalluPrism,这是一种针对多模态大语言模型的行为诊断方法,它使用视觉扰动探针来识别幻觉故障模式,改进了仅基于置信度的故障类别分类方法。

0 人收藏 0 人点赞
#cross-modal

VA-Judger:基于人类偏好反馈的联合视频-音频生成奖励建模

Hugging Face Daily Papers ↗ · 2026-08-19 缓存

VA-Judger是首个用于联合视频-音频生成的奖励模型,它使用人类偏好反馈来评估整体质量,包括一个数据集和基准测试,并在应用于像LTX-2这样的模型时展示了人类偏好率的显著提升。

0 人收藏 0 人点赞
#cross-modal

The Unwritten Benchmark: 多模态机器学习在抽象感知推理中的新挑战

arXiv cs.AI ↗ · 2026-08-18 缓存

本文介绍了The Unwritten Benchmark,这是一个用于评估多模态AI模型抽象感知推理能力的新挑战,揭示了人类与当前模型如GPT-4o和Gemini 2.5-Pro之间的显著性能差距。

0 人收藏 0 人点赞
#cross-modal

HC-RAG:面向异构财务申报文件的以证据为中心的检索增强生成

arXiv cs.CL ↗ · 2026-08-14 缓存

本文介绍了HC-RAG,一个面向10-K文件的以证据为中心的金融问答的分层跨模态检索增强生成框架,以及一个新的基准Multi-Doc-2025。它在金融问答基准上优于RAPTOR和GraphRAG,尤其是在长文档和表格相关查询方面。

0 人收藏 0 人点赞
#cross-modal

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

arXiv cs.AI ↗ · 2026-08-10 缓存

This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.

0 人收藏 0 人点赞
#cross-modal

将视觉-语言接地视为双向概念对应

Hugging Face Daily Papers ↗ · 2026-08-08 缓存

本文介绍了ConCor-1,一种接地模型,将视觉-语言接地视为双向概念对应,无需预设短语即可联合恢复文本跨度、图像片段和跨模态匹配。它统一了短语接地、指称表达接地和开放词汇检测,在长标题和零样本LVIS基准上实现了显著的F1提升。

0 人收藏 0 人点赞
#cross-modal

C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现

arXiv cs.AI ↗ · 2026-08-07 缓存

介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。

0 人收藏 0 人点赞
#cross-modal

跨文本、表格和知识图谱的知识不一致性检测

arXiv cs.CL ↗ · 2026-07-29 缓存

本文介绍了Kontrast,一种利用Text-to-SPARQL和LLM推理自动检测Wikipedia文本、表格和Wikidata知识图谱之间知识不一致性的框架。

0 人收藏 0 人点赞
#cross-modal

DCS:跨模态版权侵权检测的统一条件灵敏度框架

arXiv cs.LG ↗ · 2026-07-27 缓存

提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。

0 人收藏 0 人点赞
#cross-modal

OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成

Hugging Face Daily Papers ↗ · 2026-07-26 缓存

OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。

0 人收藏 0 人点赞
#cross-modal

Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测

arXiv cs.LG ↗ · 2026-07-21 缓存

本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#cross-modal

基于知识引导的跨模态融合与标签条件对比对齐实现成人到儿科心电图迁移

arXiv cs.LG ↗ · 2026-07-20 缓存

提出PEACE框架,一种基于知识引导的框架,通过标签条件对比对齐将成人心电图解释迁移至儿科人群,在有限监督下取得显著改进。

0 人收藏 0 人点赞
#cross-modal

LakeQuest:跨数据湖基于事实的问答三元域基准

arXiv cs.CL ↗ · 2026-07-15 缓存

介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。

0 人收藏 0 人点赞
#cross-modal

VTaMo: 用于手语翻译的视频-文本对齐模型

arXiv cs.CL ↗ · 2026-07-13 缓存

VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。

0 人收藏 0 人点赞
#cross-modal

从胎儿-母亲心电图到胎儿多普勒波形的跨模态生成式信号转换框架

arXiv cs.LG ↗ · 2026-07-10 缓存

本文提出了一种跨模态生成框架,利用跨模态注意力和膨胀卷积从胎儿-母亲心电图合成胎儿多普勒超声波形,提高了合成质量,并量化了母胎耦合的影响。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈