cross-modal

标签

Cards List
#cross-modal

Learning to Predict Middle-Layer Attention in MLLMs for Visual Token Prunin

arXiv cs.AI · 昨天 缓存

This paper introduces a method to predict middle-layer attention in multimodal LLMs to prune visual tokens efficiently, using question-contrastive teacher selection and cross-modal attention distillation.

0 人收藏 0 人点赞
#cross-modal

C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现

arXiv cs.AI · 4天前 缓存

介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。

0 人收藏 0 人点赞
#cross-modal

跨文本、表格和知识图谱的知识不一致性检测

arXiv cs.CL · 2026-07-29 缓存

本文介绍了Kontrast,一种利用Text-to-SPARQL和LLM推理自动检测Wikipedia文本、表格和Wikidata知识图谱之间知识不一致性的框架。

0 人收藏 0 人点赞
#cross-modal

DCS:跨模态版权侵权检测的统一条件灵敏度框架

arXiv cs.LG · 2026-07-27 缓存

提出了一种统一的事后检测框架,用于AI模型中的版权侵权检测,利用条件敏感性和差分隐私来跨模态衡量记忆化。

0 人收藏 0 人点赞
#cross-modal

OmniVAE:具有跨模态对齐的音频-视频VAE,用于联合生成

Hugging Face Daily Papers · 2026-07-26 缓存

OmniVAE是一种联合训练的音频-视频VAE,使用分段级对比学习和特征蒸馏来对齐潜在空间,从而提升文本到音频-视频生成中的联合生成质量和同步性。

0 人收藏 0 人点赞
#cross-modal

Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测

arXiv cs.LG · 2026-07-21 缓存

本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#cross-modal

基于知识引导的跨模态融合与标签条件对比对齐实现成人到儿科心电图迁移

arXiv cs.LG · 2026-07-20 缓存

提出PEACE框架,一种基于知识引导的框架,通过标签条件对比对齐将成人心电图解释迁移至儿科人群,在有限监督下取得显著改进。

0 人收藏 0 人点赞
#cross-modal

LakeQuest:跨数据湖基于事实的问答三元域基准

arXiv cs.CL · 2026-07-15 缓存

介绍LakeQuest,一个经过人工验证的基准测试,包含九个领域共9,846个问答对,用于评估在异构数据湖上的端到端检索与合成管道,揭示了现代问答系统中的关键故障模式。

0 人收藏 0 人点赞
#cross-modal

VTaMo: 用于手语翻译的视频-文本对齐模型

arXiv cs.CL · 2026-07-13 缓存

VTaMo 引入了显式的多粒度视频-文本对齐方法,通过最优传输和对比学习实现手语翻译,在四个基准测试上取得了最先进的性能。

0 人收藏 0 人点赞
#cross-modal

从胎儿-母亲心电图到胎儿多普勒波形的跨模态生成式信号转换框架

arXiv cs.LG · 2026-07-10 缓存

本文提出了一种跨模态生成框架,利用跨模态注意力和膨胀卷积从胎儿-母亲心电图合成胎儿多普勒超声波形,提高了合成质量,并量化了母胎耦合的影响。

0 人收藏 0 人点赞
#cross-modal

通过知识蒸馏和跨模态集成生成的多语言转录的音频情感分析

arXiv cs.CL · 2026-07-09 缓存

本文提出了一种用于音频情感极性分类的多模态解决方案,通过跨模态转换器集成音频和多语言文本转录,并利用知识蒸馏增强纯音频模型,在推理过程中不增加计算开销。

0 人收藏 0 人点赞
#cross-modal

大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移

arXiv cs.AI · 2026-06-29 缓存

本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。

0 人收藏 0 人点赞
#cross-modal

多模态大语言模型评估中我们缺失了什么?

arXiv cs.AI · 2026-06-26 缓存

本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。

0 人收藏 0 人点赞
#cross-modal

无配对数据的跨模态知识蒸馏:理论基础与算法

arXiv cs.AI · 2026-06-10 缓存

本文提出了一种无需配对数据的跨模态知识蒸馏框架,通过对齐特征分布与标签分布,提供了理论保证,并在多模态基准测试中优于先前方法。

0 人收藏 0 人点赞
#cross-modal

SynIB:多模态学习中最大化协同的信息瓶颈

arXiv cs.LG · 2026-06-10 缓存

本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。

0 人收藏 0 人点赞
#cross-modal

DyCo-RL: 动态跨模态协调用于视觉推理

Hugging Face Daily Papers · 2026-06-06 缓存

本文指出,视觉推理中的失败往往源于思维链生成过程中视觉与文本证据之间的动态跨模态协调崩溃。它介绍了DyCo-RL,一个强化学习框架,通过奖励有效的跨模态协调来提升推理性能。

0 人收藏 0 人点赞
#cross-modal

基于查询的跨模态投影器增强 Mamba 多模态大语言模型

arXiv cs.CL · 2026-06-04 缓存

本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。

0 人收藏 0 人点赞
#cross-modal

@AdinaYakup: JD刚刚发布了JoyAI-Echo,一个有趣的长视频生成模型,5分钟多镜头视频生成,跨模态……

X AI KOLs Following · 2026-06-03 缓存

JD发布了JoyAI-Echo,这是一个长视频生成模型,能够生成5分钟多镜头视频,具备跨模态记忆实现角色和声音一致性,原生音视频生成,并通过DMD蒸馏技术实现7.5倍速度提升(无质量损失)。

0 人收藏 0 人点赞
#cross-modal

ECG与血管造影表征的跨模态对比学习用于重度狭窄分类

arXiv cs.LG · 2026-06-03 缓存

本文介绍了StenCE,一个预训练框架,利用ECG与X射线血管造影表征之间的跨模态对比学习,从ECG中检测重度冠状动脉狭窄,实现了高性能,并能够在无症状患者中实现早期诊断。

0 人收藏 0 人点赞
#cross-modal

TIGER:基于图证据路由的可追溯推理,用于减轻多模态生成中的幻觉

arXiv cs.AI · 2026-06-02 缓存

TIGER是一个推理时框架,通过提取观察图和声明图并分配风险评分来修复不支持的事实,从而减轻多模态生成中的幻觉。它在图像到文本、图像+文本到文本、音频到文本和视频到文本任务中减少了不支持的内容。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈