cross-modal

标签

Cards List
#cross-modal

通过知识蒸馏和跨模态集成生成的多语言转录的音频情感分析

arXiv cs.CL ↗ · 2026-07-09 缓存

本文提出了一种用于音频情感极性分类的多模态解决方案,通过跨模态转换器集成音频和多语言文本转录,并利用知识蒸馏增强纯音频模型,在推理过程中不增加计算开销。

0 人收藏 0 人点赞
#cross-modal

大型语言模型教导视觉学生:细粒度概念知识的跨模态迁移

arXiv cs.AI ↗ · 2026-06-29 缓存

本文介绍了LaViD框架,该框架通过生成多项选择题作为概念签名,将语义知识从纯语言大语言模型转移到视觉学生模型,实现了优越的细粒度分类性能和鲁棒性。

0 人收藏 0 人点赞
#cross-modal

多模态大语言模型评估中我们缺失了什么?

arXiv cs.AI ↗ · 2026-06-26 缓存

本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。

0 人收藏 0 人点赞
#cross-modal

无配对数据的跨模态知识蒸馏:理论基础与算法

arXiv cs.AI ↗ · 2026-06-10 缓存

本文提出了一种无需配对数据的跨模态知识蒸馏框架,通过对齐特征分布与标签分布,提供了理论保证,并在多模态基准测试中优于先前方法。

0 人收藏 0 人点赞
#cross-modal

SynIB:多模态学习中最大化协同的信息瓶颈

arXiv cs.LG ↗ · 2026-06-10 缓存

本文介绍了SynIB,一种基于信息瓶颈原则的可扩展目标函数,通过在被遮蔽一个模态时对自信预测进行惩罚,来定位多模态学习中的协同信息,从而提升需要跨模态推理的任务的性能。

0 人收藏 0 人点赞
#cross-modal

DyCo-RL: 动态跨模态协调用于视觉推理

Hugging Face Daily Papers ↗ · 2026-06-06 缓存

本文指出,视觉推理中的失败往往源于思维链生成过程中视觉与文本证据之间的动态跨模态协调崩溃。它介绍了DyCo-RL,一个强化学习框架,通过奖励有效的跨模态协调来提升推理性能。

0 人收藏 0 人点赞
#cross-modal

基于查询的跨模态投影器增强 Mamba 多模态大语言模型

arXiv cs.CL ↗ · 2026-06-04 缓存

本文提出了一种基于查询的跨模态投影器,通过交叉注意力机制对视觉标记进行压缩,以提升基于 Mamba 的多模态大语言模型的性能。该方法在视觉语言基准测试中同时提高了模型性能和吞吐量,并消除了手动设计二维扫描顺序的需求。

0 人收藏 0 人点赞
#cross-modal

@AdinaYakup: JD刚刚发布了JoyAI-Echo,一个有趣的长视频生成模型,5分钟多镜头视频生成,跨模态……

X AI KOLs Following ↗ · 2026-06-03 缓存

JD发布了JoyAI-Echo,这是一个长视频生成模型,能够生成5分钟多镜头视频,具备跨模态记忆实现角色和声音一致性,原生音视频生成,并通过DMD蒸馏技术实现7.5倍速度提升(无质量损失)。

0 人收藏 0 人点赞
#cross-modal

ECG与血管造影表征的跨模态对比学习用于重度狭窄分类

arXiv cs.LG ↗ · 2026-06-03 缓存

本文介绍了StenCE,一个预训练框架,利用ECG与X射线血管造影表征之间的跨模态对比学习,从ECG中检测重度冠状动脉狭窄,实现了高性能,并能够在无症状患者中实现早期诊断。

0 人收藏 0 人点赞
#cross-modal

TIGER:基于图证据路由的可追溯推理,用于减轻多模态生成中的幻觉

arXiv cs.AI ↗ · 2026-06-02 缓存

TIGER是一个推理时框架,通过提取观察图和声明图并分配风险评分来修复不支持的事实,从而减轻多模态生成中的幻觉。它在图像到文本、图像+文本到文本、音频到文本和视频到文本任务中减少了不支持的内容。

0 人收藏 0 人点赞
#cross-modal

文本编辑能否泛化到视觉生成?统一多模态模型中的跨模态知识编辑基准测试

arXiv cs.CL ↗ · 2026-06-02 缓存

本文介绍了UniKE,这是首个针对统一多模态模型(UMMs)的跨模态知识编辑基准测试,揭示了显著的模态差距:文本编辑实现了92%的效果,但仅有18.5%迁移到图像生成。它提出了Reasoning-augmented Parameter Editing,以改善跨模态迁移,提升幅度高达18.6个百分点。

0 人收藏 0 人点赞
#cross-modal

LoMo: 局部模态替换以实现更深层的视觉-语言融合

Hugging Face Daily Papers ↗ · 2026-05-28 缓存

LoMo 提出了一种数据整理方法,将单模态提示重新表述为交错的多模态序列,以改善视觉-语言模型中的跨模态表示对齐,在多个基准测试上取得了持续的性能提升。

0 人收藏 0 人点赞
#cross-modal

SceneAligner:基于3D场景的真实世界平面图定位

Hugging Face Daily Papers ↗ · 2026-05-21 缓存

介绍SceneAligner,一种用于平面图定位的深度学习方法,利用3D场景重建和跨模态对应学习,在数据有限的真实环境中工作。

0 人收藏 0 人点赞
#cross-modal

跨模态技能注入研究:场景、方法与超参数

arXiv cs.CL ↗ · 2026-05-20 缓存

本文系统研究了跨模态技能注入,将领域专家大语言模型融入视觉语言模型以激发新兴多模态能力。评估了不同场景(指令遵循、跨语言、数学推理)、融合方法(TA、DARE等)及超参数,发现TA和DARE在除数学推理外表现良好。

0 人收藏 0 人点赞
#cross-modal

LatentUMM:统一多模态模型的双重潜在对齐

Hugging Face Daily Papers ↗ · 2026-05-18 缓存

LatentUMM 引入了双重潜在对齐,通过对齐转换和稳定潜在动态,来改善统一多模态模型中的跨模态一致性。

0 人收藏 0 人点赞
#cross-modal

AuralSAM2: 通过金字塔视听特征提示赋予SAM2听觉能力

Hugging Face Daily Papers ↗ · 2026-05-14 缓存

AuralSAM2通过AuralFuser模块将音频集成到SAM2中,该模块从视听特征生成稀疏和密集提示,在保持交互效率的同时增强跨模态分割。

0 人收藏 0 人点赞
#cross-modal

MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调

Hugging Face Daily Papers ↗ · 2026-04-18 缓存

论文页面 - MNAFT:用于图像翻译的多模态大语言模型模态神经元感知微调 来源:[https://huggingface.co/papers/2604.16943](https://huggingface.co/papers/2604.16943) 发布日期:4月18日 · 提交者 [https://huggingface.co/liboaccn](https://huggingface.co/liboaccn) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/6582c482f3006507ea10302a/KbgSsq0FnbMngBcWPhIXi.jpeg)](https://huggingface.co/liboaccn) [Bo Li](https://huggingface.co/liboaccn)

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈