modality-gap

标签

Cards List
#modality-gap

TokenSwap:基准测试并缩小多模态大语言模型中的模态差距

arXiv cs.CL · 2026-08-03 缓存

本文介绍了TokenSwap,一种将纯文本基准测试转换为图像交错对应物的方法,以及TokenSwap-Bench,用于衡量42个多模态大语言模型的模态差距。研究发现推理模型的差距较小,并表明基于TokenSwap的训练可以缩小这一差距。

0 人收藏 0 人点赞
#modality-gap

从输入端最小化模态差距:您的语音大语言模型可以成为具备韵律感知能力的文本大语言模型

arXiv cs.CL · 2026-05-08 缓存

提出了 TextPro-SLM,一种通过处理口语输入使其类似于具备韵律感知能力的文本来最小化模态差距的语音大语言模型,以少量的训练数据实现了强大的副语言理解能力。

0 人收藏 0 人点赞
#modality-gap

各向异性模态对齐

Hugging Face Daily Papers · 2026-05-08 缓存

本文提出了 AnisoAlign 框架,该框架通过应用各向异性几何校正来解决多模态模型中的模态间隙问题,从而实现有效的非配对模态对齐。

0 人收藏 0 人点赞
#modality-gap

视觉语言模型真的能进行视觉推理吗?模态差距的严格研究

arXiv cs.CL · 2026-04-20 缓存

本文介绍了CrossMath,一个受控多模态推理基准,揭示了当前视觉语言模型的一个关键局限:它们主要在文本空间进行推理,而非真正的视觉接地推理,视觉输入往往会降低性能相比仅文本基线。作者提出了微调方法来减轻这种模态差距并改进多模态推理能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈