multimodal-large-language-models

标签

Cards List
#multimodal-large-language-models

基于记忆的推理:一种时间粒度自适应的免训练长视频理解框架

arXiv cs.AI · 2天前 缓存

ReMem提出了一种双层记忆增强的关键帧选择框架,用于免训练的长视频理解,在多个基准上实现了最先进的零样本性能。

0 人收藏 0 人点赞
#multimodal-large-language-models

ConsiSpace:几何一致性学习对视频空间推理至关重要

Hugging Face Daily Papers · 2026-07-20 缓存

ConsiSpace是一个几何一致性感知的视频空间推理框架,通过使用几何一致性记忆和统一一致性自监督强化学习,在空间推理基准上提升了性能。

0 人收藏 0 人点赞
#multimodal-large-language-models

SpaR3D-MoE: 面向稀疏视图的自适应3D空间推理与几何归纳混合专家模型

arXiv cs.AI · 2026-07-09 缓存

介绍SpaR3D-MoE,这是一个端到端框架,用于从稀疏RGB视图中进行自适应3D空间推理,利用流形采样和几何归纳混合专家,在VSI-Bench、ScanQA和SQA3D上取得了最先进的性能。

0 人收藏 0 人点赞
#multimodal-large-language-models

BaFCo:针对复杂孟加拉语表单理解的文档理解基准

arXiv cs.CL · 2026-07-08 缓存

提出了BaFCo,一个面向孟加拉语表单理解的基准数据集,重点关注文档布局分析(DLA)和关键信息提取(KIE)。该数据集包含200份多页复杂孟加拉国政府表单,涵盖26种实体类型的细粒度标注,并对多个多模态大型语言模型(MLLMs)进行了评估,揭示了当前模型在理解复杂孟加拉语表单方面的局限性。

0 人收藏 0 人点赞
#multimodal-large-language-models

从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述

arXiv cs.CL · 2026-06-26 缓存

本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。

0 人收藏 0 人点赞
#multimodal-large-language-models

结合链式思维监督的强化学习自适应可解释仇恨与宣传梗图检测

arXiv cs.CL · 2026-06-16 缓存

提出了一种基于强化学习的后训练方法,使用群体相对策略优化(GRPO)和链式思维监督,以提高基于思维的多模态大语言模型在仇恨与宣传梗图检测中的分类和解释质量,在Hateful Memes和ArMeme基准上取得了改进。

0 人收藏 0 人点赞
#multimodal-large-language-models

P3D-Bench:参数化3D生成与结构推理的多模态大语言模型基准测试

Hugging Face Daily Papers · 2026-06-09 缓存

本文提出P3D-Bench,一个用于评估多模态大语言模型在参数化3D生成任务上的基准测试,涵盖文本到3D、图像到3D和组装到3D,并采用几何精度、语义对齐和部件级结构等指标。

0 人收藏 0 人点赞
#multimodal-large-language-models

光学推理:重新审视图像作为超越文本的表达性推理媒介

Hugging Face Daily Papers · 2026-06-08 缓存

提出光学推理,将图像作为语言和多模态任务的独立推理媒介,相比传统基于文本的方法实现了更高的令牌效率。

0 人收藏 0 人点赞
#multimodal-large-language-models

Robust-U1:多模态大语言模型能否自我修复受损视觉内容以实现鲁棒理解?

Hugging Face Daily Papers · 2026-06-06 缓存

Robust-U1 是一个框架,通过监督微调、双奖励强化学习和联合多模态推理,使多模态大语言模型能够自我修复受损的视觉内容,在鲁棒性基准测试上达到了最先进水平。

0 人收藏 0 人点赞
#multimodal-large-language-models

从视频中学习几何表征以赋予多模态大语言模型空间智能

Hugging Face Daily Papers · 2026-06-04 缓存

GeoVR 通过利用多个几何目标从3D基础模型中蒸馏几何知识,重构多模态大语言模型的语义潜空间,从而增强其3D感知能力。

0 人收藏 0 人点赞
#multimodal-large-language-models

多模态视频理解中视觉状态追踪的基准测试

Hugging Face Daily Papers · 2026-06-02 缓存

介绍VSTAT,一个用于评估多模态大语言模型(MLLMs)中视觉状态追踪的基准,包含834个片段和1,500个问题。当前MLLMs表现远逊于人类,问题出在视觉感知而非推理上。

0 人收藏 0 人点赞
#multimodal-large-language-models

看我之意:面向视频细粒度对象理解的视觉与语言表征对齐

Hugging Face Daily Papers · 2026-05-18 缓存

SWIM是一种新颖的训练策略,仅使用文本提示即可对齐视觉和语言表征以实现细粒度对象理解,并在训练期间利用掩码监督来改善跨模态注意力。该方法引入了NL-Refer数据集,并在细粒度对象理解基准测试中取得了优于基于视觉提示的方法的性能。

0 人收藏 0 人点赞
#multimodal-large-language-models

Video2GUI:合成大规模交互轨迹以进行通用GUI智能体预训练

arXiv cs.CL · 2026-05-15 缓存

提出了Video2GUI,一个从无标签教学视频中自动提取GUI交互轨迹的框架,构建了包含12M条轨迹、覆盖1500+应用的WildGUI数据集。在该数据上进行预训练,在GUI定位和动作基准测试上提升了5-20%。

0 人收藏 0 人点赞
#multimodal-large-language-models

CiteVQA: 面向可信文档智能的证据归因基准测试

Hugging Face Daily Papers · 2026-05-13 缓存

CiteVQA 是一个面向文档视觉-语言模型的基准,它同时评估答案正确性与支持证据的引用,揭示了广泛的归因幻觉现象,即模型提供正确答案但引用错误区域。

0 人收藏 0 人点赞
#multimodal-large-language-models

EDU-CIRCUIT-HW:评估多模态大语言模型在真实大学级 STEM 学生手写解答上的表现

Hugging Face Daily Papers · 2026-04-30 缓存

本文介绍了 EDU-CIRCUIT-HW 数据集,用于评估多模态大语言模型在真实大学级 STEM 手写解答上的表现,揭示了显著的识别局限性,并提出了一种结合自动化识别与极少人工监督的混合方法,以增强评分的鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈