mllm

标签

Cards List
#mllm

DEEPO: 针对多模态大语言模型幻觉的双熵增强策略优化

arXiv cs.AI ↗ · 22小时前 缓存

本文提出DEEPO,一种双阶段强化学习优化方法,通过解决从奖励到参数更新的纠正链中的弱点,以减少多模态大语言模型中的幻觉。

0 人收藏 0 人点赞
#mllm

一域多语:无需配对数据构建跨语言遥感MLLM的领域与语言LoRA组合

arXiv cs.CL ↗ · 2天前 缓存

本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。

0 人收藏 0 人点赞
#mllm

VideoMM:用于高效视频MLLMs的自适应宏微观推理

arXiv cs.AI ↗ · 2026-09-16 缓存

VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。

0 人收藏 0 人点赞
#mllm

OmniHarness:通过符号策略学习实现可泛化的视觉生成

arXiv cs.LG ↗ · 2026-09-16 缓存

OmniHarness 引入了一个基于符号策略学习的可泛化视觉生成框架,解决了多模态大型语言模型和多智能体系统的局限性,并在如 ComfyBench 等基准测试中表现出色。

0 人收藏 0 人点赞
#mllm

ReactVAU:一个用于流式视频异常理解的慢-快解耦框架

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

ReactVAU引入了一个用于实时流式视频异常理解的慢-快解耦框架,利用快速检测模块、持久化异常感知内存和按需慢速推理,以提高效率和性能。

0 人收藏 0 人点赞
#mllm

CORE: 通过重排序器蒸馏改进MLLM嵌入中的组合推理

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

CORE引入一种蒸馏方法,通过Rank-KL目标将组合排序判断从重排序器传输到嵌入模型,从而增强跨基准的组合检索性能,同时不损害标准任务。

0 人收藏 0 人点赞
#mllm

MetaSpace:具身智能体中空间认知的蜕变测试

arXiv cs.AI ↗ · 2026-08-11 缓存

MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。

0 人收藏 0 人点赞
#mllm

MoCA:隐式社会情境分析

arXiv cs.CL ↗ · 2026-08-07 缓存

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

0 人收藏 0 人点赞
#mllm

PRISM:通过结构化多模态数据合成实现优先级感知的规则内化

arXiv cs.LG ↗ · 2026-08-07 缓存

本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。

0 人收藏 0 人点赞
#mllm

面向可泛化深度伪造视频检测的多智能体取证推理

Hugging Face Daily Papers ↗ · 2026-08-07 缓存

本文介绍了 FaceVid-Forensics-100K,一个带有细粒度标注的大规模深度伪造视频数据集,并提出了一个多智能体取证推理框架(ARGUS),该框架使用四个专门的专家智能体和一个裁判智能体,在深度伪造检测上优于闭源模型。

0 人收藏 0 人点赞
#mllm

当提示变成像素:面向多模态推理的提示区域对齐

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。

0 人收藏 0 人点赞
#mllm

多模态大语言模型能否解码创造性飞跃?引入C4进行跨概念理解

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文介绍了C4,一个受认知启发的、使用中文成语进行跨概念理解的评估框架,并发现当前多模态大语言模型难以理解创造性编码的含义。

0 人收藏 0 人点赞
#mllm

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞
#mllm

ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试

arXiv cs.CL ↗ · 2026-08-05 缓存

本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。

0 人收藏 0 人点赞
#mllm

更优、更强、更快、更广:面向基于MLLM分割的结构化全掩码预测

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。

0 人收藏 0 人点赞
#mllm

一致性多参考图像编辑的评估-验证奖励

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。

0 人收藏 0 人点赞
#mllm

RoCo-ACE: 基于Rollout条件的在线蒸馏用于保留感知知识注入

arXiv cs.AI ↗ · 2026-07-29 缓存

本文介绍了RoCo-ACE,一种用于多模态大语言模型知识注入的基于Rollout条件的在线蒸馏目标。它在限制未更新行为漂移的同时,提高了注入知识的准确性。

0 人收藏 0 人点赞
#mllm

VlogReward:学习面向Vlog编辑的多维度评估

arXiv cs.AI ↗ · 2026-07-28 缓存

介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。

0 人收藏 0 人点赞
#mllm

DocOCR-Eval:一种无需真实标注、基于校正的OCR工具选择框架

arXiv cs.LG ↗ · 2026-07-21 缓存

DocOCR-Eval提出了一种无需标注的框架,采用校正和排序策略,在没有真实标签的情况下评估和选择OCR工具,并表明聚合多个多模态大语言模型能够改善与人工排序的一致性。

0 人收藏 0 人点赞
#mllm

HOMIE:基于多模态智能增强的人-物中心视频个性化

Hugging Face Daily Papers ↗ · 2026-07-20 缓存

HOMIE是一个用于人-物中心视频个性化的框架,它整合了MLLM特征以提高主体保真度和交互模式,达到了最先进的性能。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈