mllm

标签

Cards List
#mllm

MLLM 为何失败及其原因:面向能力失败诊断的因果任务分解

arXiv cs.CL ↗ · 4天前 缓存

该论文提出了一种因果分解框架,用于判定 MLLM 在组合任务上的失败究竟源于其内在能力不足,还是来自上游前置知识缺失所引发的级联错误;同时推出了 CADET 基准,包含 46 项单元任务和超过 33,000 条标注问题,研究发现:补充关键前置条件后,模型表现出的推理能力缺陷在很大程度上会消失。

0 人收藏 0 人点赞
#mllm

多模态大语言模型能否生成并检测多模态社交媒体假新闻?

arXiv cs.CL ↗ · 5天前 缓存

EMNLP Findings 2026 的一篇论文提出了一种多智能体框架(包括文本、图像和批评者智能体),生成了 9,000 多条多模态假新闻帖子,并对 16 个开源和闭源多模态大语言模型进行了基准测试。结果发现这些模型的检测准确率尚达不到人类水平,尤其在判断图像真实性方面表现不佳。

0 人收藏 0 人点赞
#mllm

ThinkV2V:释放多模态大语言模型在指令引导视频编辑中的推理能力

Hugging Face Daily Papers ↗ · 6天前 缓存

ThinkV2V 提出一个推理驱动的框架,在视觉生成之前激活 MLLM 的思考过程,用于指令引导的视频编辑。该框架采用 MLLM-to-DiT 架构,结合渐进式课程训练与推理时思维扩展技术。作者还发布了 ThinkV2V-150K 数据集和 ThinkV2V-Bench,实验表明其 5B 规模的 DiT 模型性能超越了更大的 10B 基线模型。

0 人收藏 0 人点赞
#mllm

MaLiang-Harness: 通往图像和视频生成的可编程路径

Hugging Face Daily Papers ↗ · 2026-09-28 缓存

MaLiang-Harness 引入了一个统一框架,以解决图像和视频生成中可执行程序的 Program-to-Visual 差距,在基准测试上评估了多个 MLLM,并揭示了视觉生成性能的见解。

0 人收藏 0 人点赞
#mllm

DEEPO: 针对多模态大语言模型幻觉的双熵增强策略优化

arXiv cs.AI ↗ · 2026-09-25 缓存

本文提出DEEPO,一种双阶段强化学习优化方法,通过解决从奖励到参数更新的纠正链中的弱点,以减少多模态大语言模型中的幻觉。

0 人收藏 0 人点赞
#mllm

一域多语:无需配对数据构建跨语言遥感MLLM的领域与语言LoRA组合

arXiv cs.CL ↗ · 2026-09-23 缓存

本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。

0 人收藏 0 人点赞
#mllm

VideoMM:用于高效视频MLLMs的自适应宏微观推理

arXiv cs.AI ↗ · 2026-09-16 缓存

VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。

0 人收藏 0 人点赞
#mllm

OmniHarness:通过符号策略学习实现可泛化的视觉生成

arXiv cs.LG ↗ · 2026-09-16 缓存

OmniHarness 引入了一个基于符号策略学习的可泛化视觉生成框架,解决了多模态大型语言模型和多智能体系统的局限性,并在如 ComfyBench 等基准测试中表现出色。

0 人收藏 0 人点赞
#mllm

ReactVAU:一个用于流式视频异常理解的慢-快解耦框架

Hugging Face Daily Papers ↗ · 2026-09-07 缓存

ReactVAU引入了一个用于实时流式视频异常理解的慢-快解耦框架,利用快速检测模块、持久化异常感知内存和按需慢速推理,以提高效率和性能。

0 人收藏 0 人点赞
#mllm

CORE: 通过重排序器蒸馏改进MLLM嵌入中的组合推理

Hugging Face Daily Papers ↗ · 2026-09-03 缓存

CORE引入一种蒸馏方法,通过Rank-KL目标将组合排序判断从重排序器传输到嵌入模型,从而增强跨基准的组合检索性能,同时不损害标准任务。

0 人收藏 0 人点赞
#mllm

MetaSpace:具身智能体中空间认知的蜕变测试

arXiv cs.AI ↗ · 2026-08-11 缓存

MetaSpace 是一个框架,应用蜕变测试来评估具身智能体的空间认知能力,从执行轨迹中生成测试用例,并将逻辑/物理约束编码为 Prolog 规则。基准测试表明,最先进的 MLLM 驱动的智能体在空间认知上的得分远低于人类水平,其中方向性任务尤为薄弱。

0 人收藏 0 人点赞
#mllm

MoCA:隐式社会情境分析

arXiv cs.CL ↗ · 2026-08-07 缓存

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

0 人收藏 0 人点赞
#mllm

PRISM:通过结构化多模态数据合成实现优先级感知的规则内化

arXiv cs.LG ↗ · 2026-08-07 缓存

本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。

0 人收藏 0 人点赞
#mllm

面向可泛化深度伪造视频检测的多智能体取证推理

Hugging Face Daily Papers ↗ · 2026-08-07 缓存

本文介绍了 FaceVid-Forensics-100K,一个带有细粒度标注的大规模深度伪造视频数据集,并提出了一个多智能体取证推理框架(ARGUS),该框架使用四个专门的专家智能体和一个裁判智能体,在深度伪造检测上优于闭源模型。

0 人收藏 0 人点赞
#mllm

当提示变成像素:面向多模态推理的提示区域对齐

arXiv cs.AI ↗ · 2026-08-06 缓存

本文介绍了可视化任务语义(VTS),一种受控干预方法,用于研究多模态大语言模型在图像中而非文本中被提问时的情况。研究显示,在所有测试模型和任务上,准确率均出现一致下降,并提出了提示区域对齐(prompt-region grounding)以恢复干净的任务表示,将VTS准确率从58.0提升至66.3。

0 人收藏 0 人点赞
#mllm

多模态大语言模型能否解码创造性飞跃?引入C4进行跨概念理解

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

本文介绍了C4,一个受认知启发的、使用中文成语进行跨概念理解的评估框架,并发现当前多模态大语言模型难以理解创造性编码的含义。

0 人收藏 0 人点赞
#mllm

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers ↗ · 2026-08-06 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞
#mllm

ArtECulture:多模态大语言模型中文化条件视觉情感理解的基准测试

arXiv cs.CL ↗ · 2026-08-05 缓存

本文介绍了ArtECulture,这是一个用于多模态大语言模型中文化条件视觉情感理解的基准测试,涵盖英语、中文和阿拉伯文化,并包含均衡的西方和非西方艺术作品。评估表明该任务仍具挑战性,作者提出了一种检索增强框架,将文化知识注入多模态大语言模型(MLLMs)。

0 人收藏 0 人点赞
#mllm

更优、更强、更快、更广:面向基于MLLM分割的结构化全掩码预测

Hugging Face Daily Papers ↗ · 2026-08-03 缓存

本文介绍了结构化全掩码预测(Structured All-Mask Prediction)及STAMPlus方法,这是一种基于MLLM的分割方法,通过一次非自回归过程联合预测所有目标掩码,解决了高分割性能、保持对话能力与快速推理之间的三难问题。

0 人收藏 0 人点赞
#mllm

一致性多参考图像编辑的评估-验证奖励

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈