Aphanta: 诊断任务对齐的图像编辑中间步骤以用于多模态推理

Hugging Face Daily Papers 论文

摘要

Aphanta是一个自动化诊断框架,用于评估图像编辑中间步骤在多模态推理管道中的效用,显示任务依赖的益处,并提高特定任务的性能。

明确的视觉中间步骤可以帮助多模态大型语言模型 (MLLMs) 外化空间证据和更新视觉状态,但它们的效用取决于图像编辑器能否忠实实现所需的变换。我们引入Aphanta,一个自动化任务发现和闭环诊断框架,用于MLLM -> 图像编辑器 -> MLLM管道。Aphanta评估三种条件——直接推理、使用编辑器生成的中间步骤进行推理,以及使用理想化的参考中间步骤进行推理——以区分潜在的视觉改进空间和当前编辑器的实际效用。在20个候选任务和多个编辑器-MLLM组合中,我们发现效用强烈依赖于任务。收益集中在视觉线索注入、定位和反事实状态实现上,而需要符号敏感构造或结构外推的中间步骤则明显不太可靠。在选定的积极任务子集上,我们整合的Qwen管道将平均任务分数从0.343提高到0.445(+10.2点;相对+29.7%),同时整个研究也保留过滤和失败的任务以暴露边界。这些结果将图像编辑定位为专门的视觉工作空间而非通用推理机制,并确立Aphanta作为衡量任务-表示对齐、编辑器实现和下游管道效用的可复用协议。
查看原文
查看缓存全文

缓存时间: 2026/08/28 07:25

论文页面 - Aphanta:用于多模态推理的任务对齐图像编辑中间态诊断

来源:https://huggingface.co/papers/2608.26993

显式视觉中间态能够帮助多模态大语言模型(MLLM)外化空间证据与更新的视觉状态,但其效用取决于图像编辑器能否忠实实现所需变换。

我们提出Aphanta——一种针对“MLLM→图像编辑器→MLLM”流程的自动化任务发现与闭环诊断框架。

Aphanta评估三种条件:直接推理、基于编辑器生成中间态的推理、以及基于理想化参考中间态的推理。这使我们能够区分当前图像编辑器的潜在视觉提升空间与实际效用。

通过对20个候选任务及多种编辑器-MLLM组合的测试,我们发现视觉中间态的效用高度依赖任务类型。其优势集中体现在视觉线索注入、定位及反事实状态实现等任务中,而需要符号敏感构建或结构外推的中间态则显著不可靠。

在选定的正向任务子集上,我们的整合式Qwen流程将平均任务得分从0.343提升至0.445(+10.2分;相对提升+29.7%)。同时,完整研究仍保留了经过筛选的失败任务,以揭示视觉中间态何时有效的边界条件。

这些结果将图像编辑定位为专用视觉工作区而非通用推理机制,并确立了Aphanta作为衡量任务-表征对齐度、编辑器实现度与下游流程效用的可复用协议。

相似文章

这个编辑正确吗?一个面向推理感知的图像编辑的多维度基准

Hugging Face Daily Papers

本文介绍了RE-Edit,一个用于评估图像编辑系统的基准,涵盖五个推理维度(物理、环境、文化、因果、指代),旨在评估逻辑一致性而不仅仅是视觉合理性。该基准包含1000个样本,评估了十个开源模型和两个商业模型,结果表明即使是先进系统在隐式多维度推理方面也存在困难。

ETCHR:编辑以澄清和利用推理

Hugging Face Daily Papers

ETCHR是一种新颖的图像编辑方法,它将视觉推理与图像生成解耦,采用两阶段训练过程(推理模仿和推理增强)来提升多模态语言模型在五个视觉推理任务上的性能。在Qwen3-VL-8B、Gemini-3.1-Flash-Lite和Kimi K2.5等模型上,Pass@1持续提升4-5%。

从ML预测到基于Toulmin论证模型的知情诊断辅助

arXiv cs.AI

本文提出一个框架,利用Toulmin论证模型对基于OCT图像的ML视网膜诊断进行结构化,整合生物标志物提取、医学大语言模型推理(MedGemma)和相似度度量(MedSigLip),以实现可解释且基于证据的诊断辅助。