MaLiang-Harness: 通往图像和视频生成的可编程路径

Hugging Face Daily Papers 论文

摘要

MaLiang-Harness 引入了一个统一框架,以解决图像和视频生成中可执行程序的 Program-to-Visual 差距,在基准测试上评估了多个 MLLM,并揭示了视觉生成性能的见解。

可执行程序提供了对图像和视频构建方式的显式控制,但生成可运行的代码只是视觉创作的开始。程序可能在执行正确的同时,违反请求的构图、外观或运动。我们将这种差异定义为 Program-to-Visual (P2V) 差距,并引入 MaLiang-Harness,一个统一的框架,用于将 MLLM 驱动的视觉生成组织成一个持久的构建、检查和修订过程。其中心设计是让不断演变的视觉程序、其构建历史和验证共享一个共同的修订参考。我们将 Persistent Executable Generation (PEG) 状态定义为保留程序和任务上下文。Traceable Generation Process (TGP) 将编辑与渲染证据连接起来,而 Revision-aware Editing and Verification (REV) 支持恢复并在完成前检查当前修订。这些机制共同协调跨渲染后端的规划、执行和视觉反馈。我们在 MaLiang-IBench 上评估了 11 个强大的闭源 MLLM,在 MaLiang-VBench 上评估了 4 个,测量了生成成功率、视觉质量和计算成本。GPT-6-Astra 在两个基准测试上都达到了 100% 的生成成功率,96.0% 的图像任务和 76.9% 的视频任务满足所有质量阈值。比较还揭示了通用能力分数和视觉生成性能之间的不匹配,同样分数的模型在满足视觉要求的能力上存在显著差异。MaLiang-Harness 为研究 MLLM 如何将可执行代码转化为视觉结果提供了系统基础,揭示了可编程生成的潜力和通用基准作为这种能力预测指标的局限性。项目可在 https://github.com/gulucaptain/MaLiang-Harness 获取。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:21

论文页面 - MaLiang-Harness:通向图像与视频生成的可编程路径

来源:https://huggingface.co/papers/2609.34309

摘要

可执行程序提供了对图像和视频构建方式的显式控制,但生成可运行代码仅仅是视觉创作的起点。程序可能在执行时正确无误,却违背了请求的构图、外观或运动要求。我们将这种差异定义为“程序-视觉(P2V)鸿沟”,并介绍了 MaLiang-Harness——一个将 MLLM 驱动的视觉生成组织为构建、检查和修订持久过程的统一框架。其核心设计在于使不断演变的视觉程序、其构建历史及其验证共享一个共同的修订参考。我们将“持久可执行生成(PEG)”状态定义为保留程序和任务上下文。“可追溯生成过程(TGP)”将编辑与渲染证据连接起来,而“修订感知编辑与验证(REV)”支持恢复并在完成前检查当前修订。这些机制协同规划、执行和跨渲染后端的视觉反馈。我们在 MaLiang-IBench 上评估了 11 个强大的闭源 MLLM,在 MaLiang-VBench 上评估了 4 个,衡量生成成功率、视觉质量和计算成本。GPT-6-Astra 在两个基准测试上均实现了 100% 的生成成功率,其中 96.0% 的图像任务和 76.9% 的视频任务满足所有质量阈值。比较还揭示了通用能力分数与视觉生成性能之间的错配,得分类似的模型在满足视觉要求的能力上存在显著差异。MaLiang-Harness 为研究 MLLM 如何将可执行代码转化为视觉结果提供了系统基础,揭示了可编程生成的潜力以及通用基准作为其能力预测指标的局限性。项目地址:https://github.com/gulucaptain/MaLiang-Harness。

查看 arXiv 页面 (https://arxiv.org/abs/2609.34309)查看 PDF (https://arxiv.org/pdf/2609.34309)项目页面 (https://gulucaptain.github.io/MaLiang-Harness/)GitHub1 (https://github.com/gulucaptain/MaLiang-Harness)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.34309)

在您的代理中获取此论文:

hf papers read 2609\.34309

尚未使用最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。

引用此论文的 Spaces 0

无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。

包含此论文的收藏夹 0

无收藏夹包含此论文

将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

GUI harness [视频]

Reddit r/LocalLLaMA

一个研究项目,展示了一个 GUI harness,允许用户或 LLM 使用简单的矢量图形函数构建复杂应用程序,具有集成代码执行、历史记录管理以及支持多种开放权重 LLM。

EvoGen-Harness:学习在何处以及如何进化图像生成框架

arXiv cs.LG

本文提出了 EvoGen-Harness,一个与生成器无关的框架,围绕冻结的文本到图像模型进化多个外部职责,通过 Trace 方法实现故障归因与协同搜索,在基准测试上相比现有的单维度适配基线取得了显著提升。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。