MaLiang-Harness: 通往图像和视频生成的可编程路径
摘要
MaLiang-Harness 引入了一个统一框架,以解决图像和视频生成中可执行程序的 Program-to-Visual 差距,在基准测试上评估了多个 MLLM,并揭示了视觉生成性能的见解。
查看缓存全文
缓存时间: 2026/09/30 04:21
论文页面 - MaLiang-Harness:通向图像与视频生成的可编程路径
来源:https://huggingface.co/papers/2609.34309
摘要
可执行程序提供了对图像和视频构建方式的显式控制,但生成可运行代码仅仅是视觉创作的起点。程序可能在执行时正确无误,却违背了请求的构图、外观或运动要求。我们将这种差异定义为“程序-视觉(P2V)鸿沟”,并介绍了 MaLiang-Harness——一个将 MLLM 驱动的视觉生成组织为构建、检查和修订持久过程的统一框架。其核心设计在于使不断演变的视觉程序、其构建历史及其验证共享一个共同的修订参考。我们将“持久可执行生成(PEG)”状态定义为保留程序和任务上下文。“可追溯生成过程(TGP)”将编辑与渲染证据连接起来,而“修订感知编辑与验证(REV)”支持恢复并在完成前检查当前修订。这些机制协同规划、执行和跨渲染后端的视觉反馈。我们在 MaLiang-IBench 上评估了 11 个强大的闭源 MLLM,在 MaLiang-VBench 上评估了 4 个,衡量生成成功率、视觉质量和计算成本。GPT-6-Astra 在两个基准测试上均实现了 100% 的生成成功率,其中 96.0% 的图像任务和 76.9% 的视频任务满足所有质量阈值。比较还揭示了通用能力分数与视觉生成性能之间的错配,得分类似的模型在满足视觉要求的能力上存在显著差异。MaLiang-Harness 为研究 MLLM 如何将可执行代码转化为视觉结果提供了系统基础,揭示了可编程生成的潜力以及通用基准作为其能力预测指标的局限性。项目地址:https://github.com/gulucaptain/MaLiang-Harness。
查看 arXiv 页面 (https://arxiv.org/abs/2609.34309)查看 PDF (https://arxiv.org/pdf/2609.34309)项目页面 (https://gulucaptain.github.io/MaLiang-Harness/)GitHub1 (https://github.com/gulucaptain/MaLiang-Harness)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.34309)
在您的代理中获取此论文:
hf papers read 2609\.34309
尚未使用最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。
引用此论文的数据集 0
无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。
引用此论文的 Spaces 0
无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2609.34309 以从本页面链接。
包含此论文的收藏夹 0
无收藏夹包含此论文
将此论文添加到收藏夹 (https://huggingface.co/new-collection)以从本页面链接。
相似文章
OmniHarness:通过符号策略学习实现可泛化的视觉生成
OmniHarness 引入了一个基于符号策略学习的可泛化视觉生成框架,解决了多模态大型语言模型和多智能体系统的局限性,并在如 ComfyBench 等基准测试中表现出色。
GUI harness [视频]
一个研究项目,展示了一个 GUI harness,允许用户或 LLM 使用简单的矢量图形函数构建复杂应用程序,具有集成代码执行、历史记录管理以及支持多种开放权重 LLM。
EvoGen-Harness:学习在何处以及如何进化图像生成框架
本文提出了 EvoGen-Harness,一个与生成器无关的框架,围绕冻结的文本到图像模型进化多个外部职责,通过 Trace 方法实现故障归因与协同搜索,在基准测试上相比现有的单维度适配基线取得了显著提升。
Show-Harness:仅凭VLM代理即可控制机器人
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。