OmniHarness:通过符号策略学习实现可泛化的视觉生成
摘要
OmniHarness 引入了一个基于符号策略学习的可泛化视觉生成框架,解决了多模态大型语言模型和多智能体系统的局限性,并在如 ComfyBench 等基准测试中表现出色。
arXiv:2609.16057v1 公告类型:新
摘要:统一的多模态大型语言模型(MLLMs)和多智能体系统推动了视觉生成的发展。然而,仍存在三个局限性。(1)现有方法常常提炼特定任务的经验,泛化能力有限。(2)反思通常推迟到任务完成之后。(3)知识通常仅针对下游任务需求而获取。为了解决这些局限性,我们引入了 OmniHarness,一个通过符号策略学习实现可泛化视觉生成的框架。OmniHarness 将经过验证的执行抽象为视觉生成任务族的符号策略,捕获共享的流程和适用条件,同时移除实例特定的输入。该工具实例化、适配并组合这些策略以适应新任务。中间验证在执行过程中指导优化和失败恢复。通过自主查询,OmniHarness 在指定下游目标之前,自主生成并执行接近其能力极限的练习任务。执行反馈持续优化策略,同时模型参数保持不变。在六个基准测试、三个 MLLM 主干网络和三个视觉智能体框架上的实验展示了强大的性能和持续的能力扩展。在 ComfyBench 的创意任务上,OmniHarness 达到了 95.0% 的解决率,比最强的基线高出 27.5 个百分点。冻结的策略快照通过即插即用的方式改进了现有的视觉智能体系统。
查看缓存全文
缓存时间: 2026/09/16 08:35
# OmniHarness:通过符号策略学习实现通用视觉生成
来源:https://arxiv.org/html/2609.16057
\]北京航空航天大学 \]香港中文大学 \]新加坡国立大学\\contribution\[\*\]通讯作者:徐旭 \(\),刘进秀 \(\)\\checkdata\[资源\]项目主页 (https://omniharness.github.io/)代码 (https://github.com/OmniHarness/OmniHarness)
###### 摘要
统一的多模态大型语言模型 \(MLLMs\) 和多智能体系统推动了视觉生成的发展。然而,目前仍存在三个局限性:\(1\) 现有方法通常蒸馏特定任务的经验,泛化能力有限。\(2\) 反思通常延迟到任务完成之后。\(3\) 知识往往仅在应对下游任务需求时才被获取。为解决这些局限,我们提出了 **OmniHarness**,一个通过 **符号策略学习** 实现通用视觉生成的框架。OmniHarness 将经过验证的执行过程抽象为面向视觉生成任务族的 **符号策略**,捕捉共享的流程和适用条件,同时移除实例特定的输入。该框架通过实例化、适配和组合这些策略来处理新任务。中间验证在执行过程中指导细化和失败恢复。通过 **自主探索**,OmniHarness 在指定下游目标之前,自主生成并执行接近其能力极限的实践任务。执行反馈持续优化策略,而模型参数保持不变。在六个基准测试、三种MLLM骨干网络和三种视觉智能体框架上的实验表明,该方法性能强劲且能力持续扩展。在ComfyBench的创意任务上,OmniHarness达到了95.0%的解决率,超越最强基线27.5个百分点。冻结的策略快照可通过即插即用方式复用,提升现有视觉智能体系统的性能。
## 1 引言
视觉智能正沿着两条互补的路径推进有效扩展。第一条路径开发端到端的统一多模态大型语言模型 \(MLLMs\),用于视觉感知\[47 (https://arxiv.org/html/2609.16057#bib.bib7), 10 (https://arxiv.org/html/2609.16057#bib.bib8), 13 (https://arxiv.org/html/2609.16057#bib.bib9), 36 (https://arxiv.org/html/2609.16057#bib.bib19)\]、多模态推理\[54 (https://arxiv.org/html/2609.16057#bib.bib10), 74 (https://arxiv.org/html/2609.16057#bib.bib11), 20 (https://arxiv.org/html/2609.16057#bib.bib12)\] 和图像生成\[19 (https://arxiv.org/html/2609.16057#bib.bib15), 30 (https://arxiv.org/html/2609.16057#bib.bib16), 6 (https://arxiv.org/html/2609.16057#bib.bib17), 71 (https://arxiv.org/html/2609.16057#bib.bib18)\]。然而,如图1 (https://arxiv.org/html/2609.16057#S1.F1)\(a\) 所示,这种方法依赖于大规模训练数据。独立模型对显式验证和自我纠正的支持有限,且在处理复杂推理任务时可能遇到困难。这些局限性催生了第二条路径,即探索基于MLLM的多智能体系统 \(MAS\)\[49 (https://arxiv.org/html/2609.16057#bib.bib20), 69 (https://arxiv.org/html/2609.16057#bib.bib21), 76 (https://arxiv.org/html/2609.16057#bib.bib22), 73 (https://arxiv.org/html/2609.16057#bib.bib26)\]。
**自我进化的视觉MAS。** 卡尼曼的双系统理论区分了快速直觉与审慎推理\[24 (https://arxiv.org/html/2609.16057#bib.bib13)\],而神经科学证据表明,语言可能表达而非构成推理的基础\[14 (https://arxiv.org/html/2609.16057#bib.bib14)\]。这一观点启发了结合直接生成、协作推理和记忆以从经验中学习的视觉MAS\[9 (https://arxiv.org/html/2609.16057#bib.bib68), 21 (https://arxiv.org/html/2609.16057#bib.bib29), 67 (https://arxiv.org/html/2609.16057#bib.bib30)\]。然而,如图1 (https://arxiv.org/html/2609.16057#S1.F1)\(b\) 所示,许多系统仍然依赖于手动定义的ComfyUI工作流\[32 (https://arxiv.org/html/2609.16057#bib.bib28), 65 (https://arxiv.org/html/2609.16057#bib.bib3), 22 (https://arxiv.org/html/2609.16057#bib.bib4)\]或固定的通信拓扑结构\[35 (https://arxiv.org/html/2609.16057#bib.bib23), 34 (https://arxiv.org/html/2609.16057#bib.bib24), 63 (https://arxiv.org/html/2609.16057#bib.bib25)\]。近期的方法实现了提示或拓扑的自动化优化,但根据协作经验调整协调机制仍然困难\[62 (https://arxiv.org/html/2609.16057#bib.bib31), 38 (https://arxiv.org/html/2609.16057#bib.bib32), 75 (https://arxiv.org/html/2609.16057#bib.bib33)\]。保留成功的执行记录并不一定能产生可复用的技能或可靠的跨任务迁移\[18 (https://arxiv.org/html/2609.16057#bib.bib5), 37 (https://arxiv.org/html/2609.16057#bib.bib6)\]。当局限于个别案例时,此类经验仅保留了特定解决方案,而未能揭示任务族共享的原理,犹如“授人以鱼”。
**面向自我进化智能体的框架设计。** 框架协调工具、工作流和记忆,与数据和模型一起塑造智能体行为\[11 (https://arxiv.org/html/2609.16057#bib.bib75), 68 (https://arxiv.org/html/2609.16057#bib.bib74)\]。通过框架设计实现自我进化提出了三个问题:❶ **特定任务的经验能否揭示可泛化的模式?** 见树不见林。现有方法蒸馏执行经验,但通常仍局限于单个解决方案,忽略了任务族共享的模式,限制了向新任务的迁移。❷ **仅靠事后反思能否确保可靠执行?** 后见之明提供教训,但错误不会等待。许多现有方法仅在任务完成后才进行反思,允许中间错误在没有及时验证或恢复的情况下传播。❸ **被动学习能否为智能体应对未来任务做好准备?** 需求是迟来的老师。现有方法通常仅在应对下游任务需求时才获取知识,导致能力缺口直到阻碍执行时才被发现。
这些挑战引出了一个核心问题:**我们如何构建一个能够超越个案进行泛化、边行动边反思、并通过自主探索进行学习的视觉生成系统?** 参见图注。
**图1:视觉生成范式比较。** \(a\) 端到端的统一MLLMs能够实现快速的多模态生成,但缺乏审慎的推理和自我纠正能力。\(b\) 现有的多智能体系统改进了协作推理,但缺乏统一的协调和持久的知识积累。\(c\) OmniHarness整合了自主探索和反馈引导执行,以学习可复用的符号策略,实现通用视觉生成。
为解决这个核心问题,我们提出了 **OmniHarness**,一个通过 **符号策略学习** 实现通用视觉生成的框架。如图1 (https://arxiv.org/html/2609.16057#S1.F1)\(c\) 所示,OmniHarness将经过验证的执行过程蒸馏为面向视觉生成任务族的符号策略,捕捉共享的流程和适用条件,同时移除实例特定的输入。该框架通过实例化、适配和组合这些策略来处理新任务。在执行过程中,它会验证中间输出并修复失败的步骤。受到中国哲学家王阳明对“格物致知”诠释的启发\[52 (https://arxiv.org/html/2609.16057#bib.bib76)\],我们引入了自主探索。在指定下游目标之前,OmniHarness自主生成并执行实践任务,以探测其能力边界并为策略学习积累经验。执行反馈持续优化这些策略,而模型参数保持不变。冻结的策略快照支持跨视觉智能体框架的即插即用式复用。我们的贡献总结如下:
- • **符号策略学习。** 我们将经过验证的执行过程蒸馏为面向视觉生成任务族的符号策略,捕捉共享的流程和适用条件,同时移除实例特定的输入。
- • **反馈引导执行。** 我们设计了一个框架,用于实例化、适配和组合符号策略以应对新任务。对中间输出的验证在执行过程中指导工作流的细化和失败恢复,限制错误传播。
- • **自主探索。** 我们引入了自主探索机制,在指定下游目标之前学习可复用的符号策略。OmniHarness自主生成并执行实践任务,探测其能力边界,并利用执行反馈指导策略学习。
- • **实验评估。** 在六个基准测试上的实验表明,该方法性能强劲、能力持续扩展,并能跨视觉智能体框架迁移。在ComfyBench的创意任务上,OmniHarness达到了95.0%的解决率,超越了最先进的基线27.5个百分点。
## 2 相关工作
**端到端统一的MLLMs。** 统一的MLLMs在单一架构内集成视觉理解和生成能力\[50 (https://arxiv.org/html/2609.16057#bib.bib34), 15 (https://arxiv.org/html/2609.16057#bib.bib35), 61 (https://arxiv.org/html/2609.16057#bib.bib36)\]。近期的工作通过跨模态思维链\[33 (https://arxiv.org/html/2609.16057#bib.bib37), 5 (https://arxiv.org/html/2609.16057#bib.bib38)\]、多表示协同增强\[46 (https://arxiv.org/html/2609.16057#bib.bib39)\]和共享上下文视觉标记化\[42 (https://arxiv.org/html/2609.16057#bib.bib40)\]推进了推理能力。然而,标准推理对显式验证、失败恢复和持久化工作流复用的支持有限。
**智能体系统。** ComfyBench评估ComfyUI中的自主工作流构建\[65 (https://arxiv.org/html/2609.16057#bib.bib3)\],而相关系统结合规划和反馈为指定任务构建工作流\[22 (https://arxiv.org/html/2609.16057#bib.bib4), 18 (https://arxiv.org/html/2609.16057#bib.bib5)\]。近期的方法为具身智能体演化执行检查和恢复机制\[11 (https://arxiv.org/html/2609.16057#bib.bib75)\],合成特定任务的框架\[68 (https://arxiv.org/html/2609.16057#bib.bib74)\],或从传入任务中学习可复用的符号概念\[37 (https://arxiv.org/html/2609.16057#bib.bib6)\]。OmniHarness从经过验证的执行中学习符号策略,捕捉视觉生成任务族共享的原理。该框架适配并组合这些策略以应对新任务,利用中间验证在执行过程中指导细化和恢复。自主探索在指定下游目标之前,自主生成并执行实践任务以探测能力边界。执行反馈持续优化策略,而模型参数保持不变。冻结的策略快照支持跨视觉智能体框架的即插即用式复用。
## 3 OmniHarness:符号策略学习
### 3.1 自主探索
受到王阳明对“格物致知”诠释的启发\[52 (https://arxiv.org/html/2609.16057#bib.bib76)\],OmniHarness使用自主探索在指定下游目标之前学习符号策略。图2 (https://arxiv.org/html/2609.16057#S3.F2)展示了其架构。附录A.1 (https://arxiv.org/html/2609.16057#A1.SS1)和A.2 (https://arxiv.org/html/2609.16057#A1.SS2)节详细阐述了公式化、学习过程和探索配置。
**图2:OmniHarness架构。** 自主探索和反馈引导执行驱动着面向通用视觉生成的符号策略学习。策略库在OmniHarness执行期间演化,而冻结的快照支持跨视觉智能体的即插即用式复用。
**候选任务生成。** 在第 t 次迭代时,提议器使用能力空间 \(\mathcal{G}\)、场景上下文 \(c_t\) 和策略库状态 \(\mathcal{S}_t = (\mathcal{L}_t, \mathcal{F}_t)\) 生成 \(\mathcal{T}_t = \operatorname{Propose}(\mathcal{G}, c_t, \mathcal{S}_t)\)。上下文 \(c_t\) 总结了能力覆盖范围、工作流可靠性和可用源图像。工作流库 \(\mathcal{L}_t\) 将符号策略存储为面向视觉生成任务族的可复用工作流模板,而失败库 \(\mathcal{F}_t\) 存储失败证据和纠正策略。每个候选 \(\tau = (q_\tau, m_\tau, \mathcal{G}_\tau, x_\tau)\) 指定了一个描述 \(q_\tau\)、模态 \(m_\tau \in \{\mathrm{T2I}, \mathrm{I2I}\}\)、所需能力 \(\mathcal{G}_\tau \subseteq \mathcal{G}\) 和源图像 \(x_\tau \in \mathcal{X} \cup \{\bot\}\),其中对于文本到图像 (T2I),\(x_\tau = \bot\)。
**图3:在复杂和创意子集的挑战性任务上的定性比较。**
生成过程鼓励多样化的能力组合,过滤近似重复项,并避免已知的失败模式。
**可达范围内的探索。** 候选任务通过能力新颖性 \(\mathcal{N}(\tau)\) 和能力前沿分数 \(\mathcal{C}(\tau)\) 进行评分(此处省略时间索引)。对于T2I,设 \(z_\tau = z_{\mathrm{T2I}}\);对于图像到图像 (I2I),设 \(z_\tau = x_\tau\)。给定上下文 \(z\) 和能力 \(g\) 的尝试次数 \(n_t(z, g)\),\(\mathcal{N}(\tau) = \frac{1}{\|\mathcal{G}_\tau\|} \sum_{g \in \mathcal{G}_\tau} \frac{1}{\sqrt{n_t(z_\tau, g) + 1}}\) 有利于未充分探索的上下文-能力对。能力支持使用适用且未暂停的工作流 \(\mathcal{W}_t(\tau, g) \subseteq \mathcal{L}_t\)。工作流可靠性基于使用次数和成功次数,采用95% Wilson置信区间的下限。最高可靠性定义了 \(r_t(\tau, g)\),当 \(\mathcal{W}_t(\tau, g)\) 为空时使用一个小的先验值 \(\varepsilon\)。估计的任务能力遵循最弱所需能力:\(\bar{r}_t(\tau) = \min_{g \in \mathcal{G}_\tau} r_t(\tau, g)\)。可靠性细节见附录A.1.2 (https://arxiv.org/html/2609.16057#A1.SS1.SSS2)节。遵循“金发姑娘”原则\[1 (https://arxiv.org/html/2609.16057#bib.bib1), 26 (https://arxiv.org/html/2609.16057#bib.bib2)\],可学习性启发式 \(\mathcal{C}(\tau) = 4\bar{r}_t(\tau)\left(1 - \bar{r}_t(\tau)\right)\) 在 \(\bar{r}_t(\tau) = 0.5\) 时达到峰值,并对估计能力极低或极高的任务降权。OmniHarness 选择 \(\tau_t = \operatorname*{arg\,max}_{\tau \in \mathcal{T}_t} \mathcal{N}(\tau) \mathcal{C}(\tau)\),随着 \(\mathcal{S}_t\) 的演化,倾向于位于能力前沿附近的新颖任务。
### 3.2 反馈引导执行
对于实践或下游任务 \(\tau_t\),OmniHarness 通过 \((\pi_t, o_t) = \operatorname{Run}(\tau_t, c_t, \mathcal{K}, \mathcal{S}_t)\) 执行符号策略,其中 \(\pi_t\) 是任务的可执行工作流,\(o_t\) 记录状态、验证者反馈和证据。智能体共享计划、程序、验证结果和纠正措施。规划器构建有序计划 \(\rho_t = (a_{t,1}, \ldots, a_{t,J_t})\),通过 \(\rho_t = \operatorname{Plan}(\tau_t, c_t, \mathcal{K}, \mathcal{S}_t)\) ...相似文章
HarnessForge: 联合执行框架与策略演化用于自适应智能体系统
HarnessForge 提出一种用于演化LLM智能体系统的元自适应框架,通过联合优化执行框架与推理策略,在五个基准测试上对Qwen3骨干模型实现持续改进。
Show-Harness:仅凭VLM代理即可控制机器人
Show-Harness是一种方法,它使视觉语言模型能够通过离散的语义动作来控制机器人,实现零样本部署和跨不同机器人与GUI的高效微调。
GaP:一种面向变体自动化任务的图即策略多智能体自学习框架
引入图即策略(GaP),一种多智能体编码框架,通过模块化机器人技能库生成有向计算图,并利用并行模拟迭代优化任务执行,在变体自动化任务上成功率显著高于基准方法。
@omarsar0:强烈推荐。我经常声称构建agent harnesses有巨大的alpha收益。结果发现harnesses是组合…
讨论了agent harnesses作为组合通用器的概念,用于模型中扩展泛化能力,并引用了RLM harness。
面向视觉原生多模态深度搜索智能体的同策略数据演化
本文介绍了同策略数据演化(ODE)和一种视觉原生智能体框架,以提升多模态深度搜索智能体的性能。通过实现视觉证据的可重用性和闭环数据生成,ODE 显著提升了 Qwen3-VL 智能体在多个基准测试中的表现,超越了 Gemini 2.5 Pro。