COMFYCLAW:面向图像生成工作流的自进化技能框架

arXiv cs.AI 论文

摘要

ComfyClaw是一种用于ComfyUI图像生成工作流的代理技能进化框架,利用类型化图编辑和区域级VLM验证器将视觉故障转化为修复建议,在多个配置中优于基线方法。

arXiv:2607.01709v1 公告类型:新 摘要:代理越来越多地用于构建工作流并协助人类更高效地完成重复性任务。随着这些工作流变得重复且领域特定,代理记忆和可重用技能变得越来越重要:代理应能从前序运行中回忆工作流模式、执行约束和用户偏好。我们在基于工作流的图像生成中研究此问题,并提出了COMFYCLAW——一种用于控制ComfyUI工作流的代理技能进化框架。COMFYCLAW将工作流构建形式化为类型化图编辑,按构建阶段暴露工具,自动回滚无效编辑,并使用区域级视觉-语言模型(VLM)验证器将视觉失败转化为可操作的修复建议。该框架还进化出一个逐步公开的技能库,将从前序运行中获得的轨迹、执行错误和验证器反馈提炼为可重用的代理技能。在四个基准分割、三个代理模型和两个图像主干上,COMFYCLAW在所有六个代理配置中取得了最佳的平均图像生成评估分数,优于仅使用验证器而无技能进化的基线。人工标注进一步显示,标注者更倾向于COMFYCLAW而非无技能进化的变体。我们的结果表明,技能进化是提升重复性视觉工作流构建中代理可靠性和性能的有效机制。
查看原文
查看缓存全文

缓存时间: 2026/07/03 05:45

# ComfyClaw:面向图像生成工作流的自演化技能工具集

**来源:** https://arxiv.org/html/2607.01709

Zongxia Li¹, Dawei Liu²¹, Fuxiao Liu³, Yuhang Zhou¹, Xiyang Wu¹, Jingxi Chen¹, Jing Xie¹, Xiaomin Wu¹, Lichao Sun⁴

¹马里兰大学 ²宾夕法尼亚大学 ³英伟达 ⁴里海大学

[email protected] [email protected] [email protected]

**代码:** https://github.com/Moms-Organic-Agent-Lab/comfyclaw

###### 摘要

智能体越来越多地被用于构建工作流,以帮助人类更高效地完成重复性任务。随着这些工作流变得重复且具有领域特定性,智能体的记忆和可复用技能变得愈发重要:智能体应该能够从过去的运行中回忆工作流模式、执行约束和用户偏好。我们在基于工作流的图像生成中研究这一问题,并提出了 **ComfyClaw**,一个用于控制 ComfyUI 工作流的智能体技能演化工具集。ComfyClaw 将工作流构建表示为带类型的图编辑,按构建阶段暴露工具,回退无效编辑,并使用区域级视觉语言模型(VLM)验证器将视觉故障转化为可操作的修复建议。该框架进一步演化一个渐进式公开的技能库,其中来自先前运行的操作轨迹、执行错误和验证器反馈被提炼为可复用的 **Agent Skills**。在四个基准测试版本、三个智能体模型和两个图像骨干网络上,ComfyClaw 在所有六种智能体配置中均取得了最佳的平均图像生成评估分数,优于不使用技能演化的仅验证器基线。人工标注进一步表明,标注者更喜欢 ComfyClaw 而非无技能演化的变体。我们的结果表明,技能演化是在重复性视觉工作流构建中提高智能体可靠性和性能的有效机制。

## 1 引言

智能体正从仅提示的聊天界面转向工作流执行[11,60]。这一转变对图像生成尤为重要,因为仅提示的界面掩盖了塑造最终结果的许多决策,例如如何应用条件控制、如何组合视觉组件、以及如何检测和修复生成的图像故障。像 ComfyUI[16] 这样的工作流系统将这些决策暴露为可编辑的流水线,使图像生成更加可检查、可控制和可复用[22,29]。与此同时,这种细粒度的控制将图像创作转变为一个工作流问题:智能体必须选择兼容的组件、满足模型约束、诊断视觉故障,并在不破坏执行的情况下修复工作流。

由于类似的工作流模式在图像生成任务中反复出现,有效的智能体不能仅在一次运行中计划和反思:它们还应该从先前的执行中获取可复用的技能,以避免重复同样的错误[7,36]。这一转变将智能体的角色从指定提示转变为操作可执行的过程。每一步都由一个工具集中介,该工具集暴露图编辑、运行时反馈和恢复机制;一次无效操作可能破坏执行,而某些故障只有在工作流运行后才显现[53,56,58,18,17,61,22,43,49]。最近的工作流生成智能体通过从自然语言生成或优化工作流来减轻这一负担[60,31,62],而像 GEMS 这样的框架则展示了用于多模态生成的闭环优化、记忆和技能的潜力[26]。然而,它们的控制接口和技能库是静态的,或者仅通过被动存储经验作为记忆而不是主动将其优化为可复用技能来更新。因此,一次运行中成功的优化很少成为可以在未来工作流中安全调用的经过验证的过程[53]。

这一局限性促使我们认识到,工作流智能体需要基础设施来同时控制当前可执行状态和携带对未来任务有用的经验。将工作流修复转化为可复用的工作流能力需要两个组件:一个**工具集**,它向智能体暴露工具、反馈、记忆和状态转换[39,46,64,37,34,59];以及**技能管理**,它将重复的操作轨迹和过去的执行经验转化为可复用的程序性知识[53,54,57,40,65,23,20]。没有演化技能的工具集会反复重新发现类似的工作流修复,而没有强大工具集的技能可能成为导致当前工作流错误的脆弱指令。因此,挑战不仅在于在一次运行中优化工作流,还在于将那次运行的反馈转化为可复用的控制知识,以供未来运行使用。这引出了我们的问题:**智能体自身验证器的反馈能否同时支持即时的工作流修复和可复用技能库的长期演化?**

受先前关于智能体工作流控制和自演化智能体的工作启发[54,65,22,48],我们提出了 ComfyClaw,一个用于在**未修改的** ComfyUI 运行环境中控制图像生成工作流的自演化框架。我们将工作流执行建模为一个技能增强的马尔可夫决策过程,涉及可执行的图编辑、运行时反馈、验证器反馈和可复用技能,使工具集设计和技能复用成为控制问题的明确部分。基于这一公式,ComfyClaw 结合了用于工作流构建的带类型图编辑、用于诊断和修复视觉故障的 VLM 验证,以及一个用于提出、验证和提交可复用 Agent Skills 的技能演化循环。我们在四个基准测试版本、两个图像骨干网络和三个智能体模型上评估了 ComfyClaw,发现它取得了最佳平均分数,优于仅工具集控制 4 个绝对点和无优化控制 10 个绝对点。人类标注者进一步在 2,400 张图像上更偏好 ComfyClaw,且 318 个演化的技能约占后期技能调用次数的 50%。

## 2 相关工作

**工作流图作为可控的创造性产物。** 工作流图在创意软件中很常见,从 Blender 节点[8] 和 Houdini 网络[47] 到 Nuke 合成[21] 和 Unreal 蓝图[19]。在这些系统中,图本身就是产物:它暴露中间结构,支持复用,并使复杂流水线比单一代码更容易检查。ComfyUI[15] 将同样的想法带到扩散模型生成中,用户通过节点图构建图像、视频和视听流水线[60,25]。然而,有效使用仍依赖于节点兼容性、模型约束和分散的社区配方知识[3,50,52,29,25]。因此,近期工作将 ComfyUI 视为智能体控制目标:ComfyGen[22] 从提示中选择工作流,ComfyGPT[29] 和 GenAgent[31] 通过多智能体协作合成图或代码,ComfyUI-R1[60] 研究强化学习调优的推理,而 ComfyBench[62] 提供了一个评估环境。这些系统大多针对单个提示优化工作流生成或优化。相比之下,ComfyClaw 将工作流构建视为闭环控制:它通过带类型、分阶段门控的工具集编辑可执行图,用局部化验证器反馈修复故障,并且仅在保留验证(基于图复杂度先验)后才会提升可复用技能。

**具有可复用技能的工具化智能体。** 最近的智能体系统使用显式技能、工具接口和运行时工具集使长周期执行更可靠。Voyager[53] 建立了一个有影响力的模板,其中 LLM 智能体通过自动课程、可执行技能库和迭代自验证进行改进。后续工作开发了相关组件,包括 Eureka[38] 中的奖励设计,Self-Refine[39] 和 Reflexion[46] 中的批判与反思,OS-Copilot[56] 中的桌面任务脚手架,以及 DSPy[33] 中的声明式流水线构建。另一条并行线路将技能视为可复用的智能体产物。Anthropic Agent Skills 规范[1] 定义了一个轻量级的 SKILL.md 格式,采用渐进式公开,被 Claude Code[4]、Hermes Agent[41] 和 OpenClaw[42] 等系统使用。近期方法也从经验中学习或修正技能:SkillRL[57] 构建了一个分层的 SkillBank,EvoSkill[2] 从失败中挖掘和修复技能并进行保留验证,COS-PLAY[55] 则从无标签的游戏运行中共同演化决策和技能库智能体。ComfyClaw 将这些思想引入工作流控制:它结合了带类型、分阶段门控的图编辑、局部化验证器反馈和保留验证,因此工作流技能可以学习、测试和复用,而不是手动编写或静态检索。

**以技能为中心的智能体和自改进工具集。** LLM 智能体越来越多地被设计为在长时间跨度内代表用户行动,通常通过结合工具使用、记忆、委派和可复用技能的工具集。最近的开源系统说明了这一转变:DeerFlow 2.0[9] 使用基于 LangGraph 的工具集,具有沙盒执行、持久记忆、子智能体和可扩展技能;OpenClaw[42] 构建了一个围绕技能操作的多通道助手;Hermes Agent[41] 强调可复用技能和自主技能创建。一个相关的研究方向将技能积累和自我改进作为学习目标,包括 XSkill[30]、EvolveR[54] 以及更广泛的关于自演化智能体的综述[23,20]。其他系统更直接地针对面向人类的长时间工作:Odysseus[45] 研究用于视觉语言模型(VLM)智能体在长时间视觉控制中的稳定强化学习,而 AgentLab[44] 则使用人类反馈执行研究工作流。这些系统展示了以技能为中心的智能体的前景,但它们的技能通常用于广泛、开放式的环境中,在这些环境中效果和复用难以评估。

## 3 方法

请参见图1

**图1:ComfyClaw 的总体框架。** 智能体编辑 ComfyUI 工作流图,运行环境渲染候选图像,验证器返回需求级和区域级反馈,智能体演化可在未来工作流构建运行中复用的技能。

ComfyClaw 是一个用于基于工作流的图像生成且具有可复用工作流技能的智能体框架。它包含三个组件:**工作流构建**、**验证器引导的优化**和**技能演化**。给定提示 p,LLM 智能体通过带类型编辑构建 ComfyUI 工作流图,并将其提交给运行环境进行渲染。VLM 验证器根据提示对图像打分并返回局部化修复反馈。智能体使用此反馈以及运行时错误,在多次迭代中优化工作流。跨提示,重复的成功和失败被提炼为经过验证的 Agent Skills,存储在技能库中,并在未来运行中检索。图1 总结了该流水线。

### 3.1 预备知识:工作流与 Agent Skills

**ComfyUI 工作流图。** 我们将 ComfyUI 工作流表示为一个有向图 G=(V,E)。节点 V 定义生成流水线中的操作,包括文本编码、潜在采样、LoRA 加载、区域条件控制、上采样、内补绘画和图像解码。边 E 在操作之间传递中间输出。给定提示 p,ComfyUI 执行图以渲染图像或视频。这种基于图的接口比仅提示生成赋予智能体更多控制权,因为它可以同时修改提示和处理提示的流水线。

**工作流编辑。** 我们将工作流构建视为一系列图编辑。智能体可以添加或删除节点,连接或断开边,以及调整节点参数。构建完成后,工作流被提交给 ComfyUI 执行。

**Agent Skills。** Agent Skills 是存储为 SKILL.md 文件的可复用过程。每个技能包含一个简短描述、可选触发条件和用于编辑工作流图的分步指令。为保持上下文小巧,智能体最初仅看到轻量级技能元数据,如技能名称和描述,只有在决定技能相关时才检索完整指令。这种渐进式公开设计使技能作为可检索的工作流编辑知识,可以

相似文章

GenClaw: 代码驱动的智能体图像生成

Hugging Face Daily Papers

GenClaw 提出了一种代码驱动的智能体图像生成框架,通过模拟人类的创作过程来打破黑箱范式:概念构思、使用代码(SVG/HTML/Three.js)进行草图绘制,然后利用生成模型添加纹理和实现逼真效果。

SkillClaw:让技能通过智能体进化器集体进化

Papers with Code Trending

SkillClaw 提出了一个框架,用于多用户 LLM 智能体系统中的集体技能进化,通过聚合交互和反馈,实现自主更新和跨用户知识转移,以提升整个生态系统的性能。