面向工作流生成的知识中心型智能体
摘要
本文介绍了一种知识中心型框架,用于生成ComfyUI工作流,该框架从真实工作流中提炼层次化知识(伪代码、骨架、策略),并利用大语言模型(LLM)执行从任务描述到可执行结构的推理,实现了更高的节点多样性和执行成功率。
arXiv:2607.15845v1 公告类型: 新
摘要:在ComfyUI等视觉创作系统中的工作流生成不仅需要语法准确性,还需要对模块化组合进行专家级推理。现有的大语言模型方法通常将其视为直接的文本到JSON生成任务,但存在结构脆弱性,并且缺乏有效设计所需的经验知识。我们认为,成功的工作流生成需要对知识本身进行建模,包括其结构、层次和推理动态。为此,我们提出了一种知识中心型框架,该框架在多个抽象层次上学习反转、注入和推理知识。我们首先进行知识反转,从大量真实世界工作流中提炼层次化表示,从完整的伪代码和骨架到高层策略。然后,我们通过监督微调进行知识注入,教导模型从任务描述推理到策略,再从策略推理到可执行结构。在推理过程中,模型执行可逆推理以合成可执行工作流,并通过自我精炼增强结构连贯性。大量实验表明,我们的方法生成的工作流比现有系统具有更丰富的节点多样性、更连贯的结构和更高的执行成功率,为知识驱动的智能体工作流生成建立了新的基础。
查看缓存全文
缓存时间: 2026/07/20 09:23
# 面向 ComfyUI 工作流生成的以知识为中心的智能体
来源: https://arxiv.org/html/2607.15845
11instituttext:![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png)INSAIT, 索非亚大学“圣·克莱门特·奥赫里德斯基” ,◆\\lozengeAdobe Research\{zhendong\.li, lei\.sun, ruibo\.ming, danda\.paudel, luc\.vangool, jinjin\.gu\}@insait\.ai, hezhan@adobe\.com
🖂通讯作者。Lei Sun![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png),🖂Ruibo Ming![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png)He Zhang◆\\lozengeDanda Pani Paudel![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png)Luc Van Gool![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png)Jinjin Gu![[未标题图片]](https://arxiv.org/html/2607.15845v1/figs/insait-trans.png),🖂
###### 摘要
在 ComfyUI 等视觉创作系统中,工作流生成不仅需要语法正确性,还需要对模块化组合进行专家级的推理。现有的大语言模型(LLM)方法通常将其视为直接的文本转 JSON 生成任务,却难以应对结构脆弱性,并且缺乏有效设计所需的经验知识。我们认为,成功的工作流生成需要对知识本身进行建模,包括其结构、层次和推理动态。为此,我们提出一个以知识为中心的框架,该框架学习在多个抽象层次上对知识进行**反向、注入和推理**。首先,我们执行知识反向,从大量真实工作流中提取层次化表示,包括完整的伪代码、骨架以及高层策略。然后,通过有监督微调进行知识注入,教会模型从任务描述推理到策略,再从策略推理到可执行结构。在推理阶段,模型执行可逆推理来合成可执行的工作流,并通过自我精炼增强结构连贯性。大量实验表明,我们的方法生成的工作流相比现有系统具有更丰富的节点多样性、更连贯的结构以及更高的执行成功率,为知识驱动的自主工作流生成奠定了新基础。
![[未标题图片]](https://arxiv.org/html/2607.15845v1/x1.png)
图 1:给定用户任务指令,我们的智能体学习构建并执行完整的 ComfyUI 工作流。通过知识反向,它从大量真实工作流中提取伪代码结构和工作流策略。在推理阶段,智能体执行生成的工作流以产生高质量的视觉结果。该示例展示了智能体如何解释风格化编辑请求,推导出高层策略,组合相应的 ComfyUI 图,并执行以生成最终输出。
## 1 引言
现代计算机视觉模型的飞速发展已稳步将可控图像生成、创建、编辑和处理从实验室原型转变为能够应对复杂现实需求的强大工具。在实践中,技术专家和艺术家通常需要组合和协调多个模型组件来完成这些任务。这产生了一种非单一的、模块化组合的问题解决范式,其中不同的模块被编排成有向无环图(DAG),通常称为工作流,并按顺序或条件执行。ComfyUI [comfyanonymous2023comfyui] 体现了这一理念,并已成为在图像创建管线中构建此类工作流的广泛使用的可视化编程框架。开发能够自动生成和优化这些工作流的智能体,不仅具有巨大的实际意义,也提出了深刻的科学挑战。
ComfyUI 工作流可以完全表示为 JSON 配置,其中指定了所有节点、参数和互连关系。最近的一些研究尝试利用大语言模型(LLM)自动生成这些配置 [xue2025comfybench, gal2024comfygen, xu2025comfyuir1, guo2025comfymind, huang2025comfygpt, sobania2024comfygi]。然而,生成有效且高效的工作流与传统的代码或文本生成有着根本不同。它需要多层次的推理,从抽象的概念设计到具体的语法实现,每个层次都要求不同形式的知识和表示。
在策略层面,工作流设计是一个开放式的、经验驱动的过程,而非确定性的编程任务。ComfyUI 提供了丰富的节点类型和模型变体生态系统,每种都具有复杂且通常非线性的行为。它们的组合产生了巨大的组合空间,其中微小的结构变化可能导致截然不同的结果。人类设计师主要依赖隐性专长、迭代实验和直觉来判断是否需要分割、如何安排处理分支、或哪些控制模块应该交互。这种基于经验知识的启发式推理,对于 LLM 来说很难仅从文本数据中习得或复现。
在结构层面,即使知道了高层策略,将其转换为语法正确且可执行的 JSON 配置也面临重大挑战。工作流是大型离散图,具有复杂的输入-输出依赖关系。智能体不仅要推断正确的拓扑结构,还要实例化有效的节点参数并维护类型安全的数据流。JSON 语法的脆弱性,加上可能图结构的组合爆炸,使得直接的文本到配置生成极不可靠。诸如连接错误或参数绑定不一致的小错误很容易导致工作流无法执行。
这些挑战共同揭示了一个更深层次的局限:现有语言模型缺乏关于工作流组合的结构化、多层次知识。虽然它们擅长表面层的模式补全或直接的任务分解,但在推理专家工作流设计背后的层次依赖、因果逻辑和经验启发式方面却存在困难。此外,大规模直接标注此类隐性专长极不现实。为了克服这一差距,我们的主要贡献不是提出一个标准的生成管线,而是一个**以知识为中心的范式**。其核心洞察是**知识反向**:从原始的、未标注的工作流开始,恢复缺失的领域知识,然后将其重新用于增强 LLM 进行链式思维(CoT)风格的决策。
我们的方法首先从大量真实工作流中**反向出知识**,提取出策略、结构和推理的层次化表示;然后通过有监督微调将这种提炼出的知识**注入**语言模型;最后**用知识进行推理**,执行从任务描述到可执行工作流的可逆推理。这个统一的范式将工作流生成从一个特设的文本生成问题转变为一个原则性的知识推理过程,为能够以专家级可靠性组合复杂视觉管线的自主系统铺平了道路。在实践中,我们整理了一个高质量 ComfyUI 工作流集合,既用于训练也用于评估。实验结果表明,我们的方法生成的工作流具有更丰富的节点多样性、更复杂但连贯的结构以及更准确的连接性。与现有方法相比,它在成功解决的任务比例上更高。
## 2 相关工作
#### ComfyUI 与自动 ComfyUI 助手。
随着 AI 生成内容(AIGC)的持续发展 [NEURIPS2020_4c5bcfec_diffusion, NEURIPS2021_49ad23d1_diffusion],越来越多的模型和任务涌现出来,包括文本到图像生成、可控合成和图像编辑 [kumari2023multi, ruiz2023dreambooth, li2023dreamedit, zhang2023adding]。这一转变已使社区从依赖单一模型转向组合多个模型以完成更复杂和定制化的工作流。因此,ComfyUI [comfyanonymous2023comfyui] 因其灵活的基于节点的设计而变得越来越受欢迎。ComfyUI 将模块化功能节点连接成有向无环工作流,使用户能够构建和复用复杂的 AIGC 管线。然而,这些工作流可能很快变得复杂,通常涉及用于提示优化、前景-背景分割、超分辨率以及许多其他操作的节点,这产生了对自动化工作流设计工具的强烈需求。为了满足这一需求,各种自动化工作流设计工具相继出现 [gal2024comfygen, xu2025comfyuicopilot, sobania2024comfygi, chen2025symbolic, huang2025comfygpt, xu2025comfyuir1, xue2025comfybench, guo2025comfymind]。ComfyUI-Copilot [xu2025comfyuicopilot] 帮助用户选择合适的参数和模型;ComfyGen [gal2024comfygen] 专门专注于文本到图像生成;ComfyBench [xue2025comfybench] 和 ComfyMind [guo2025comfymind] 采用基于模板的组合策略,覆盖大多数常见任务,后者还提供树状回滚。同时,ComfyGPT [huang2025comfygpt] 和 ComfyUI-R1 [xu2025comfyuir1] 利用有监督微调和 GRPO [shao2024deepseekmath] 强化学习将工作流设计知识注入 LLM。然而,当社区中出现新的工作流时,这些方法必须重新训练,限制了它们未来扩展的灵活性和可扩展性。
#### LLM 与 LLM 智能体。
LLM 已迅速发展了自然语言理解和生成能力。BERT [devlin2019bert] 引入了双向掩码语言建模,极大地改进了上下文表示学习。GPT 系列 [brown2020language] 转向大规模自回归预训练,实现了少样本和上下文学习。后来,ChatGPT 和 GPT-4 [achiam2023gpt] 结合了指令微调和基于人类反馈的强化学习(RLHF)以增强对齐和交互质量。最近的模型如 LLaMA [touvron2023llama]、Qwen [yang2025qwen3]、Gemini [team2023gemini, comanici2025gemini] 进一步扩展了推理、效率和多模态能力。在这些基础之上,LLM 驱动的智能体作为自主实体出现,能够感知其环境、规划长期行动并与各种外部工具交互 [franklin1996agent, achiam2023gpt]。与传统的基于符号或强化学习的智能体 [silver2018general, hwangbo2019learning] 相比,由 LLM 驱动的智能体展现出更优越的适应性、组合推理和任务泛化能力 [chen2023autoagents, li2024multimodal]。最近的研究通过基于图的推理 [yao2024tree, besta2024graph]、动态工具利用 [qian2025toolrl, li2025torlscalingtoolintegratedrl, shen2024hugginggpt, wu2023visual] 和自我反思学习机制 [shinn2024reflexion] 进一步增强了它们的自主性。一些研究还探索了智能体工作流的自动优化。例如,GPTSwarm [zhuge2024gptswarm] 将语言智能体建模为可优化图中的节点,而 TextGrad [yuksekgonul2024textgrad] 引入了类似梯度的优化来迭代优化提示和智能体行为。此外,最近的工作研究了智能体系统的可扩展评估策略 [zhuge2024agent],而 [chen2024humans] 强调了自动评估中的潜在偏差。这些 LLM 智能体广泛应用于代码生成 [cursor2024]、医疗保健 [luo2022biogpt, singhal2023large] 和科学发现 [taylor2022galactica] 等领域。此外,作为一个具有挑战性和复杂性的问题,工作流生成也非常适合由 LLM 智能体来处理,它们可以分解任务、规划多步操作并在工具间进行协调。
参照题注 图 2:我们框架的概览。该系统由两个对称的阶段组成。(1) 知识反向从真实 ComfyUI 工作流中提炼层次化表示。(2) 知识推理反转该过程,通过策略规划器、伪代码生成器和基于规则的重构,从指令生成工作流。
## 3 方法
### 3.1 概览
生成一个 ComfyUI 工作流是一个复杂的问题,涉及多个层次的推理和表示。工作流被编码为 JSON 图,其中节点是功能模块,边描述数据或控制依赖关系。因此,工作流生成等价于产生一个有效且可执行的 JSON 文件,这比普通的文本或代码生成要精细得多。
这种复杂性在多个层面出现。人类专家不会直接从任务指令跳到 JSON。他们首先形成一个高层策略,决定整体处理方案。典型的决策包括是否需要分割,分支是否应分别处理内容,引入多少控制以及控制如何交互。这个高层策略需要大量的领域知识以及对视觉模型及其组合逻辑的直观理解。
给定策略后,专家构建工作流拓扑,即模块的结构化连接。这一步也很困难,因为图可能非常庞大、离散且复杂。对于语言模型来说,直接从文本生成 JSON 连接极其困难,这是由于语法的脆弱性和组合爆炸。拓扑形成后,可以进行参数调整和详细的模块配置,这相对更受规则或模式驱动。因此,工作流生成是一个多层次的过程,每个层次都提出了不同的推理和学习挑战。例如,将拓扑转换为完整工作流可以是基于规则的,但从任务指令和策略中推导出拓扑本身则需要大量的知识和推理能力。
我们方法的核心思想是在这些层次间进行知识反向、知识注入和知识推理。我们系统地学习大量真实工作流,提炼出底层的知识表示,并将它们集成到具有推理能力的智能体系统中。
### 3.2 知识反向
这一阶段的目标是将原始且异构的工作流数据反向为一组层次化的知识表示,使其能够被语言模型或智能体系统有效学习。如图 2(https://arxiv.org/html/2607.15845#S2.F2)(1) 所示,整个过程从底部到顶部进行,逐步抽象和重组大量原始工作流中包含的知识。
- • 从原始工作流到完整伪代码。我们首先采用**基于规则的规范化**过程,将每个工作流转换为紧凑的、机器可读的格式,称为**完整伪代码**。这种表示保留了所有模块名称、拓扑连接和参数值,同时去除了语法和 ComfyUI 特定的样式信息。这一步不涉及任何学习,并作为更高级抽象的结构基础。
- • 到骨架伪代码。下一步从完整伪代码中抽象出低层的实现细节。语言模型移除参数绑定和数值,同时保留工作流的功能拓扑。结果是一个**骨架伪代码**,仅捕获基本的图结构和执行流,提供了一个清晰的目标相似文章
UI-KOBE:面向知识的轻量级图引导GUI代理行为探索
UI-KOBE 提出了一种框架,通过构建和利用特定应用的知识图谱来增强轻量级移动GUI代理,从而提高任务规划和执行效率。
面向知识驱动工具使用工作流的AI代理声明式技能
本文研究了客户服务工作流中工具使用AI代理的编排机制,比较了声明式代理与命令式状态机及基准方法的性能。结果表明检索质量是关键瓶颈,在高质量检索下,声明式技能可提升程序性任务的准确性。
Chat2Workflow:用自然语言生成可执行可视化工作流的基准测试
Chat2Workflow 提出了一套基准与智能体框架,用于将自然语言直接转化为可执行的可视化工作流。实验表明,现有大模型虽能捕捉意图,却难以胜任工业级自动化。
SKILL.nb: 选择性形式化与门控执行用于持久化智能体工作流
介绍了SKILL.nb,一个通过证据校准的生命周期策略来管理可复用智能体工作流的框架,具有选择性形式化和门控条件执行等特点。在网页自动化基准测试中取得了显著改进,并展示了对环境漂移的鲁棒性。
吸收复杂性:面向金融LLM代理的交互原生知识驾驭架构
提出InKH,一种面向金融LLM代理的交互原生知识驾驭架构,通过结构化知识管理和时态记忆吸收用户复杂性,在延迟、令牌成本和过时知识减少方面取得显著改进。