智能体视觉生成:从生成模型到智能体控制

Hugging Face Daily Papers 论文

摘要

本文提出一个四级框架,根据控制器对生成操作的直接决策范围,将智能体视觉生成系统分类,从固定支持到经验自适应控制。

视觉生成正从通过单次调用使用的生成模型演进为能够规划、选择工具、检查中间合成输出、修正错误并重用先前经验的智能体控制过程。在大多数现有系统中,控制器是LLM或VLM,而视觉生成模型则作为工具或执行器。然而,现有工作缺乏一个一致的标准来确定何时生成系统变得智能体化。规划深度、工具使用、多角色协作和强化学习常被视为智能体性的证据,尽管它们都不一定决定控制器能做出哪些生成决策。我们根据控制器在生成过程中能直接控制的内容来组织该领域。在L1条件控制中,控制器准备给预定生成器的输入,但不控制执行哪个视觉操作。在L2执行控制中,它选择并调用实际的生成、编辑、渲染或其他内容修改操作。在L3结果自适应控制中,它观察中间结果,并利用该观察来改变当前任务中的后续操作。在L4经验自适应控制中,它保留已完成任务的经验,并利用该经验来改变未来任务的决策。L0固定支持单独表示生成器、编辑器、评估器、奖励模型、基准测试和固定管道,没有部署的控制器进行生成级决策。这些级别描述了逐渐扩大的决策范围,而非模型大小、系统复杂性、输出质量、工具或角色数量或训练方法。将该框架应用于图像、视频、编辑、3D、世界、幻灯片和用户界面生成,揭示了控制器能力如何演进及其机制如何分布在不同级别。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:30

论文页面 - 智能体式视觉生成:从生成模型到智能体控制

来源:https://huggingface.co/papers/2609.06758

摘要

摘要提出了一个四级框架,根据控制器对生成操作的直接决策范围,对智能体式视觉生成进行分类,范围从固定支持到经验自适应控制。

视觉生成(https://huggingface.co/papers?q=Visual%20generation)正从通过单次调用使用的生成模型,演变为能够规划、选择工具、检查中间合成输出、修正失败并重用先前经验的智能体式控制(https://huggingface.co/papers?q=agentic%20control)过程。在大多数现有系统中,控制器是大语言模型或多模态大语言模型,而视觉生成(https://huggingface.co/papers?q=visual%20generation)模型则作为工具或执行器。然而,现有工作缺乏一个一致的标准来确定一个生成系统何时成为智能体式。规划深度、工具使用、多角色协作和强化学习(https://huggingface.co/papers?q=reinforcement%20learning)常被视为智能体性的证据,尽管这些因素都不一定决定控制器能够做出哪些生成决策。我们根据控制器在生成过程中能直接控制什么来组织该领域。在L1 条件控制(https://huggingface.co/papers?q=Conditioning%20Control)层级,控制器准备输入给预定义的生成器,但不控制执行哪个视觉操作。在L2 执行控制(https://huggingface.co/papers?q=Execution%20Control)层级,它选择并调用实际的生成、编辑、渲染或其他内容修改操作。在L3 结果自适应控制(https://huggingface.co/papers?q=Outcome-Adaptive%20Control)层级,它观察中间结果,并利用该观察在当前任务中改变后续操作。在L4 经验自适应控制(https://huggingface.co/papers?q=Experience-Adaptive%20Control)层级,它保留已完成任务的经验,并利用该经验改变对未来任务的决策。L0 固定支持则单独指代生成器、编辑器、评估器、奖励模型、基准测试以及没有部署能做出生成级别决策的控制器的固定流水线。这些层级描述的是逐渐扩大的决策范围,而非模型规模、系统复杂性、输出质量、工具或角色数量或训练方法。将此框架应用于图像、视频、编辑、3D、世界、幻灯片和用户界面生成,揭示了控制器能力的演进及其机制在各层级上的分布。

查看 arXiv 页面 (https://arxiv.org/abs/2609.06758) 查看 PDF (https://arxiv.org/pdf/2609.06758) GitHub24 (https://github.com/YinmingHuang/Awesome-agentic-visual-generation-model) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06758)

在您的智能体中获取此论文:

hf papers read 2609.06758

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文。

在模型的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。

引用此论文的数据集0

无数据集链接此论文。

在数据集的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。

引用此论文的 Spaces0

无 Space 链接此论文。

在 Space 的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。

包含此论文的收藏集0

无收藏集包含此论文。

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

智能体控制的生物模体

arXiv cs.AI

本文利用多项式函子和接线图,在基因调控网络与智能体软件系统之间建立了类型化接口对应关系,将五种生物模体映射为可组合的软件设计模式,以解决自主AI智能体在可靠性和安全性方面的挑战。

CogOmniControl: 基于推理的可控视频生成,通过创意意图认知

Hugging Face Daily Papers

CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。

如何解释 Agentic AI

Reddit r/artificial

一篇介绍性文章,解释 Agentic AI 的概念、特征以及它与传统AI系统的区别。