智能体视觉生成:从生成模型到智能体控制
摘要
本文提出一个四级框架,根据控制器对生成操作的直接决策范围,将智能体视觉生成系统分类,从固定支持到经验自适应控制。
查看缓存全文
缓存时间: 2026/09/09 04:30
论文页面 - 智能体式视觉生成:从生成模型到智能体控制
来源:https://huggingface.co/papers/2609.06758
摘要
摘要提出了一个四级框架,根据控制器对生成操作的直接决策范围,对智能体式视觉生成进行分类,范围从固定支持到经验自适应控制。
视觉生成(https://huggingface.co/papers?q=Visual%20generation)正从通过单次调用使用的生成模型,演变为能够规划、选择工具、检查中间合成输出、修正失败并重用先前经验的智能体式控制(https://huggingface.co/papers?q=agentic%20control)过程。在大多数现有系统中,控制器是大语言模型或多模态大语言模型,而视觉生成(https://huggingface.co/papers?q=visual%20generation)模型则作为工具或执行器。然而,现有工作缺乏一个一致的标准来确定一个生成系统何时成为智能体式。规划深度、工具使用、多角色协作和强化学习(https://huggingface.co/papers?q=reinforcement%20learning)常被视为智能体性的证据,尽管这些因素都不一定决定控制器能够做出哪些生成决策。我们根据控制器在生成过程中能直接控制什么来组织该领域。在L1 条件控制(https://huggingface.co/papers?q=Conditioning%20Control)层级,控制器准备输入给预定义的生成器,但不控制执行哪个视觉操作。在L2 执行控制(https://huggingface.co/papers?q=Execution%20Control)层级,它选择并调用实际的生成、编辑、渲染或其他内容修改操作。在L3 结果自适应控制(https://huggingface.co/papers?q=Outcome-Adaptive%20Control)层级,它观察中间结果,并利用该观察在当前任务中改变后续操作。在L4 经验自适应控制(https://huggingface.co/papers?q=Experience-Adaptive%20Control)层级,它保留已完成任务的经验,并利用该经验改变对未来任务的决策。L0 固定支持则单独指代生成器、编辑器、评估器、奖励模型、基准测试以及没有部署能做出生成级别决策的控制器的固定流水线。这些层级描述的是逐渐扩大的决策范围,而非模型规模、系统复杂性、输出质量、工具或角色数量或训练方法。将此框架应用于图像、视频、编辑、3D、世界、幻灯片和用户界面生成,揭示了控制器能力的演进及其机制在各层级上的分布。
查看 arXiv 页面 (https://arxiv.org/abs/2609.06758) 查看 PDF (https://arxiv.org/pdf/2609.06758) GitHub24 (https://github.com/YinmingHuang/Awesome-agentic-visual-generation-model) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.06758)
在您的智能体中获取此论文:
hf papers read 2609.06758
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。
引用此论文的数据集0
无数据集链接此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。
引用此论文的 Spaces0
无 Space 链接此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.06758 以从本页面链接。
包含此论文的收藏集0
无收藏集包含此论文。
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
智能体制品创建:系统、评估、原则与机遇
本综述将智能体制品创建定义为AI系统进行的有状态、反馈驱动的交付成果构建,并分析了259篇作品以提出可问责控制的原则。
智能体控制的生物模体
本文利用多项式函子和接线图,在基因调控网络与智能体软件系统之间建立了类型化接口对应关系,将五种生物模体映射为可组合的软件设计模式,以解决自主AI智能体在可靠性和安全性方面的挑战。
CogOmniControl: 基于推理的可控视频生成,通过创意意图认知
CogOmniControl是一个基于推理的可控视频生成框架,它使用在动画制作数据上训练的专业视觉语言模型(CogVLM)从稀疏条件中推断创意意图,然后通过强化学习引导基于扩散的生成器,在新基准上取得最先进的结果。
如何解释 Agentic AI
一篇介绍性文章,解释 Agentic AI 的概念、特征以及它与传统AI系统的区别。
GenEvolve:通过工具编排的视觉经验蒸馏实现自我进化的图像生成代理
GenEvolve是一个自我进化的图像生成框架,它利用工具编排的轨迹和视觉经验蒸馏来迭代提升生成能力,取得了最先进的性能。