ToolArtist:使用工具的统一多模态模型实现智能体图像生成
摘要
介绍了ToolArtist,一个基于统一多模态模型构建的完全智能体图像生成模型,利用SFT和强化学习(RAD-GRPO)动态编排推理、工具使用和图像生成。
查看缓存全文
缓存时间: 2026/08/06 05:50
论文页面 - ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation
来源:https://huggingface.co/papers/2608.04436
摘要
文本到图像(T2I)模型能够生成视觉上引人注目的图像,但在需要复杂语义理解、多步推理以及外部世界知识整合的开放世界任务中仍然存在局限。现有工作将智能体能力引入图像生成,但它们要么规定固定工作流,要么仅将开放世界图像生成过程的一部分置于智能体控制之下。因此,推理、工具调用和图像生成并未由单一策略协调。我们提出 ToolArtist,一种通过对统一多模态模型(UMM)进行后训练而获得的完全智能体化图像生成模型。ToolArtist 在单一统一策略内动态协调推理、外部工具使用和原生图像生成。在监督微调(SFT)阶段,我们为教师智能体配备搜索工具以及图像生成工具。然后,我们将收集到的轨迹转换为与 UMM 兼容的格式,其中图像生成工具被隐藏,而生成的图像得以保留。在强化学习(RL)阶段,我们为 UMM 开发了智能体强化学习基础设施,并提出了 Reason-Act-Draw GRPO(RAD-GRPO),它使用互补的意图奖励和质量奖励来联合优化模型。实验表明,将整个开放世界图像生成过程置于智能体策略之下,始终优于采用固定流水线或仅部分组件由智能体控制的方法。我们发布了训练数据和完整的后训练基础设施。
在您的智能体中获取此论文:
hf papers read 2608\.04436
没有最新版 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型与此论文关联
在模型的 README.md 中引用 arxiv.org/abs/2608.04436,即可从本页面链接到该模型。
引用此论文的数据集 0
暂无数据集与此论文关联
在数据集的 README.md 中引用 arxiv.org/abs/2608.04436,即可从本页面链接到该数据集。
引用此论文的 Space 0
暂无 Space 与此论文关联
在 Space 的 README.md 中引用 arxiv.org/abs/2608.04436,即可从本页面链接到该 Space。
收录此论文的收藏集 0
暂无收藏集收录此论文
将这篇论文添加到收藏集中,即可从本页面链接到该收藏集。
相似文章
CanvasAgent: 通过视觉工具编排实现复杂图像创建与编辑
本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。
工具总是有益的吗?学会自适应调用工具以实现双模式多模态大语言模型推理
介绍 AutoTool,一种自适应决定是否调用工具进行多模态大语言模型推理的模型,通过强化学习和双模式推理实现了显著的准确率和效率提升。
GenClaw: 代码驱动的智能体图像生成
GenClaw 提出了一种代码驱动的智能体图像生成框架,通过模拟人类的创作过程来打破黑箱范式:概念构思、使用代码(SVG/HTML/Three.js)进行草图绘制,然后利用生成模型添加纹理和实现逼真效果。
在统一的多模态理解与生成中唤醒空间智能
本文介绍了 JoyAI-Image,这是一种统一的多模态基础模型,通过整合空间增强的多模态大语言模型(MLLM)与多模态扩散 Transformer(MMDiT),在视觉理解、文生图生成以及指令引导编辑方面取得了最先进的性能。
艺术图像AI
介绍用于生成和编辑艺术图像的AI工具,可能涵盖流行模型或平台。