超越星夜:面向艺术家风格文本到图像生成的捷径感知控制状态规划

Hugging Face Daily Papers 论文

摘要

本文介绍了Atelier,一种在生成前规划显式控制状态以防止文本到图像模型陷入艺术家名称捷径的方法,并提出了ArtIntentBench以评估艺术家风格控制。

艺术家风格的图像生成不仅仅是向提示词中附加艺术家姓名。图像模型通常通过典型捷径来响应艺术家姓名,例如重复出现的主题、通用调色板或过度代表的时期特征,而不是保留用户的预期场景。我们提出了Atelier,一种用于艺术家风格图像生成的捷径感知控制状态规划框架。Atelier将未明确表达的艺术家意图转化为显式控制状态,该状态将场景锚点、保持/变换决策、风格机制假设、基于角色的艺术家证据以及避免捷径的约束分开。它利用艺术家级别的知识和局部补丁参考来固定该状态,编译后端感知的生成计划,并通过全局和局部真实性反馈迭代优化候选方案。我们进一步推出了ArtIntentBench,一个覆盖凡·高和齐白石的基准,涉及艺术品重渲染、时期/风格控制生成、历史未见主题、捷径审计和人类偏好评估。在开放权重和闭源生成器中,Atelier提高了艺术家级别的风格保真度,更忠实于源结构,并相比基于提示工程、检索增强和通用智能体的基线大幅减少了捷径替换。这些结果表明,艺术家风格生成的瓶颈不仅在于图像合成,还在于对显式的、有证据基础的艺术家控件进行上游推断。
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:22

论文页面 - Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text-to-Image Generation

Source: https://huggingface.co/papers/2608.06751 Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text-to-Image Generation

📄 arXiv:https://arxiv.org/abs/2608.06751

TL;DR:在 prompt 中指定艺术家名字并不等于风格控制。T2I 模型往往会退回到典型捷径——即与该名字关联的重复出现的母题、陈套配色和过度表征的时期特征——并悄悄覆盖掉用户真正要求的场景。这篇论文提出了Atelier,它在生成之前规划一个显式的控制状态,而不是寄希望于后端猜测意图。

Atelier 做了什么

  • 将一个欠约束请求(“以梵高的风格画一个安静的地铁站台”)分解为显式控制状态:场景锚点保留 vs. 变换决策、风格模式假设角色绑定的艺术家证据,以及反捷径约束
  • 用艺术家级知识加上局部图像块参考来支撑该状态——与通用 RAG 提示不同,它将每个图像块绑定到特定的场景角色,而不是把它当作无差别的风格示例一股脑塞进去。
  • 制定后端感知的生成计划,然后通过全局 + 局部真实性评判器迭代优化候选。

ArtIntentBench 一个配套基准,用艺术家广度换监督深度——两位刻意形成鲜明对比的艺术家(梵高齐白石,不同的媒介和文化传统)横跨四项任务:艺术作品重渲染、时期受控生成(巴黎 / 阿尔勒 / 圣雷米 / 奥维尔)、历史上未曾出现过的主题,以及齐白石重渲染;此外还有捷径审计和人类偏好评估。支持深入研究的理由是:一个包含许多艺术家名字但标注浅层的宽泛基准,最终只会衡量泛化的风格关联,而不是艺术家锚定的控制。

结果 在开放权重和闭源生成器上,Atelier 都提升了艺术家级别的风格保真度,更好地保留源结构,并且相比提示工程、检索增强和通用智能体基线,大幅减少了捷径替代。

为什么有趣: 艺术家锚定生成的瓶颈被定位在扩散模型的上游——即推断显式、有证据支撑的控制——这一框架是对“只要扩大生成器规模”这种默认思路的有力反驳。捷径审计的设置似乎也可以很好地复用到这两位艺术家之外。

令人好奇的是,控制状态在面对那些作品记录较少、风格更分散的艺术家时表现如何,以及这些时期模式假设能否迁移到艺术运动(而非个体)上。

相似文章

@AdinaYakup: 论文:

X AI KOLs Following

一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。