超越星夜:面向艺术家风格文本到图像生成的捷径感知控制状态规划
摘要
本文介绍了Atelier,一种在生成前规划显式控制状态以防止文本到图像模型陷入艺术家名称捷径的方法,并提出了ArtIntentBench以评估艺术家风格控制。
查看缓存全文
缓存时间: 2026/08/12 08:22
论文页面 - Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text-to-Image Generation
Source: https://huggingface.co/papers/2608.06751 Beyond Starry Night: Shortcut-Aware Control-State Planning for Artist-Grounded Text-to-Image Generation
📄 arXiv:https://arxiv.org/abs/2608.06751
TL;DR:在 prompt 中指定艺术家名字并不等于风格控制。T2I 模型往往会退回到典型捷径——即与该名字关联的重复出现的母题、陈套配色和过度表征的时期特征——并悄悄覆盖掉用户真正要求的场景。这篇论文提出了Atelier,它在生成之前规划一个显式的控制状态,而不是寄希望于后端猜测意图。
Atelier 做了什么
- 将一个欠约束请求(“以梵高的风格画一个安静的地铁站台”)分解为显式控制状态:场景锚点、保留 vs. 变换决策、风格模式假设、角色绑定的艺术家证据,以及反捷径约束。
- 用艺术家级知识加上局部图像块参考来支撑该状态——与通用 RAG 提示不同,它将每个图像块绑定到特定的场景角色,而不是把它当作无差别的风格示例一股脑塞进去。
- 制定后端感知的生成计划,然后通过全局 + 局部真实性评判器迭代优化候选。
ArtIntentBench 一个配套基准,用艺术家广度换监督深度——两位刻意形成鲜明对比的艺术家(梵高和齐白石,不同的媒介和文化传统)横跨四项任务:艺术作品重渲染、时期受控生成(巴黎 / 阿尔勒 / 圣雷米 / 奥维尔)、历史上未曾出现过的主题,以及齐白石重渲染;此外还有捷径审计和人类偏好评估。支持深入研究的理由是:一个包含许多艺术家名字但标注浅层的宽泛基准,最终只会衡量泛化的风格关联,而不是艺术家锚定的控制。
结果 在开放权重和闭源生成器上,Atelier 都提升了艺术家级别的风格保真度,更好地保留源结构,并且相比提示工程、检索增强和通用智能体基线,大幅减少了捷径替代。
为什么有趣: 艺术家锚定生成的瓶颈被定位在扩散模型的上游——即推断显式、有证据支撑的控制——这一框架是对“只要扩大生成器规模”这种默认思路的有力反驳。捷径审计的设置似乎也可以很好地复用到这两位艺术家之外。
令人好奇的是,控制状态在面对那些作品记录较少、风格更分散的艺术家时表现如何,以及这些时期模式假设能否迁移到艺术运动(而非个体)上。
相似文章
@AdinaYakup: 论文:
一个新的以创作者为中心的文本到图像生成基准,Qwen-Image-Bench,通过一个包含56个可验证方面的分层分类,由统一评判模型评分,评估模型在真实世界保真度和创意生成方面的表现。
STAR: 时空自适应奖励分配用于文本到图像强化学习后训练
本文介绍STAR,一种用于文本到图像扩散模型强化学习后训练中的时空自适应奖励分配方法,通过将策略更新聚焦于相关潜在区域,改善组合对齐和文本渲染。
ICML 2026 spotlight:通用美学对齐缩小艺术表达范围 [R]
这篇ICML 2026 spotlight立场论文识别了图像生成对齐中的一个失败模式:美学偏好优化会覆盖用户的明确意图,将其称为'逆向对齐',并在反美学提示上进行了测试。
ToolArtist:使用工具的统一多模态模型实现智能体图像生成
介绍了ToolArtist,一个基于统一多模态模型构建的完全智能体图像生成模型,利用SFT和强化学习(RAD-GRPO)动态编排推理、工具使用和图像生成。
从计划到像素:学习规划和编排实现开放式图像编辑
一个针对长序列图像编辑的体验式框架,将规划与奖励驱动的执行相结合,以提高复杂多步编辑的连贯性和可靠性。