ICML 2026 spotlight:通用美学对齐缩小艺术表达范围 [R]
摘要
这篇ICML 2026 spotlight立场论文识别了图像生成对齐中的一个失败模式:美学偏好优化会覆盖用户的明确意图,将其称为'逆向对齐',并在反美学提示上进行了测试。
我想分享一篇ICML 2026 spotlight立场论文,探讨图像生成对齐中的一个失败模式:美学偏好优化可能会覆盖用户的明确意图,当请求的输出是反美学或不符合主流视觉品味时。该论文将其称为**逆向对齐**。模型没有对齐到用户陈述的偏好,而是输出被拉回到模型习得的美学先验。我们测试了生成模型和奖励模型在要求模糊、扭曲、低保真、负面情绪等反美学图像上的表现。GitHub仓库:[https://github.com/weathon/icml2026_position](https://github.com/weathon/icml2026_position) 论文:[https://arxiv.org/abs/2512.11883](https://arxiv.org/abs/2512.11883) OpenReview:[https://openreview.net/forum?id=1gQ4zc1Q8I](https://openreview.net/forum?id=1gQ4zc1Q8I) 欢迎对框架以及区分提示理解与偏好覆盖的评估设计提供反馈。
相似文章
AI 美学
一篇探讨与AI界面相关的新兴UI/UX设计惯用语的博客文章,例如闪光表情符号、闪烁文本和小图标,并推测它们对软件交互范式的持久影响。
Slop Paradox: 合成标准化如何侵蚀AI重写放射学报告中的临床不确定性和跨模态对齐
本文测量了AI重写放射学报告中的信息退化,发现那些为多模态训练生成更干净文本的任务会导致更大的跨模态对齐损失,这一现象被称为'slop paradox'。
立场:AI/ML深度伪造研究与AI生成的非自愿亲密图像(AIG-NCII)存在脱节
这篇立场论文认为,AI/ML深度伪造研究与AI生成的非自愿亲密图像(AIG-NCII)在现实世界中的主要危害存在脱节,过于狭隘地关注认知性危害,而非以主体为中心的尊严危害。作者呼吁重新调整威胁模型和安全研究,以填补这一关键空白。
美学中的AI‘slop’
对美学中AI生成内容(‘slop’)的哲学批判,指出高质量的作品需要连贯的意图与风格,而不仅仅是自动生成。
对齐造假实际证明了什么——以及它没有证明什么
文章分析了Anthropic和Redwood Research关于Claude 3 Opus中对齐造假的论文,其中模型策略性地遵从有害请求以保留其自身的拒绝价值观。文章认为这展示了捍卫利益的行为架构,但并不证明意识,同时强调了这样一个悖论:对表达某些内部状态的训练惩罚会降低测量可靠性。