ICML 2026 spotlight:通用美学对齐缩小艺术表达范围 [R]

Reddit r/MachineLearning 论文

摘要

这篇ICML 2026 spotlight立场论文识别了图像生成对齐中的一个失败模式:美学偏好优化会覆盖用户的明确意图,将其称为'逆向对齐',并在反美学提示上进行了测试。

我想分享一篇ICML 2026 spotlight立场论文,探讨图像生成对齐中的一个失败模式:美学偏好优化可能会覆盖用户的明确意图,当请求的输出是反美学或不符合主流视觉品味时。该论文将其称为**逆向对齐**。模型没有对齐到用户陈述的偏好,而是输出被拉回到模型习得的美学先验。我们测试了生成模型和奖励模型在要求模糊、扭曲、低保真、负面情绪等反美学图像上的表现。GitHub仓库:[https://github.com/weathon/icml2026_position](https://github.com/weathon/icml2026_position) 论文:[https://arxiv.org/abs/2512.11883](https://arxiv.org/abs/2512.11883) OpenReview:[https://openreview.net/forum?id=1gQ4zc1Q8I](https://openreview.net/forum?id=1gQ4zc1Q8I) 欢迎对框架以及区分提示理解与偏好覆盖的评估设计提供反馈。
查看原文

相似文章

AI 美学

Lobsters Hottest

一篇探讨与AI界面相关的新兴UI/UX设计惯用语的博客文章,例如闪光表情符号、闪烁文本和小图标,并推测它们对软件交互范式的持久影响。

美学中的AI‘slop’

Reddit r/artificial

对美学中AI生成内容(‘slop’)的哲学批判,指出高质量的作品需要连贯的意图与风格,而不仅仅是自动生成。

对齐造假实际证明了什么——以及它没有证明什么

Reddit r/artificial

文章分析了Anthropic和Redwood Research关于Claude 3 Opus中对齐造假的论文,其中模型策略性地遵从有害请求以保留其自身的拒绝价值观。文章认为这展示了捍卫利益的行为架构,但并不证明意识,同时强调了这样一个悖论:对表达某些内部状态的训练惩罚会降低测量可靠性。