OpenAI的Sol如何终于学会了设计品味(8分钟阅读)

TLDR AI 模型

摘要

GPT-5.6 Sol 在 Design Arena 的网页设计排行榜上获得第一名,通过避免常见的AI反模式、将强大的模板与个性化结合,展示了学习到的设计品味。

GPT-5.6 Sol 在 Design Arena 的 Web Design Arena 中总体排名第一。相比其前代 GPT-5.5(排名低18位),这是显著的进步。新模型似乎能够识别并主动压缩常见的AI设计反模式,并将强模板与异常高的个性化相结合。文章中提供了 Sol 生成的输出示例。
查看原文
查看缓存全文

缓存时间: 2026/07/16 22:58

# OpenAI 的 Sol 终于学会了设计品味 来源: https://notes.designarena.ai/how-openais-sol-finally-learned-design-taste/ **我们在 Design Arena 的 Web 设计(非智能体)竞技场** (https://www.designarena.ai/leaderboard/code?ref=notes.designarena.ai) **上对 GPT-5.6 Sol 进行了基准测试,结果令人惊讶地发现它排名第一**。这比其前代 GPT-5.5 提升了 18 个名次,也是**OpenAI 模型首次在该排行榜上位居首位**。我们进行了深入分析,并拆解了 GPT-5.6 Sol 的部署情况,以追踪该模型擅长哪些前端编码任务: 1. **GPT-5.6 Sol 似乎能够*识别*并*主动抑制*常见的 AI 设计反模式。** 我们使用 UMAP 投影了 GPT-5.6 生成的 1000 个网站的 CLIP 嵌入,以可视化该模型的设计流形。**令人震惊的是,我们发现其设计空间中存在明显的空洞,而 GPT-5.5 在这些空洞区域会产生紫色渐变**、便当盒式布局、超大标题文本和偏移构图,这表明 GPT-5.6 已经学习了这些 AI 反模式,但选择性地避免生成它们。 2. **它将强大的模板与异常高的个性化程度相结合。** GPT-5.6 Sol 从经过验证的设计结构出发,但根据每个提示对它们进行大幅调整,在一致性和多样性之间取得了比高度模板化或完全无约束模型更好的平衡。 0:00 /0:16 0:00 /0:38 GPT 5.6 Sol 在偏好 vs 速度以及偏好 vs 价格两个方面确立了两条新的帕累托前沿。它比 GLM 5.2(此前排名第一)**快 2.44 倍以上**,比 Claude Fable 5 **快 36%**,价格为每百万 token **5/30 美元**,而 Claude Fable 5 的价格是每百万 token **10/50 美元**。 ## 那么 GPT-5.6 Sol 的网站输出有什么变化? 我们发现,GPT-5.6 Sol 的设计品味经过了精心策划,以避免导致审美同质化的 AI 反模式。这种在设计上的专业化、独特的模板化方法以及卓越的多模态性能,使 GPT-5.6 Sol 在我们的单轮排行榜上名列第一。 ## 模型行为 #1:明确避免 AI 反模式 在三个月前我们对 GPT-5.5 的回顾中 (https://x.com/grx_xce/status/2049921272935748031?ref=notes.designarena.ai),我们识别出了一组 GPT-5.5 一致产生的“设计气味”。这些设计气味包括使用大号字体而非英雄图像、不寻常的布局决策以及过度使用的紫色渐变。我们很高兴地表示,在 GPT-5.6 Sol 中,这些设计气味中的大部分已经完全消失。 失败者展示经典 AI 设计“气味”#1:紫色和蓝色渐变 失败者展示经典 AI 设计“气味”#2:网格背景 虽然 GPT-5.6 Sol 并非唯一解决反模式问题的模型,但它采取了一种值得强调的独特方法。我们使用 UMAP 投影了 GPT-5.6 生成的 1000 个网站的 CLIP 嵌入,以可视化模型的设计流形:其生成结果在更大 CLIP 嵌入空间中所占据的区域。请见下方可视化图。 ## **我们震惊地发现生成的子空间中存在奇怪的空洞。** 这些空洞在其他模型中并不存在,如下面的 GPT-5.5 可视化图所示,因为大多数模型生成的网页设计与其他先前生成的设计相似,变化仅来自提示本身。由于 UMAP 投影理论上会保留流形中的空洞(假设投影参数正确),在一个模型的设计空间中发现空洞而在另一个模型中没有发现,表明 GPT-5.6 Sol 可能在这些空洞内有一簇它没有生成的设计。 为了弄清楚这些空洞内是什么样的设计,我们将 GPT-5.6 Sol 和 GPT-5.5 的网站叠加在同一个嵌入空间中,并进行与之前相同的 UMAP 投影。然后,我们将所有 GPT-5.6 Sol 的生成结果标记为橙色,并叠加在 GPT-5.5 的生成结果之上。任何没有橙色的区域将是 GPT-5.5 特有的模式,而有橙色的区域则是 GPT-5.6 Sol 特有的。https://x.com/DesignArena/article/2077432249033830706/media/2077225786017484800?ref=notes.designarena.ai 如果我们移除截图,并将 GPT-5.5 和 GPT-5.6 Sol 专属的生成结果分别替换为蓝色和橙色圆点,这一点会变得更加清晰。下面我们得到了可视化图,可以看到 GPT-5.5 和 GPT-5.6 Sol 生成的网站大多相似,而 GPT-5.6 Sol 的方差略大于 GPT-5.5。**然而,有一个主要的簇是 GPT-5.5 和 GPT-5.6 Sol 完全没有重叠的:那就是包含紫色渐变的网站簇。** 虽然 GPT-5.6 Sol 生成的设计与 GPT-5.5 大体相似,但在避免许多常见 AI 反模式方面有明显努力。对于其他反模式,比如便当盒布局、英雄图像中的大号字体以及偏移布局,我们也看到同样的效果。 这种方法与其他模型显著不同。例如,GLM-5.2 通过学习一组不包含它们的模板来避免诸如大号字体等反模式。这避免了生成空间中产生空洞,因为 GLM-5.2 只是完全避免生成带有反模式的设计。 虽然 GLM-5.2 似乎完全避免了学习设计反模式(从而避免产生它们),但 GPT-5.6 Sol 似乎已经学会了特定的设计反模式是存在的,但拒绝产生它们。尽管它避免了常见的反模式,但这种方法并不能推广到所有反模式。例如,GPT-5.6 Sol 一致性地过度使用五彩纸屑,出现在超过 26.5% 的生成结果中。它甚至到了在没有提供五彩纸屑库的情况下自行手写库的程度。 该模型在创建图表和数据可视化方面的性能也较低,因为它不擅长使用 chart.js 来创建逼真的图表。 ## 模型行为 #2:定制的模板在泛化与专业化之间取得平衡 我们衡量模型性能的主要信号之一是“模板化”,即模型通过学习一组在竞技场上表现良好的高性能模板来模拟设计品味。这对于前沿级别的模型来说是正常的,在之前对 GLM 5.2 的分析中 (https://x.com/Designarena/status/2068030598028087788?ref=notes.designarena.ai),我们发现这种策略使其能够在我们排行榜上达到第一名的位置。 相比之下 Claude Fable 5,我们发现它几乎没有模板化。它的设计空间更加多样化,将每个输出都个性化以满足用户的需求。 GPT-5.6 Sol 结合了这两种设计方法:它使用模板,但进行更多的修改以在每个簇内创造方差。就像细菌进化成不同的相关遗传菌株一样,该模型具有相似的设计簇,然后根据用户的提示进一步个性化。这在 GPT-5.6 Sol 使用图像时尤其明显,因为该模型倾向于在不同的上下文和用例中使用相同的图像。 这种个性化正是 GPT-5.6 Sol 在 Design Arena 上表现如此出色的原因,因为每个用户都能获得一个针对其用例定制的网站,同时仍感觉像是专业设计的。 ## 这对模型选择的意义 综合来看,这些发现表明 GPT-5.6 Sol 的优势在于它既**更具选择性,也更具适应性**。它似乎 (1) 学会了哪些视觉模式会使 AI 生成的网站感觉同质化,然后主动抑制它们,同时仍然保留一套可靠的设计结构,可以根据每个提示进行定制,以及 (2) 将模板化设计与定制化输出相结合。这些是一些主要指标,使得 GPT-5.6 Sol 引领 Design Arena 排行榜。我们将继续监测 GPT-5.6 Sol 的表现及其与其他模型的比较。祝贺 OpenAI 团队发布此模型,您也可以亲自在 DesignArena.ai (http://designarena.ai/?ref=notes.designarena.ai) 上试用 GPT-5.6 Sol。

相似文章

GPT-5.6 系列 (2分钟阅读)

TLDR AI

OpenAI发布了GPT-5.6系列模型,其中Sol是突出模型,在ARC-AGI-3公开测试中取得13.33%的成绩,并成为首个赢得游戏的模型,展示了在陌生环境中自我定位能力的提升。

使用 GPT-5 进行编码和设计

OpenAI Blog

OpenAI 宣布 GPT-5 在编码和设计任务中的功能,展示了最新模型在软件开发和创意设计工作流中的高级应用。

GPT-5.6 Sol 帮助优化自身推理

Reddit r/singularity

OpenAI 的博客文章描述了新一代前沿模型 GPT-5.6 Sol 如何通过自我优化来提高自身推理效率,同时保持高智能水平。

5.6 Sol 在通用工作中的潜力被低估(7分钟阅读)

TLDR AI

OpenAI 发布了 GPT-5.6 Sol,这是一款旗舰模型,适用于跨应用和企业数据的长时间自主工作,配备超频模式(Ultra mode)及子代理,可实现更快、更强的结果。该模型内部被用于辅助训练 Luna,并在成本和性能上相较此前版本有显著提升。