异星绮梦:新兴艺术图景
摘要
本文聚焦于利用 OpenAI 的 CLIP 模型作为生成式模型引导机制的新兴 AI 生成艺术场景,展示了多种文本转图像的生成实例。
<p><em>作者:<a href="https://sea-snell.github.io/">Charlie Snell</a></em></p><p>近几个月来,AI 生成艺术领域经历了一波爆发式增长。</p><p>自 OpenAI 发布 CLIP 模型的权重和代码以来,各路黑客、艺术家、研究人员及深度学习爱好者们发现了如何利用 CLIP 作为各种生成式模型的有效“自然语言方向盘”,使得艺术家仅通过向模型输入文本——无论是标题、诗歌、歌词还是单个词语——即可创作出各种有趣的视觉艺术作品。</p><p>例如,输入“夜景城市”会生成这样一幅酷炫的、带有抽象风格的都市灯光画作:</p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!Y1M4!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!Y1M4!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 424w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 848w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 1272w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!Y1M4!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png" width="480" height="480" data-attrs="{"src":"https://substack-post-media.s3.amazonaws.com/public/images/73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png","srcNoWatermark":null,"fullscreen":null,"imageSize":null,"height":480,"width":480,"resizeWidth":null,"bytes":null,"alt":null,"title":null,"type":null,"href":null,"belowTheFold":false,"topImage":true,"internalRedirect":null,"isProcessing":false,"align":null,"offset":false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!Y1M4!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 424w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 848w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 1272w, https://substackcdn.com/image/fetch/$s_!Y1M4!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div><h6>(<a href="https://twitter.com/RiversHaveWings/status/1382402580379148290?s=20">来源</a>:Twitter 用户 <a href="https://twitter.com/RiversHaveWings">@RiversHaveWings</a>)</h6><p>或者请求生成一张日落图片,则会返回这样一幅有趣的极简主义作品:</p><div class="captioned-image-container"><figure><a class="image-link image2 is-viewable-img" target="_blank" href="https://substackcdn.com/image/fetch/$s_!tRGt!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg" data-component-name="Image2ToDOM"><div class="image2-inset"><picture><source type="image/webp" srcset="https://substackcdn.com/image/fetch/$s_!tRGt!,w_424,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 424w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_848,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 848w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_1272,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 1272w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_1456,c_limit,f_webp,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 1456w" sizes="100vw"><img src="https://substackcdn.com/image/fetch/$s_!tRGt!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg" width="512" height="512" data-attrs="{"src":"https://substack-post-media.s3.amazonaws.com/public/images/273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg","srcNoWatermark":null,"fullscreen":null,"imageSize":null,"height":512,"width":512,"resizeWidth":null,"bytes":null,"alt":null,"title":null,"type":null,"href":null,"belowTheFold":false,"topImage":false,"internalRedirect":null,"isProcessing":false,"align":null,"offset":false}" class="sizing-normal" alt="" srcset="https://substackcdn.com/image/fetch/$s_!tRGt!,w_424,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 424w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_848,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 848w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_1272,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 1272w, https://substackcdn.com/image/fetch/$s_!tRGt!,w_1456,c_limit,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg 1456w" sizes="100vw" fetchpriority="high"></picture><div class="image-link-expand"><div class="pencraft pc-display-flex pc-gap-8 pc-reset"><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container restack-image"><svg role="img" width="20" height="20" viewBox="0 0 20 20" fill="none" stroke-width="1.5" stroke="var(--color-fg-primary)" stroke-linecap="round" stroke-linejoin="round" xmlns="http://www.w3.org/2000/svg"><g><title></title><path d="M2.53001 7.81595C3.49179 4.73911 6.43281 2.5 9.91173 2.5C13.1684 2.5 15.9537 4.46214 17.0852 7.23684L17.6179 8.67647M17.6179 8.67647L18.5002 4.26471M17.6179 8.67647L13.6473 6.91176M17.4995 12.1841C16.5378 15.2609 13.5967 17.5 10.1178 17.5C6.86118 17.5 4.07589 15.5379 2.94432 12.7632L2.41165 11.3235M2.41165 11.3235L1.5293 15.7353M2.41165 11.3235L6.38224 13.0882"></path></g></svg></button><button tabindex="0" type="button" class="pencraft pc-reset pencraft icon-container view-image"><svg xmlns="http://www.w3.org/2000/svg" width="20" height="20" viewBox="0 0 24 24" fill="none" stroke="currentColor" stroke-width="2" stroke-linecap="round" stroke-linejoin="round" class="lucide lucide-maximize2 lucide-maximize-2"><polyline points="15 3 21 3 21 9"></polyline><polyline points="9 21 3 21 3 15"></polyline><line x1="21" x2="14" y1="3" y2="10"></line><line x1="3" x2="10" y1="21" y2="14"></line></svg></button></div></div></div></a></figure></div>
查看缓存全文
缓存时间: 2026/05/08 08:40
# 外星之梦:新兴的艺术场景
来源:https://mlberkeley.substack.com/p/clip-art
*作者:Charlie Snell (https://sea-snell.github.io/)*
近几个月来,AI 生成艺术领域经历了一场小小的爆发。
自 OpenAI 发布其 CLIP 模型的权重和代码以来,各种黑客、艺术家、研究人员以及深度学习爱好者们发现了如何利用 CLIP 作为各种生成模型的有效“自然语言方向盘”,使得艺术家只需输入文本——无论是标题、诗歌、歌词还是单词——到这些模型中,就能创造出各种有趣的视觉艺术作品。
例如,输入“夜景城市景观”会产生这样一幅酷炫的、看似抽象的城市灯光描绘:
[](https://substackcdn.com/image/fetch/$s_!Y1M4!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F73044ffb-f36e-4a74-8a59-79a8bb9fb4db_480x480.png)
###### (来源 (https://twitter.com/RiversHaveWings/status/1382402580379148290?s=20):@RiversHaveWings (https://twitter.com/RiversHaveWings) 在 Twitter 上)
或者请求一张日落图像,则会返回这件有趣的最小主义作品:
[](https://substackcdn.com/image/fetch/$s_!tRGt!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F273d820c-8af7-4360-8b2f-a3c3c23426a1_512x512.jpeg)
###### (来源 (https://twitter.com/advadnoun/status/1369403672006963206?s=20):@Advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
请求“一个由小城堡统治的行星的抽象画”则会产生这件令人满意且致幻的作品:
[](https://substackcdn.com/image/fetch/$s_!OCNr!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fcdedf861-db06-45b7-8205-633885b15d2b_512x512.png)
###### (来源 (https://twitter.com/RiversHaveWings/status/1386755619164622848?s=20):@RiversHaveWings (https://twitter.com/RiversHaveWings) 在 Twitter 上)
将 T.S. Eliot (https://www.poetryfoundation.org/poems/47311/the-waste-land) 的诗歌《荒原》的一部分喂给系统,你会得到这件庄严而宁静的作品:
[](https://substackcdn.com/image/fetch/$s_!38O-!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F971a6bb3-55f3-4be1-9724-aec844c9c6c0_512x512.png)
###### (来源 (https://twitter.com/advadnoun/status/1367375268629770245):@Advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
你甚至可以提及具体的文化参考,它通常会给出某种程度准确的结果。查询模型以获取“吉卜力工作室风格的风景”会产生一个相当令人信服的结果:
[](https://substackcdn.com/image/fetch/$s_!TLMs!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fb14ce425-21a6-41ae-9e4b-04b2934cd8f7_560x416.jpeg)
###### (来源 (https://twitter.com/ak92501/status/1402134906931720195?s=20):@ak92501 (https://twitter.com/ak92501) 在 Twitter 上)
你也可以用同样的方法制作小型动画。在我自己的实验中,我尝试请求“星月夜”,最终得到了这个看起来相当酷炫的 gif:
[](https://substackcdn.com/image/fetch/$s_!b9Fr!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd0db5310-efdf-4bb9-b526-600050edb90f_512x512.gif)
这些模型拥有巨大的创造力:只需输入一些词语,系统就会尽最大努力以它那种奇异、抽象的风格进行渲染。玩起来真的很有趣且令人惊喜:我从来不知道会产出什么;它可能是一个致幻的伪现实景观,也可能是更抽象和极简的东西。
尽管模型在生成图像方面做了大部分工作,但在与这些模型合作时,我仍然感到富有创造力——我感觉自己像个艺术家。想出如何提示模型本身就具有真正的创造性元素。自然语言输入是一个完全开放的沙盒,如果你能驾驭文字以符合模型的喜好,你就可以创造几乎任何东西。
在概念上,这种从文本描述生成图像的想法与 OpenAI 的 DALL-E 模型极其相似(如果你看过我之前的博客 (https://ml.berkeley.edu/blog/posts/vq-vae/)文章 (https://ml.berkeley.edu/blog/posts/dalle2/),我曾详细探讨过 DALL-E 的技术内幕和哲学思想)。但事实上,这里的方法截然不同。DALL-E 是为直接从语言生产高质量图像这一唯一目的而端到端训练的,而这种 CLIP 方法更像是一种巧妙拼凑的技巧,用于利用语言来引导现有的无条件图像生成模型。
[](https://substackcdn.com/image/fetch/$s_!H49h!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F3cf1d958-94c4-4142-9e5d-91a9edc814ac_1378x460.png)
###### DALL-E 的端到端文本到图像生成工作原理的高级图示。
[](https://substackcdn.com/image/fetch/$s_!AqNB!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fd565a0be-af91-4690-ab5c-08b7ed33b272_800x392.gif)
###### CLIP 如何被用来生成艺术的高级图示。
DALL-E 的权重甚至还没有公开发布,因此你可以将这种 CLIP 工作视为黑客们试图重现 DALL-E 承诺的一种尝试。
由于基于 CLIP 的方法略显“黑客式”,其输出不如 DALL-E 演示的那样高质量和精确。相反,这些系统产生的图像怪异、致幻且抽象。输出确实扎根于我们的世界,但就好像它们是由一个以不同方式看待事物的外星人生产出来的。
正是这种怪异感使得这些基于 CLIP 的作品在我眼中如此独特且美丽。看到熟悉事物的外星视角确实有一种特别之处。
*(注:技术上 DALL-E 利用 CLIP 对其输出进行重新排序,但此处我说基于 CLIP 的方法时,并不是指 DALL-E。)*
[](https://substackcdn.com/image/fetch/$s_!Eeiz!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe94bdbf2-c5cb-4b56-9b02-0a713e07799d_1382x896.jpeg)
在过去的几个月里,我的 Twitter 时间线被这种 CLIP 生成的艺术所占据。一个不断壮大的艺术家、研究人员和黑客社区一直在试验这些模型并分享他们的输出。人们也在分享代码以及各种技巧/方法来修改所产生图像的质量或艺术风格。这一切感觉有点像是一个新兴的艺术场景。
看着这个艺术场景在一年中的发展和演变,我乐在其中,所以我觉得应该写一篇博客文章来讨论它,因为对我来说这真的很酷。
我不会深入探讨该系统生成艺术的技术细节。相反,我将记录这一艺术场景的意外起源和演变,并在过程中提出我的一些想法和一些酷炫的艺术作品。
当然,我无法在一篇博客文章中涵盖这一艺术场景的方方面面。但我觉得这篇博客涵盖了大多数主要观点和重要想法,如果你认为我遗漏了什么重要的内容,欢迎在下方评论或通过 Twitter 联系我 (https://twitter.com/sea_snell)。
2021 年 1 月 5 日,OpenAI 发布了 CLIP (https://openai.com/blog/clip/) 的模型权重和代码:这是一个经过训练以确定一组标题中哪个标题最适合给定图像的模型。通过这种方式学习了数亿张图像后,CLIP 不仅变得非常擅长为给定图像挑选最佳标题,还学习了一些令人惊讶的抽象且通用的视觉表示(参见 Goh 等人发表在 Distill (https://distill.pub/2021/multimodal-neurons/) 上的多模态神经元工作)。
例如,CLIP 学会了表示一个专门对与蜘蛛侠相关的图像和概念激活的神经元。还有其他神经元会对与情绪、地理位置甚至著名个人相关的图像激活(你可以使用 OpenAI 的显微镜工具 (https://microscope.openai.com/models) 自行探索这些神经元激活)。
这种级别的抽象图像表示在当时可以说是开创性的。除此之外,该模型还展示了比先前任何工作更强的分类鲁棒性。
因此,从研究角度来看,CLIP 是一个非常令人兴奋且强大的模型。但这里没有任何东西明确表明它有助于生成艺术——更不用说催生它所引发的艺术场景了。
尽管如此,仅仅过了一天,各种黑客、研究人员和艺术家(最著名的是 Twitter 上的 @advadnoun (https://twitter.com/advadnoun) 和 @quasimondo (https://twitter.com/quasimondo))就发现,通过一个简单的技巧,CLIP 实际上可以用来引导现有的图像生成模型(如 GANs、自编码器或像 SIREN 这样的隐式神经表示)产生符合给定标题的原创图像。
在这种方法中,CLIP 充当生成模型的某种“自然语言方向盘”。CLIP 基本上引导搜索给定生成模型的潜在空间,以找到映射到符合给定词序列图像的潜在变量。
早期使用这种技术产生的结果虽然怪异,但依然令人惊喜且充满希望:
[](https://substackcdn.com/image/fetch/$s_!2_uw!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F5946333e-9190-4cc2-8eec-294520ca34d8_1360x792.jpeg)
###### 左 –(来源 (https://twitter.com/quasimondo/status/1347956102898606081?s=20):@quasimondo (https://twitter.com/quasimondo) 在 Twitter 上);右 –(来源 (https://twitter.com/advadnoun/status/1346767585266679808?s=20):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
仅仅几周之内,就取得了突破。@advadnoun (https://twitter.com/advadnoun) 发布了《The Big Sleep》(长眠)的代码:一种基于 CLIP 的文本到图像技术,它使用 Big GAN (https://arxiv.org/abs/1809.11096) 作为生成模型。
[](https://substackcdn.com/image/fetch/$s_!OAcw!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F491171b9-35fe-455f-b85f-e5e1cc050d04_1086x1636.jpeg)
###### (来源 (https://twitter.com/advadnoun/status/1351038053033406468):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
以它独特的方式,《The Big Sleep》大致实现了文本到图像的承诺。它可以大致渲染你能用语言描述的任何东西:“日落”、“像 M.C. Escher 画作一样的脸”、“当风吹过的时候”、“3D 大峡谷”。
当然,《The Big Sleep》的输出可能不是每个人的菜。它们怪异且抽象,虽然通常全局连贯,但有时并没有太大意义。《The Big Sleep》生产的艺术作品确实有一种独特的风格,我个人觉得它在审美上是令人愉悦的。
[](https://substackcdn.com/image/fetch/$s_!7_9m!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F3c7c57c0-6bcb-42b9-800a-e49aad988144_512x512.png)
###### 《The Big Sleep》眼中的“日落”(来源 (https://twitter.com/advadnoun/status/1378226110995984386?s=20):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
[](https://substackcdn.com/image/fetch/$s_!ZnuI!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F61023d10-3792-46f0-9a2b-0170478a17e0_512x512.png)
###### 来自《The Big Sleep》的“像 M.C. Escher 画作一样的脸”(来源 (https://twitter.com/advadnoun/status/1359723192890269696):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
[](https://substackcdn.com/image/fetch/$s_!xR8n!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fa60fb234-2b96-4c6b-bd29-0f0524aac546_512x512.png)
###### 来自《The Big Sleep》的“当风吹过的时候”(来源 (https://twitter.com/advadnoun/status/1361205540970319875?s=20):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
但我在《The Big Sleep》中获得的主要惊奇和魅力并不一定来自其美学,而是更具元认知层面的意义。《The Big Sleep》在生成图像时的优化目标是找到 GAN 潜在空间中的一个点,使其在 CLIP 下最大程度地对应于给定的词序列。因此,当查看《The Big Sleep》的输出时,我们实际上看到的是 CLIP 如何解释单词,以及它认为这些单词如何对应于我们的视觉世界。
要真正欣赏这一点,你可以将 CLIP 视为统计学上的或外星的。我更喜欢后者。我喜欢把 CLIP 想象成某种外星大脑,借助《The Big Sleep》等技术,我们能够解锁并窥探它。神经网络与人类大脑非常不同,因此将 CLIP 视为某种外星大脑其实并不那么疯狂。当然,CLIP 并不是真正“智能”的,但它向我们展示了*不同*的视角,我发现这个想法非常迷人。
对 CLIP 的另一种视角/哲学则更加统计化和冷酷。你可以将 CLIP 的输出视为纯粹统计平均的产物:计算互联网上语言和视觉之间相关性结果。因此,从这个角度来看,CLIP 的输出更像是在窥探时代精神(至少是在 CLIP 训练数据被抓取时的时代精神),并以“互联网统计平均值”的方式看待事物(当然,这假设相对于数据的真实分布近似误差最小,这可能是一个不合理的假设)。
由于 CLIP 的输出如此怪异,外星视角对我而言更有意义。我认为统计时代精神视角更适用于 GPT-3 等情况,其中近似误差 presumably 相当低。
[](https://substackcdn.com/image/fetch/$s_!njPM!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F51ce01f6-8c92-4a3c-b351-98f1516a620d_512x512.png)
###### 来自《The Big Sleep》的“万物终结, crumbling buildings 和刺穿天空的武器”(来源 (https://twitter.com/advadnoun/status/1358304614337052673?s=20):@advadnoun (https://twitter.com/advadnoun) 在 Twitter 上)
###### 《The Big Sleep》眼中的“3D 大峡谷”
回顾来看,《The Big Sleep》并不是第一个捕捉到窥探神经网络“心灵”这种魔法感觉的 AI 艺术技术,但它确实比之前出现的任何技术更好地捕捉到了这种感觉。
这并不意味着旧的 AI 艺术技术无关紧要或无趣。事实上,《The Big Sleep》似乎在某种程度上受到了一个早已逝去的时代中最流行的神经网络艺术技术之一:DeepDream 的影响。
据 @advadnoun (https://twitter.com/advadnoun)(《The Big Sleep》的创作者)称:
> “《The Big Sleep》这个名字‘是对 DeepDream 和超现实主义黑色电影《长眠》(The Big Sleep)的典故。第二个引用是因为它奇怪、梦幻般的质量’(来源 (https://rynmurdock.github.io/2021/02/26/Aleph2Image.html))。”
有趣的是,@advadnoun (https://twitter.com/advadnoun) 部分以 DeepDream 命名《The Big Sleep》,因为现在回头看,它们在精神上确实有些关联。
De
相似文章
一家新的体验式画廊或许会改变你对AI艺术的看法
Dataland,世界首座AI艺术博物馆,在洛杉矶开幕,展出艺术家Refik Anadol的沉浸式装置《机器梦:雨林》。该装置使用基于合乎道德来源数据训练的自定义大型自然模型,打造互动数字展示,旨在重新定义AI艺术,超越生成式垃圾。
更好的AI图像
文章强调了陈词滥调和误导性的AI图像问题,并介绍了一个非营利项目,该项目创建并策划更准确、更多样化的AI素材图像。
艺术图像AI
介绍用于生成和编辑艺术图像的AI工具,可能涵盖流行模型或平台。
AI艺术比赛中集体创造力的动态
本研究分析了13个月内368场Artbreeder‘混音派对’中的130,882张图像,发现集体人机共创的图像趋于简化并汇聚到共同的主题吸引子(例如蒸汽朋克场景、外星建筑),同时用户矛盾地偏好混音更新颖性较低的图像,尽管新颖性会生成更活跃的子代图像。
CLIP:连接文本与图像
CLIP 是 OpenAI 的视觉语言模型,从互联网上的文本-图像对中学习,实现零样本视觉分类,无需任务特定的训练数据。它通过减少对昂贵标注数据集的依赖并提高现实世界泛化能力,解决了传统计算机视觉的主要局限性。