他抓取了他们所有的艺术作品用于AI,如今他正参与开发一款保护创作者的工具
摘要
一名用户从反AI艺术社区Cara平台抓取了所有公开的艺术作品,遭遇抵制后,现正与平台创始人合作开发开源工具,帮助艺术家抵御AI抓取。
专为不希望作品被用于AI训练的创作者设计的艺术作品集平台Cara,近期遭到恶意用户攻击,其数据被非法获取并公开。
查看缓存全文
缓存时间: 2026/08/28 15:17
# 他为AI抓取了他们的全部艺术作品,如今却在合作开发一个保护创作者的工具
来源:https://www.wired.com/story/he-scraped-art-from-cara-for-ai-now-he-is-collaborating-on-a-tool-to-help-them/
自2023年初起,摄影师Jingna Zhang与一小群志愿者不懈维护着名为Cara(https://cara.app/)的图片分享社交媒体及作品集应用(https://www.wired.com/tag/social-media/)。目前该平台已吸引约150万艺术家。是什么吸引他们来到这里?是对未经授权使用其作品(https://www.wired.com/story/cara-portfolio-app-artificial-intelligence-jingna-zhang/)训练AI模型的共同反对,以及渴望在避免科技巨头剥削的前提下展示自己艺术作品的追求。
尽管Cara能过滤AI生成的图像并提供保护功能——包括可屏蔽爬虫获取的图像风格以干扰AI模仿的Glaze(https://www.wired.com/story/kudurru-ai-scraping-block-poisoning-spawning/)工具,但完全阻止抓取行为几乎是不可能的。就在本月8月13日起,Cara接连遭遇三次大规模爬取,导致服务器费用激增,更让从Instagram等平台迁移至此的创作者们深感不安——在Instagram上,所有内容都明确可被Meta用作训练数据。
首次事件曝光时,涉事者在Reddit的r/DefendingAIArt子版块发布了包含1200万件作品的12TB存档——这几乎是Cara所有公开图像的完整库。这位Reddit用户MandarinDawnPoppy994在已删除的帖文中写道:“这是个有趣的项目”,并表示整个过程花费不到10美元。
“我们实际上是通过用户@我们才得知此事,”Zhang告诉Wired,因为爬取者“正在Reddit上洋洋得意,并招募他人用这些数据集做点什么”,引发了AI相关论坛对其行为伦理性的激烈辩论。“我只觉得这是针对性的伤害,”她补充道,并指出“法律尚未跟上”对此类数据收割的保护,这意味着爬取者常能以“技术合法”为由进行辩护。(Zhang还分别参与了视觉艺术家针对Stability AI、Midjourney等公司,以及针对Google的两起集体诉讼,指控这些公司的图像生成工具使用了受版权保护的作品进行训练。)
然而戏剧性转折的是,这位抓取了Cara所有艺术作品的人最终表示悔意,并同意与Zhang合作开发一款保护艺术家的开源新工具。
不幸的是,其他爬虫继续利用Cara的漏洞和有限资源趁虚而入。尽管一些AI支持者反对攻击Cara,但显然有人受MandarinDawnPoppy994的启发实施了Zhang眼中“模仿性质”的攻击。
第二位爬取者从Cara抓取了约850万个链接(https://www.reddit.com/r/antiai/comments/1vp0nu3/another_user_went_and_swept_up_cara_then_uploaded/)以及用户名、标题、标签等元数据,并上传至AI开发者平台Hugging Face(https://huggingface.co/CaptiveDreamer)。在收到大量删除请求后,Hugging Face发布声明(https://huggingface.co/datasets/CaptiveDreamer/CaraArchive/discussions/57#6a85764c9199d43e5f82ca41)表示,虽会要求用户“CaptiveDreamer”删除个人元数据,但无法处理URL链接,因为“此处未托管艺术品副本”,这些链接“指向艺术家在Cara发布的作品”。公司总结称“基于相同理由的后续版权投诉不会改变此结果”。
8月22日,第三位爬取者从Cara获取了12.3万张图片,以及包含个人信息的文本帖子和用户简介,并将其发布至Academic Torrents网站(https://academictorrents.com/details/77d4e2a65852258420a8e47bf29c8f3a5043a446)。随后Zhang发起GoFundMe众筹(https://www.gofundme.com/f/help-cara-legal-fund),目标12万美元用于支付法律费用,表示资金将用于通过网络和版权法律探索一切可能的Cara防御策略。截至周四,已筹款超10万美元,Zhang称Cara正在积极寻求更多法律援助。
Zhang不仅对爬取行为感到沮丧,更困惑于她和团队究竟能做什么来保护艺术家免受恶意行为者侵害,她指出已有用户删除作品集并离开该平台。“我们在有限范围内做了正确的事,同时保持应用可用性,”Zhang这样评价现有的安全措施,包括临时增设的登录验证等新手段,但她强调这并非解决这一互联网全局性问题的真正方案。
Zhang担心指责她导致连串攻击的人们可能不理解:Cara几乎肯定早先就被爬取过,就像其他任何网站一样,无法保证绝对安全。“如果离开Cara能让他们感觉更好,我支持,”Zhang对这些离开者表示,“但我不想让人们产生误解,以为换到其他平台更安全,事实并非如此。大型平台被爬取得更频繁,这让我更担忧。”
不过Zhang在这场战斗中获得了意外盟友——正是发起本月爬取狂潮之人。她与其对质后最终说服对方道歉并删除数据集。“他看到人们如此受伤感到非常愧疚,”Zhang说,“所以他决定帮助我们。”
“Heft”是北美某高校学生,具有软件开发背景,对数字保存和档案项目感兴趣。(因Cara事件遭受人肉搜索和死亡威胁,他要求仅使用这个网名。)通过Discord对话,Heft告诉Wired,抓取Cara最初只是技术项目,从未打算公开数据。
Heft承认自己“在Reddit上试图用数据集煽动对立的决定很愚蠢”,并“被评论区的挑衅言论带偏了”。他知道这会激怒Cara艺术家,但没料到社区会如此痛苦。他看到人们“分享因爬取事件惊恐发作的经历,描述如何删除了所有网络作品集”。通过与艺术家的直接对话,他更深刻理解到作品对他们个人的特殊意义及所有权的重要性。
“事后看来,不仅故意针对Cara,还在帖子中如此呈现都是残酷且欠考虑的,”Heft说,“我忽略了这会造成的远超些许愤怒的后果。”
他提到,虽然最初好奇数据能否用于AI训练,但他从未认为这可行,因为1200万图像“不足以训练图像模型”,且“商业AI实验室大多使用大规模网络爬取数据”,这类数据可从LAION等开源组织获得。普通用户可能在Hugging Face上传海量数据,但Heft认为“OpenAI或Anthropic扫描每个新Hugging Face数据集进行训练的可能性极低”。
摆脱理论思维并决心弥补后,Heft加入Cara的Discord服务器担任故障排查员,开始分析为何某些修复方案可能无效。“他只是帮助我们,花时间解释那些容易被爬取的技术漏洞,”Zhang说。当讨论到某个工具或设计时,Heft会演示他如何“真的只需几分钟就能突破防线”。
由于Heft“坚信没有任何网站能做到真正‘无法爬取’”,他和Zhang合作开发了一款事后干预工具。
这款名为Lantern(https://lanternite.org/)的工具允许艺术家为图像创建“单向指纹”,无需在平台存储原图。Heft说明该工具“定期扫描新的公开AI图像数据集”,若发现艺术家作品出现在其中,“艺术家将收到通知和数据集链接,以便申请删除或提交删除通知”。
Lantern才刚起步,这种在监管空白期催生的变通方案并不完美,但Zhang和Heft希望无论网站是否在条款中禁止,都能让艺术家对内容被网络汲取的过程拥有更多掌控感与知情权。此外,作为开源项目,任何人都可参与代码贡献。
Zhang对此次爬取事件后续发展的最大期望是,它能引起政策制定者超越版权问题的视角——这仅是复杂拼图中的一小块。
“遭受AI攻击将变得非常非常普遍,”她说,“而大多数攻击者不会道歉——更别说试图弥补过错了。”
相似文章
AI让大规模网页抓取变得触手可及。这是一个问题吗?
本文探讨了AI编程助手如何使普通大众能够进行大规模网页抓取,由此引发了关于忽略robots.txt和速率限制的道德问题,并对AI提供者的责任提出质疑。
Patreon 停止请求 AI 机器人不要抓取——并开始阻止它们
Patreon 已与 Cloudflare 合作,主动阻止 AI 机器人抓取创作者内容用于训练,超越了自愿的 robots.txt 方式。此举旨在让创作者更好地控制其作品被 AI 公司使用的方式。
艺术家们正对AI垃圾内容采取法律行动,有些人甚至赢了官司
艺术家们越来越多地对AI公司提起版权诉讼,指控其未经许可使用他们的作品训练模型,目前已有早期胜诉案例,法律战仍在继续。
"AI正在取代艺术家"这个观点忽略了创意社区中实际发生的情况
本文认为,关于AI取代艺术家的说法忽略了创意社区中的实际动态,艺术家们正在以微妙的方式适应和整合AI工具。
少复用软件
本文讨论了一个网站使用Anubis(一种工作量证明系统)来防止AI公司的大规模爬取,凸显了内容提供者与AI数据收集之间持续存在的斗争。