无人愿定义的AI版权问题
摘要
本文探讨了在AI训练中界定技术与法律边界以区分复制与学习的必要性,提出了一种本地优先的方法,将经授权的检索与仅抽象学习分离开来,以解决版权问题。
我们常常将几个技术上不同的事物混为一谈,统称为“AI训练”:复制源文本、检索段落、微调和学习一般概念。它们并非同一操作。
我正在构建一个名为Christine的本地优先助手,围绕一个严格的分离原则:• **经授权的检索:** 面向用户的事实性答案只能使用已承认的公共领域或明确允许的来源和片段。声明需要直接支持。如果证据不足,系统应当如实说明,而不是填补空白。• **仅抽象学习:** 对于经作者授权的非虚构类内容,系统可以自行提取关于概念、因果关系、方法和开放问题的紧凑笔记。然后丢弃原始内容。不保留段落、页面图像、可搜索文本、类源嵌入或替代副本。抽象路径不能引用或复制原始内容,并且会经过重构、近义词泄露和风格模仿测试。
这并非声称此方法能解决版权法问题。数据摄入可能产生技术性副本;管辖权和事实很重要;架构需要证据、审计和测试,而非营销语言。但它引发了一个看似不可避免的问题:如果人类阅读非虚构类书籍,保留其基本思想,并在不复制表达方式的情况下应用这些思想,那么当本地AI被设计为仅保留独立撰写的概念笔记并丢弃源材料时,应适用何种技术和法律边界?
此类系统目前正在构建中,包括离线优先系统。我们需要在“所有学习都是复制”和“所有训练都是合理使用”成为唯二立场之前界定边界。我们的法律是否只允许人类心智从作品中学习,还是我们可以定义一个真正无留存且无替代性的严格机器类比?
相似文章
在受版权保护的书籍上训练AI模型是否合法?情况复杂
本文探讨了在受版权保护的书籍上训练AI模型的法律复杂性,重点介绍了涉及Anthropic的一起法庭案件,以及将过时的版权法应用于现代AI技术所面临的挑战。
为什么关于用版权法阻止AI的讨论这么少?
讨论AI公司是否应面临版权诉讼,以强制其以合乎道德的方式获取训练数据;文章引用了Suno在德国的败诉,并主张法律应要求在使用人们的数据进行训练时获得同意。
AI只是更大规模的无授权抄袭
作者认为,AI模型通过未经同意训练受版权保护的内容构成无授权抄袭,并且AI生成的仿冒品在搜索结果中排名超过了原创者。
The copyright argument against AI, taken to its logical end, would make androids like Data illegal
文章从版权法角度论证,如果严格解读训练即侵权,那么《星际迷航》中的类人机器人Data也将违法,而人类对机器人的集体向往和战略利益决定了AI不会因版权被禁止。
欧盟法律不保护人工智能生成内容的版权
欧盟已裁定人工智能生成的内容不符合版权保护条件,这将影响人工智能创作的知识产权归属。