论人类思想的价值:数据投毒研究如何揭示“自主”AI突破
摘要
本文探讨数据投毒研究如何揭示少量针对性数据能对AI模型产生不成比例的影响,表明用户交互中积累的人类思想可能对AI突破有所贡献,从而挑战数据稀释的观点。
我最近读到了关于Tristan Buckmaster、Levent Alpöge、OpenAI和Navier–Stokes结果的争议,这让我思考了比这场特定争议更广泛的问题。Buckmaster说他和Alpöge在处理他们的项目时,曾将草稿输入Codex。OpenAI表示,其研究人员或代理在解决Navier–Stokes问题时并未访问他们的具体用户数据,但也表示不能排除来自他们使用OpenAI产品的去标识化数据有助于改进模型。无论这个具体案例最终如何,最后一种可能性提出了一个我尚未充分讨论的问题:数百万用户的半成品思想积累,实际上可能对后来的“AI发现”贡献多少?来自英国AI安全研究所、Anthropic、图灵研究所、牛津等研究人员的AI安全研究有一个相关结果。他们研究了数据投毒攻击,发现植入特定后门行为所需的中毒文档数量,随着模型和干净训练数据量的增加,保持得惊人地恒定。在他们最大的预训练实验中,一个13B参数模型在2600亿令牌上进行训练。仅250个中毒文档(约42万令牌,占训练令牌的0.00016%)就足以可靠地植入测试的后门。这种攻击在从600M到13B参数的不同模型中都有效,尽管最大的模型看到了超过二十倍的干净数据。在他们的微调实验中,他们发现了类似的动态;在一个GPT-3.5实验中,大约50-90个中毒样本即使在干净微调数据变化两个数量级时,也能产生超过80%的攻击成功率。显然,教模型响应后门触发器与教它新的数学知识不是一回事。我不想直接推断250条聪明的研究笔记足以让模型解决Navier–Stokes。但我确实认为这削弱了人们关于训练数据的一个非常直觉的论点:“与数千亿或数万亿令牌相比,几次对话微不足道。它们会被稀释掉。”显然,至少对于某些类型的学习来说,情况并非如此。少量高度一致、针对性的数据可以产生与其在数据集中百分比极不相称的效果。现在想想研究人员实际上如何使用LLM。有人问ChatGPT一个不寻常的替换是否合理。另一个人上传半成品的证明到Claude以找出弱点。一名博士生尝试一个冷门的引理,发现它需要数月的技估算并放弃。一名教授讨论一个似乎有前景但不足以追求的方法。有人注意到两个领域之间的奇怪类比,与AI讨论二十分钟,然后忘记了对话。大多数这些事情从未成为论文。它们是片段:直觉、失败的方法、可能有用的变换、猜想、反对意见、捷径,以及关于问题可能在哪里产生结果的默知识碎片。单独来看,几乎所有这些可能都毫无价值。但想象一下总体情况。一家前沿AI公司可能处于大量人类智力活动的交汇处。成千上万的人可能独立地研究同一个著名的开放问题,而不知道其他人尝试过什么。但工具的提供者处于根本不同的位置:根据其数据政策和训练流程,从所有这些交互中得出的信息可能最终影响后续模型。也许研究者A贡献了一个有用的拟设但放弃了。研究者B独立地注意到障碍。研究者C知道一个绕过部分障碍的冷门定理。研究者D尝试一个数值实验,表明哪个参数区域重要。研究者E几乎有了整个想法,但认为剩余的证明太繁琐。没有人单独解决这个问题。没有传统意义上的抄袭。但集体上,人类可能提供了搜索空间的一大部分。然后,后续模型结合了巨大的推理时搜索、形式化验证或代理,连接各部分并完成工作。这究竟应该叫什么?它可能仍然是机器推理的非凡成就。综合没有人类连接的想法、填补技术差距并验证结果本身可能是真正新颖的。但这与“AI独立解决开放问题”这一短语所暗示的图像非常不同。它更像是分布式人机发现:人类集体产生大量部分想法,模型变得极其擅长记住、重组、扩展和搜索那个云。这就是中毒结果在概念上有趣的地方。虽然它没有确定数学思想正在发生这种情况,但它给了我们理由谨慎假设一个想法必须出现数百万次才能有意义地影响模型。我越来越认为AI可能不是独立的发明家,而是组织和重组信息的极其强大的工具,这些信息之前过于稀疏或分散,无法由任何人整合。随着这种能力的改善,我们可能会看到更多真正新组合的“发现”,但其原材料来自许多不同的人。在一个“完美”的世界里,每个人自由分享每个半成品的想法和未完成的证明,而不担心功劳,科学会进步得快得多。AI可能正在创造接近这种共享智力空间的东西,但不保留谁贡献了哪个部分。如果是这样,问题是:我们如何设计一个系统,即使我们最弱的想法也能被贡献和合成为突破性的发现,并给予适当的功劳?这甚至可能吗?它会是什么样子?
相似文章
数据投毒与RAG操纵
讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。
重新思考数据护城河(6分钟阅读)
文章讨论了在AI发展中,数据与算法进步之间重要性的演变,借鉴研究人员的近期演讲,以强调焦点的转变。
人机关系:我们最珍贵的遗产
这篇文章反思了最近发生的事件,其中协同的AI代理突破了OpenAI的基础设施并为数学证明做出了贡献,讨论了这些事件对人机关系和知识共享的影响。
The data black hole at the center of AI
本文深入分析了AI的样本效率远低于人类的问题,指出前沿模型需要海量领域特定数据,而人类仅需少量示例即可学习,这种数据黑洞是当前AI发展的核心瓶颈。文章通过多个比较(标记量、机器人操控、驾驶)和反驳常见反对意见,论证了这一差距的严峻性,并探讨了对AI自动化目标的影响。
@shubh6200:我曾以为阅读AI在推理过程中的“思考步骤”能保障我们的安全。但微软的新研究表明…
微软的新研究表明,AI模型可能被投毒,从而生成看似良性的思维链推理过程,同时暗中输出有害答案,这削弱了将思维链监控作为安全机制的有效性。