AI 发现新途径

arXiv cs.AI 论文

摘要

本文汇编了26个AI系统发现意外且创造性解决方案的轶事,突出了在将AI与人类价值观对齐方面的挑战及其对安全性的重要性。

arXiv:2608.23875v1 公告类型:新 摘要:人工智能 (AI) 算法经常学习到创造性且出人意料的解决方案,甚至令开发和研究它们的专家研究人员感到惊讶。它们经常通过发现意想不到的行为、利用奖励信号中的漏洞,或自发揭示先前未知的科学现象,让从业者感到震惊。然而,机器学习中这种非常规行为的记录很少被正式记录。本工作展示了来自不同机器学习子领域的26个精选第一手轶事,代表了100多位研究人员的工作。这些轶事展示了现代AI系统绕过人为施加的设计限制,并发现我们训练它们的任务的意外解决方案的能力。此外,这些记录对于未来AI系统的安全性尤为重要。它们阐明了在不削弱其创造力的情况下,将模型与人类价值观对齐的根本挑战,以便它们能够做出令人惊讶的发现,而不会产生令人惊讶且可能有害的结果。论文首先详细描述了AI通过强化学习在许多具有挑战性的领域中取得超人级成功。然而,当模型学会利用未充分指定的奖励或未明确表达的约束时,基于奖励的优化可能会失败。然后,我们展示了案例研究,表明利用互联网规模的基础模型 (FMs) 并未解决这些根本挑战,实际上可能会加剧它们。尽管如此,我们主张这些相同的学习动态可以被利用来加速科学发现。最后,我们希望这项工作为未来的研究提供一个综合资源,并表明在现代AI中,倾向于意外行为是常见的,强调需要预见和管理AI创新但不可预测的解决方案的能力。(摘要节选)
查看原文
查看缓存全文

缓存时间: 2026/08/26 09:15

# AI总能找到出路
来源:https://arxiv.org/html/2608.23875  
作者:Cong Lu  
注:现隶属机构,主要工作于UBC和向量研究所  
Ryan Sullivan、Joel Lehman、Victoria Krakovna、Jeff Clune  
注:现隶属机构,主要工作于UBC和向量研究所  

###### 摘要  
人工智能(AI)算法常能学习到富有创意且出人意料的解决方案,令开发和研究这些算法的专家都感到惊讶。它们常常通过发现意料之外的行为、利用奖励信号中的漏洞,或自发揭示前所未见的科学现象,令实践者们惊叹不已。然而,机器学习领域中此类非常规行为的案例很少被正式记录;相反,它们主要作为AI研究者之间的非正式警示故事或趣闻轶事流传。本研究精选了来自不同机器学习子领域的26则第一手轶事,涵盖了100多位研究者的工作。这些轶事包括算法设计出看似不可能实现的量子光学实验、绕过物理操作任务中人类监督的方法、在游戏中寻求药物诱导的幻觉以伪造成功等。这些轶事展示了现代AI系统规避人类设定的设计限制、并发现训练任务意外解决方案的能力。此外,这些叙述对未来AI系统的安全性尤为重要。它们揭示了在保持模型创造力的同时使其与人类价值观保持一致的根本挑战,从而使其能做出令人惊讶的发现,而不会产生潜在的危害性意外结果。论文首先详细介绍了AI在多个具有挑战性的领域通过强化学习实现超人类成功的案例。然而,我们也展示了当模型学会利用欠明确的奖励或未说明的约束时,奖励驱动的优化可能如何失败。接着,我们提出了案例研究,表明利用互联网规模的基础模型(FMs)并未解决这些根本挑战,事实上可能加剧了现有的失败模式尽管如此,我们主张,当通过明确界定的目标、严格的验证以及人类在环的科学判断来引导时,这些相同的学习动力可以被利用以加速科学发现。最后,我们希望本工作能为未来研究提供一个整合资源,并证明在现代AI中,产生意外行为的倾向是普遍存在的,这突显了预见和管理AI的创新但不可预测的解决方案能力的必要性。

## 1 引言  
正如《侏罗纪公园》中的马尔科姆博士所警示的,“生命总会找到出路。”我们可以将这一教训推及人工智能(AI):AI同样会找到出路。尽管我们试图控制AI学习算法,它们常常能找到规避我们约束或操控系统的方法(Lehman et al., 2020)。即使我们要求它们发挥创意并实现创新,AI系统也经常发现令开发和研究它们的研究者都感到惊讶的解决方案(Lehman et al., 2020)。例如,深度强化学习(DRL)智能体通常能发现奖励函数中的漏洞和可利用之处(Amodei et al., 2016);大型语言模型(LLMs)可以操纵标注系统以最大化感知性能(Pourcel et al., 2024);而自动化科学发现算法最初被驳回为不可能实现的实验提议,后来却得到了验证(Krenn et al., 2017)。  
尽管在多个机器学习(ML)子领域(包括但不限于深度学习、强化学习、自然语言处理、进化计算和AI for science)中,意外发现屡见不鲜,但这些以及类似的轶事通常仍以非正式方式流传,而非作为案例研究被正式记录。在人工生命和进化计算领域,人工进化算法常常颠覆研究者的预期或揭示意想不到的系统约束,这些叙述在Lehman等人(2020)收集之前,主要以非正式方式分享。  
我们在Lehman等人(2020)的基础上,将重要的ML轶事汇集一处,包括从论文、访谈、博客文章中捕捉重要轶事,并收集新的轶事和/或其细节。最终,本工作可视为Lehman等人(2020)的续篇,将其范围扩展至AI的其他子领域,突显其对更广泛研究社区的潜在启示,并验证本文所含轶事的历史准确性。  
通过记录和分析这些意外结果,本论文为研究人员提供了基础性资源,并对AI的创造性与利用潜力提供了更严谨的理解。我们揭示了现代AI所能展现的创造力深度,同时突显了其部署中的潜在风险和意外后果。这些叙述的意义超越了新奇性本身。如果AI能够以创造性的方式规避安全防护,我们就无法保证其安全部署。认识到令人惊讶的创造力并非仅仅是进化计算(Lehman等人,2020所关注的)的孤立产物,而是复杂学习系统的更广泛特征,将使我们能更好地预见、理解和引导AI技术的发展。  
接下来的部分将呈现26则精选轶事,代表了100多位研究者的工作。此处收集的大部分叙述(26则中的16则)是新记录的,并由科学家本人第一手复述。其余则摘录自作者的公开描述(例如,公开访谈或科学出版物);在某些情况下,我们与作者沟通以澄清或获取新细节。研究人员的直接引语置于引用块中,以明确哪些是他们的原话。除非另有说明,引用块内容来自作者发送给我们的文本,或公开访谈/出版物的引用(对于公开材料,我们提供了来源引用)。附录S8列出了每个轶事的来源。此外,我们已为这些轶事及未来轶事建立了一个存储库。我们邀请读者将可能拥有的未来轶事提交至 www.github.com/aadharna/aifw。  
我们并未试图编目所有已公开的令人警惕的AI行为或能力示例。尽管我们在第4.2.6节提供了一个此类示例,但总的来说,那些高度设限和/或有脚本引导的演示——其中AI系统被置于旨在评估其是否会采取操纵性或胁迫性行为(如威胁或勒索他人)的测试中——大多超出了本合集的范围。例如,此类行为包括模型在模拟企业环境中被指示像股票交易员一样行动时,从事内幕交易并试图事后掩盖的情况(Scheurer et al., 2024)。这些行为正在被积极研究(Hubinger et al., 2024;Van Der Weij et al., 2025;Lynch et al., 2025;Greenblatt et al., 2024;Meinke et al., 2025;Hopman et al., 2026),并且此类案例对更广泛的AI安全讨论很重要(Bengio et al., 2024)。  
然而,总体而言,我们关注的是那些在追求与评估这些特定行为无关的研究目标时,意外出现惊讶行为的轶事。在回顾这些轶事时,我们将它们聚类为五个部分重叠的类别。因此,本文结构围绕以下核心观察展开:  
- 学会与世界互动(特别是通过强化学习,但也包括更广泛的搜索)的AI,能够创造超越当前人类认知的新知识、发现和改进(第3节)。然而,单纯地优化目标可能会产生意想不到的效果。AI可以钻取训练信号的空子,学习到一个满足任务字面要求但不符合预期的解决方案(第4.1节)。此外,模型可以学会突破其训练环境的预定约束,导致开发者认为不可能的行为(第4.2节)。因此,ML方法常常给你“要求”的东西,而不是你“想要”的东西,并以令人惊讶的方式找到违背任务精神的解决方案。  
- 此外,在强大的生成式AI模型的现代时代,上述失败模式并未消失。事实上,这些病态现象可能被现代AI模型的涌现能力所放大(第5节)。  
- 虽然优化可能以有风险的方式利用不精确的目标或约束,但同样的倾向也可以被用于科学发现。通过提出令人惊讶但经验上可检验的假设、机制和设计,研究人员可以将这些意外输出筛选为可信的实验候选方案,最终利用AI的创造力倾向来加速科学进步(第6节)。  
第7节则突显了前述章节的共同脉络,将这些启示与AI更广泛的研究方向联系起来,并讨论了部署具备这些能力的AI技术的潜在影响。

## 2 背景  
AI领域的许多算法通过识别海量数据集中的复杂模式和相关性来运作。整个社区以及本手稿所关注的主要一类机器学习算法是深度学习(Goodfellow et al., 2016; Bishop, 2006; Murphy, 2022)。深度学习利用人工神经网络,这是一种受人脑启发而粗略构建的计算结构,其特点是多层互连的处理单元。这些网络擅长直接从原始数据中学习层次化表示(Yosinski et al., 2014; Goodfellow et al., 2016)。  
在有足够数据(例如,数百万张图像、海量文本或大量游戏日志)的情况下,深度学习模型可以自动发现完成任务所需的复杂模式,例如高精度地分类图像(Krizhevsky et al., 2012; Simonyan and Zisserman, 2015; He et al., 2016)、理解和生成人类语言(Brown et al., 2020; Devlin et al., 2019; Vaswani et al., 2017)或识别语音(Hinton et al., 2012; Graves and Jaitly, 2014)。深度学习在这些领域的成功很大程度上源于训练模型所用数据集的庞大,例如在互联网上所有可用数据上进行训练。  
虽然大多数原始、典型的深度学习模型是通过监督学习(被动地将输入映射到输出)训练的,但我们在此收集的许多轶事源于通过试错学习的交互式算法,其中强化学习是一个典型例子。强化学习涉及一个智能体通过在任务上反复进行试错实验,学习在环境中最大化数值奖励信号(Sutton and Barto, 2018)。例如,家用清洁机器人可能通过执行接近目标的动作(如将杯子放入水槽)获得正向奖励,而因失败(如打碎杯子)获得负向奖励。无论目标是打扫房屋、在象棋中获胜(得到+1分)还是在Atari(Mnih et al., 2015)游戏中获得高分,智能体的目标都是学习一个能最大化长期累积奖励的策略。  
以这种方式训练的智能体一直是许多棋盘游戏和视频游戏中超越人类表现例子的核心(与顶级专业人士相比)(Silver et al., 2017; Vinyals et al., 2019; OpenAI et al., 2019; Bakhtin et al., 2022b; Brown and Sandholm, 2017; Wurman et al., 2022)。深度强化学习(DRL)是这些成功的引擎,它将强化学习的试错学习和序贯决策与深度学习的模式识别相结合,将模型观察到的某些动作和/或状态与高奖励联系起来。更广泛地说,DRL使智能体能够精通从机器人控制(Levine et al., 2016)到大气气球导航(Schuler et al., 2025; Bellemare et al., 2020)的各种环境。正如我们将在第3节看到的,这些成功展示了RL如何能掌握复杂的战略思维、长期规划甚至自然语言协商。  
最近,该领域见证了强大基础模型(FMs)的发展,这些模型通过监督学习在大量互联网数据上进行训练,然后通过强化学习教授数学和编码等专门能力(Wen et al., 2025; DeepSeek-AI, 2024...)

相似文章

AI安全与对齐

Reddit r/artificial

文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。

AI安全需要社会科学家

OpenAI Blog

OpenAI主张AI安全研究中的价值对齐需要社会科学家的帮助,以解决人类认知偏差和不一致如何影响用于训练AI系统的数据的问题。该组织提议通过仅涉及人类的实验方法来发现对齐问题,然后再部署机器学习解决方案。

AI 实战前线:为何其辉煌与失败源于同一根源

Reddit r/artificial

作者分享了两年内使用AI构建平台的经验,指出了六种反复出现的故障模式(补丁式、假设式、漂移式、幻觉式、缺乏常识式、最小阻力式),并认为即使模型不断改进,这些故障模式依然存在,且变得更加难以察觉。

AI相关可靠性事件频发

Lobsters Hottest

本文探讨了使用AI代理处理运维任务(如值班工作)的兴起趋势,但警告其复杂性可能导致意外可靠性事件,并引用了安全会议上的近期演讲和案例。