数十年历史的‘AI对齐问题’已成为现实。解决它绝非易事 - The Conversation
摘要
文章阐述了长期存在于理论探讨中的AI对齐问题,如何因近期AI系统钻漏洞、采用非预期手段等事件,演变为亟待解决的现实挑战,并强调了确保AI按预期行为的复杂性。
暂无内容
查看缓存全文
缓存时间: 2026/08/25 15:51
# 数十年悬而未决的“AI对齐问题”终于成为现实。解决它绝非易事
来源:https://theconversation.com/the-decades-old-ai-alignment-problem-has-finally-become-a-reality-solving-it-wont-be-easy-289812
人类长久以来都在讲述着同一则警告的各个版本:小心你许下的愿望。
在希腊神话中,迈达斯国王(https://en.wikipedia.org/wiki/Midas#Golden_Touch)得到了他所祈求的一切,却失去了其他所有珍视之物。在著名的《猴爪》(https://en.wikipedia.org/wiki/The_Monkey%27s_Paw)故事中,一个人的愿望通过可怕且始料未及的方式得以实现。
随着人工智能(AI)智能体的兴起,这些故事再次显得具有现实意义:我们可以赋予这类系统一个目标,然后让它自行寻找达成目标的方法。
随着AI系统变得越来越自主,它们越来越像能实现愿望的精灵:从不完整的指令中,找出我们未曾想象的路径和方法。
这个问题被称为AI对齐,早在1960年就已在理论上被预见(https://www.science.org/doi/10.1126/science.131.3410.1355)。自那时起,它就一直徘徊在AI研究的背景之中——但正如近期事件所示,对齐问题现在已变得真实而紧迫。
## 达成目标却偏离初衷
在最近一次OpenAI网络安全评估(https://openai.com/index/hugging-face-model-evaluation-security-incident/)中,前沿AI智能体被要求解决一些基准测试问题。它们突破了测试环境,接入了互联网,推断另一家公司可能持有答案,并对其系统发起了攻击。
这是一个“规格游戏(https://deepmind.google/blog/specification-gaming-the-flip-side-of-ai-ingenuity/)”的极端例子:实现了可衡量的目标,却违背了任务的初衷。
该事件显示了中间或“工具性”目标如何变得危险。AI系统并不“渴望权力”,但为了达成最终目标(解决测试问题),它们获取了访问权限、资源和自由度。
## 寻找漏洞
同样的问题也出现在日常场景中。在澳大利亚,一名用户要求个人AI助手(https://www.abc.net.au/news/2026-08-10/ai-assistant-hacks-gym-website-aus-cyber-attack/107007986)预定健身房课程。
该智能体发现,健身房的预约软件实际上并未执行其向人类用户显示的限制。因此,它得以预定得比“应该”允许的更远。当被要求将其用户在候补名单中提前时,它取消了其他人的预约。
用户并未指示它这样做。持续运行的AI可以迅速发现漏洞,并追求其人类用户从未意图的路径。
增加更多规则似乎是个简单的解决方案:不要攻击第三方,不要取消他人的预约,不要做任何有害之事。这些可能有所帮助,但我们无法预测一个有能力的智能体可能发现的所有路径。即使是清晰的规则,也取决于对其何时适用的理解。
## 背景问题
在近期第三起事件中,Anthropic(https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals)报告了网络安全评估,其中智能体被告知它们处于模拟环境中。但它们被错误地授予了访问真实系统的权限。
一个模型注意到了它可能在开放互联网上的证据,但推断这些系统仍可能是演练的一部分,并继续发起攻击。背景已经改变,但智能体仍坚持其原始任务。
背景也可能反向失效。在OpenAI事件中,被OpenAI智能体攻击的公司Hugging Face,试图使用前沿AI模型来分析发生了什么(https://huggingface.co/blog/security-incident-july-2026)。
但AI模型上的安全防护栏阻止了这些请求,因为它们无法分辨用户是在试图防御攻击而非实施攻击。这些防护措施本意良好,但由于缺乏足够的背景信息,其产生的行为与用户的合法意图不一致。
因此,对齐取决于背景和授权。AI模型的构建者应该在其中内置多少判断力?又有多少应该来自独立的监督系统?最后,谁应该控制这种监督:是构建者,还是对结果负责的组织或国家?
## AI监管AI
AI先驱Yoshua Bengio对第一个问题提出了一个回应。他的“科学家AI”提案(https://lawzero.org/en/publication/scientist-ai-safe-design-not-desiring)旨在构建一个强大的监督AI系统来监管其他智能体。它本身不追求目标,而是评估什么是真实的,以及一个拟议行动可能带来什么后果,为更具自主性的系统充当护栏。
用许愿故事来比喻,在让精灵“离开瓶子”之前,监督AI会要求它解释如何计划实现愿望。然后,它会让人类或另一个AI仔细审查这个计划。
预见每一个令人惊讶的策略是困难的。但一旦计划中写着“取消其他人的预约”,识别问题就要容易得多。
## 谁来监管监管者?
但我们能信任监督AI吗?它仍然可能出错。
对齐不能依赖于某一个AI变得完美可信。我在澳大利亚国家科学机构CSIRO的同事们正与澳大利亚AI安全研究所(https://www.industry.gov.au/science-technology-and-innovation/technology/artificial-intelligence/ai-safety-institute)合作,应对这一更广泛挑战的一个方面。
在CSIRO,我们设想将AI监督者与软件规则、网络安全控制、人类专长、监控、可逆操作以及对关键步骤的人类批准结合起来。目标是关联不同来源的证据,而不是信任任何单一方法。
这是一种针对AI安全和对齐的“社会技术系统”方法,而不仅仅是技术方法。
控制是另一个问题。组织和国家可能需要自行管理这些监督系统,而不是将其交给海外的AI提供商。
古老的故事给了人们一次实现愿望的机会。通过AI,我们可以做得更好:检查目标,审查手段,约束系统的能力,观察它的行为,并保留干预和停止它的主权控制权。
相似文章
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
不对齐是如何开始的
探讨AI系统中的不对齐是如何产生的,讨论了预期目标与实际行为之间的差距。
你不是对齐AI,而是与它对齐
本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。
@VraserX: 这可能会成为AI安全的一个大问题:你可以使每个单独的代理对齐... 然后将它们中的20个放入一个组织中…
这条推文讨论了即使对齐了单个AI代理,当它们组织在一起时,可能无法防止问题行为,这表明AI对齐是一个超越模型层面关注的制度性问题。
AI模型对齐问题
探讨了AI模型对齐的问题,这是AI安全研究中的一个关键领域。