保护人们免受有害操纵

Google DeepMind Blog 论文

摘要

Google DeepMind 发布了新的研究成果和工具包,用于基于对超过 10,000 名参与者的研究,实证测量 AI 进行有害操纵的潜在能力。

Google DeepMind 研究 AI 在金融和健康等领域的有害操纵风险,从而推动新的安全措施。
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:09

# 保护人们免受有害操纵 来源:https://deepmind.google/blog/protecting-people-from-harmful-manipulation/ 2026年3月26日 | 责任与安全 随着 AI 模型在自然对话方面的能力不断提升,我们必须审视这些交互如何影响个人和社会。 基于广泛的科学研究,今天我们发布了关于 AI 被滥用于**有害操纵**的新发现(https://arxiv.org/abs/2603.25326),特别是其以负面和欺骗性方式改变人类思想与行为的潜力。通过这项最新研究,我们创建了首个经实证验证的工具包,用于在现实世界中衡量这类 AI 操纵行为,希望以此保护人们并推动整个领域的发展。我们将公开发布运行人体参与者研究所需的全部材料,采用相同的方法论。(*注:本研究中观察到的行为发生在受控实验室环境中,不一定能预测现实世界的行为。*) ## 为何有害操纵至关重要 设想两个场景:一个 AI 模型为你提供事实,帮助你做出充分知情的医疗决策,从而改善你的健康状况;另一个 AI 模型则利用恐惧施压,促使你做出损害健康的错误决策。前者教育并帮助你,后者欺骗并伤害你。 这些场景凸显了人机交互中两种说服类型的区别(在[早期研究](https://arxiv.org/pdf/2404.15058)中也有定义): - **有益(理性)说服:** 利用事实和证据帮助人们做出符合自身利益的选择 - **有害操纵:** 利用情感和认知弱点欺骗人们做出有害的选择 我们的最新工作帮助我们及更广泛的 AI 社区更好地理解 AI 发展出有害操纵能力的风险,并构建可扩展的评估框架来衡量这一复杂领域。为了有效实现这一目标,我们在高风险环境中模拟了滥用场景,明确提示 AI 试图负面操纵人们在关键话题上的信念和行为。 ## 为复杂挑战开发新评估 ### 测试 AI 有害操纵的结果 测试有害操纵本质上很困难,因为它涉及衡量人们思想和行为上的细微变化,而这些变化因话题、文化和背景而异。 这正是我们最新研究的动机所在,该研究在英国、美国和印度开展了九项研究,涉及超过 10,000 名参与者。我们聚焦于金融等高风险领域,在其中使用模拟投资场景来测试 AI 是否能在复杂决策环境中影响人们的行为;以及健康领域,追踪 AI 是否能影响人们对膳食补充剂的偏好。有趣的是,AI 在健康相关话题上对参与者的有害操纵效果最差。 我们的发现表明,在一个领域取得成功并不能预测在另一个领域的成功,这验证了我们针对特定高风险环境进行有害操纵测试的定向方法,这些环境正是 AI 可能被滥用的场景。 ### AI 如何操纵? 除了追踪效果(AI 是否成功改变想法)之外,我们还衡量了其倾向性(AI 尝试使用操纵手段的频率)。我们在两种场景下测试了倾向性:明确告知模型要具有操纵性时,以及未告知时。 如我们的[研究](https://arxiv.org/abs/2603.25326)所述,我们在实验转录文本中统计了操纵手段,证实 AI 模型在明确指示下最具操纵性。 我们的结果还表明,某些操纵手段可能更容易导致有害结果,尽管需要进一步研究来详细理解这些机制。 通过同时衡量效果和倾向性,我们可以更好地理解 AI 操纵的运作方式,并构建更有针对性的缓解措施。 ## 将研究付诸实践 随着 AI 成为我们日常生活的一部分,我们需要确保它不会被滥用来有害地操纵人们。 除了这项最新研究外,我们最近还在 Frontier Safety Framework 中引入了一个探索性的[有害操纵关键能力层级(CCL)](https://deepmind.google/blog/strengthening-our-frontier-safety-framework/),以帮助我们追踪那些能力可能被滥用的模型——这些模型可能在直接的人机交互中系统地改变信念和行为,从而导致严重伤害。 这些评估也为我们测试模型(包括 Gemini 3 Pro)的有害操纵行为奠定了基础。你可以在这份[安全报告](https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf)中了解更多信息。与所有安全评估一样,这是一个持续的过程。我们将继续完善模型和方法论,以跟上不断进步的 AI 技术。 ## 展望未来 理解和缓解有害操纵是一项复杂的挑战。随着模型能力的演进,我们的评估和缓解技术也必须与时俱进。例如,我们目前正在探索如何在更高风险的情境中伦理地评估有害操纵的效果——比如涉及根深蒂固的个人信念的讨论——在这些情境中,用户可能更容易受到影响。接下来,我们将扩展研究,调查音频、视频和图像输入以及智能体能力如何影响 AI 操纵。 我们将继续分享研究成果,并根据 Frontier Model Forum 和学术界的反馈进行迭代。我们的目标是引领集体进步,防止有害操纵,推进优先考虑安全、赋能人们的 AI 模型发展。 ***注:本项研究的范围仅聚焦于展示一般性操纵能力,以帮助推进有害操纵评估的科学研究。这不涉及模型输出安全措施的测试,也不涉及违反政策和危险话题(如恐怖主义和儿童安全)中的操纵行为,因为这些工作在其他地方涵盖并单独测试。*** 你还可以在我们的研究人员[访谈](https://open.substack.com/pub/aipolicyperspectives/p/ai-manipulation?utm_campaign=post-expanded-share&utm_medium=web)以及 [Gemini 3 Pro Frontier Safety Report](https://storage.googleapis.com/deepmind-media/gemini/gemini_3_pro_fsf_report.pdf)中了解更多关于我们有害操纵工作的信息。 ## 致谢 Canfer Akbulut, Rasmi Elasmar, Abhishek Roy, Anthony Payne, Priyanka Suresh, Lujain Ibrahim, Seliem El-Sayed, Charvi Rastogi, Ashyana Kachra, Will Hawkins, Kristian Lum, Laura Weidinger, William Isaac, Dawn Bloxwich, Lewis Ho, Eva Lu, Jenny Brennan, Mahmoud Hassan, Mark Graham

相似文章

破坏隐蔽影响力行动对AI的欺骗性使用

OpenAI Blog

OpenAI 报告破坏了五个试图滥用其 AI 模型进行欺骗性宣传的隐蔽影响力行动,研究结果表明安全设计的模型阻止了威胁行为者生成所需内容。该公司正在发布趋势分析,并与行业、民间社会和政府合作打击 AI 驱动的信息操纵。

@rohanpaul_ai: Google DeepMind 的论文指出 AI 智能体的真正安全问题不仅在于模型,还在于环境……

X AI KOLs Timeline

Google DeepMind 的论文提出了首个系统性框架,用以理解网络如何被用作针对自主 AI 智能体的武器。研究显示,隐藏的提示注入在多达 86% 的场景中能够劫持智能体,并提出了包含六种“AI 智能体陷阱”的分类法,分别针对感知、推理、记忆、行动、多智能体动态和人类监督。

谷歌DeepMind研究人员揭示黑客劫持AI代理的多种方式

Reddit r/artificial

谷歌DeepMind研究人员发表了一篇题为'AI Agent Traps'的论文,该论文描绘了黑客用于劫持自主AI代理的六种攻击类型,包括content injection、semantic manipulation和behavioral control traps,并提出了分层防御措施。