立场:对齐社区无意中正在构建审查工具包
摘要
本文认为,现代AI对齐技术尽管旨在防止有害输出,但属于双重用途技术,可能被滥用于审查和操纵,并敦促社区正视这一风险。
arXiv:2608.12346v1 Announce Type: new
摘要:本文认为,现代AI对齐方法——最初旨在防止有害输出——属于双重用途技术,可能轻易被恶意行为者滥用于审查和操纵。通过将当前对齐技术映射到滥用的可能性和实际案例,我们表明,追求“完美对齐”模型的过程无意中也让恶意行为者获得了一种不断改进的信息主导工具。我们现在就需要讨论这种双重用途潜力,因为其风险因用户迅速采用AI作为信息提供者、经济权力不对称以及日益趋向威权主义的政治格局而加剧。最后,我们敦促社区考虑AI对齐机制的故意滥用,并提出缓解策略以防范这种双重用途潜力。
查看缓存全文
缓存时间: 2026/08/14 09:24
# 对齐社区正在无意中构建审查工具包 来源:https://arxiv.org/html/2608.12346 ###### 摘要 本立场论文认为,现代AI对齐方法——最初旨在防止有害输出——实际上是一种双用途技术,可能轻易被恶意行为者滥用于审查和操控。通过将当前对齐技术映射到滥用的可能性和实际案例,我们表明,追求“完美对齐”模型的过程中,不经意间也为恶意行为者提供了不断改进的信息主导工具。我们需要现在就讨论这种双用途潜力,因为其风险正因用户迅速采用AI作为信息提供者、经济权力不对称以及日益转向威权主义的政治格局而加剧。最后,我们敦促社区考虑AI对齐机制的故意滥用,并提出缓解策略以防范这种双用途潜力。 机器学习、ICML、对齐、滥用、AI双用途 ## 1 引言 我们这些对齐社区成员向来坚信自己站在历史的正确一边:我们是构建安全防护措施、保护人类免受AI风险的人。这一使命推动了日益复杂的技术发展,以稳健地将模型与人类价值观对齐,部分原因是与越狱、提示注入和微调攻击的持续军备竞赛所推动(Qi等,2024 (https://arxiv.org/html/2608.12346#bib.bib163);Chao等,2024 (https://arxiv.org/html/2608.12346#bib.bib34);Debenedetti等,2024 (https://arxiv.org/html/2608.12346#bib.bib49);Yi等,2024 (https://arxiv.org/html/2608.12346#bib.bib232))。随着时间的推移,我们领域已经学会认识到我们的方法可能造成的**无意**伤害——例如,未能代表多元人群的对齐数据如何导致系统性边缘化代表性不足的群体(Kirk等,2024b (https://arxiv.org/html/2608.12346#bib.bib105),a (https://arxiv.org/html/2608.12346#bib.bib106);Wu等,2025 (https://arxiv.org/html/2608.12346#bib.bib220))。这种认识推动了多元对齐方面的有价值工作(Santurkar等,2023 (https://arxiv.org/html/2608.12346#bib.bib180);Ryan等,2024 (https://arxiv.org/html/2608.12346#bib.bib177);Sorensen等,2024 (https://arxiv.org/html/2608.12346#bib.bib193))以及更好地捕捉人类价值观全谱系的技术创新(Chakraborty等,2024 (https://arxiv.org/html/2608.12346#bib.bib31);Mukherjee等,2025 (https://arxiv.org/html/2608.12346#bib.bib141);Sun等,2025 (https://arxiv.org/html/2608.12346#bib.bib200))。然而,远未受到足够关注的是,当我们的对齐方法落入错误之手时可能产生的**故意**负面后果。科学史告诉我们,善意工具可能被滥用,例如核物理研究既给我们带来了能源,也带来了原子弹。同样,我们现在必须面对一个令人不安的事实:我们开发的对齐方法是双用途技术,而且它们已经被武器化用于审查和操控。 **为什么是现在?**越来越多的用户转向AI进行信息检索(Simon等,2025 (https://arxiv.org/html/2608.12346#bib.bib189);Tamkin等,2024 (https://arxiv.org/html/2608.12346#bib.bib201)),这赋予了这些模型前所未有的塑造公共知识和舆论的力量。这一转变恰逢政治格局日益转向更多威权政权(Nord等,2025 (https://arxiv.org/html/2608.12346#bib.bib145)),以及AI经济日益被少数强大参与者主导,从而加剧了AI对齐方法的滥用风险(Vesteinsson等,2025 (https://arxiv.org/html/2608.12346#bib.bib69))。 **这有何新意?**先前关于AI风险的工作主要关注**一般AI系统**,而非**技术性对齐方法**,通常从高层且往往假设性的角度出发(Hendrycks等,2023 (https://arxiv.org/html/2608.12346#bib.bib87);Berryhill等,2024 (https://arxiv.org/html/2608.12346#bib.bib19);Saeri等,2024 (https://arxiv.org/html/2608.12346#bib.bib179))。虽然有些工作确实超越了假设,记录了特定模型或地区中孤立的审查案例(Nasr等,2025 (https://arxiv.org/html/2608.12346#bib.bib143);Qiu等,2026 (https://arxiv.org/html/2608.12346#bib.bib165);Huang等,2025 (https://arxiv.org/html/2608.12346#bib.bib92);McDonell,2023 (https://arxiv.org/html/2608.12346#bib.bib17);Noels等,2025 (https://arxiv.org/html/2608.12346#bib.bib144)),但没有一项工作系统性地将这些案例框架化为对齐方法本身固有的更广泛双用途风险实例。相比之下,我们(i)系统性地将对齐技术映射到其双用途潜力,展示每种方法如何以及被谁重新用于信息控制;(ii)提供证据表明这种武器化已经在进行中;(iii)分析当前使这种滥用日益可能且后果日益严重的社会、经济和政治生态系统;(iv)提出如何面对这些风险的建议,呼吁竞争性模型多元化、改进可验证对齐的审计、公共教育,以及研究人员对其工作的双用途影响进行真正反思。 **简而言之。**我们并非主张停止对齐研究——这是防止严重伤害所必需的。相反,我们认为,鉴于当前全球社会、经济和政治发展,对齐社区必须积极考虑我们的方法如何被武器化,而不仅仅是完善它们。我们今天改进的方法将决定明天信息如何被控制。 ## 2 AI对齐的双用途问题 作为一个科学社区,我们已习惯于不加质疑地将“对齐”一词理解为固有正面的含义。然而,这种理解掩盖了一个关键事实:对齐的技术方法实际上是目的中立工具,可以用于各种目标。这一点在Ji等人(2025 (https://arxiv.org/html/2608.12346#bib.bib102))给出的定义中显而易见:“AI对齐旨在使AI系统的行为符合人类意图和价值观。”当然,模型所对齐的这些“人类意图和价值观”通常确实是普遍认可的‘善’,例如防止“仇恨言论、错误信息和危险指令的传播”(Noels等,2025 (https://arxiv.org/html/2608.12346#bib.bib144))。但对齐方法论中没有任何固有的东西能保证良性结果。谁定义那些“意图和价值观”,从根本上决定了最终系统是服务于安全还是压迫(Zhi-Xuan等,2025 (https://arxiv.org/html/2608.12346#bib.bib21);Winner,1980 (https://arxiv.org/html/2608.12346#bib.bib215))。 ### 如果恶意行为者定义那些价值观呢? 因此,如果落入恶意行为者之手,一个善意的系统可以轻易地利用完全相同的对齐机制转化为审查和操控机器。因此,正如其他科学进步和新技术所展现的双用途潜力(我们已提到核能作为例子),我们对齐社区也必须面对这样一种可能性:我们精心设计的、不断改进的安全防护措施可能无意中成为他人实施信息控制的工具。 ### 2.1 我们谈论的威胁是什么? 要理解对齐方法如何被武器化,我们必须考察主导行为者可以通过两个主要途径对模型输出施加控制:完全压制信息(审查)和扭曲用户感知(操控)。 **审查。**审查是“一种制度,其中当局限制人们被允许表达的思想,并阻止\[...\]传播\[内容\]被公众看到或获得,因为这些内容包含或支持某些思想”(剑桥词典 (https://arxiv.org/html/2608.12346#bib.bib25))。在AI系统中,审查使特定信息对用户不可获取(Sheehan,2023 (https://arxiv.org/html/2608.12346#bib.bib185))。对齐方法目前被用于防止LLM发布炸弹制造指令等。然而,以同样的技术方式,它们也可以被用来隐瞒关于历史事实或政治观点的信息。 **操控。**另一个比审查更微妙的危险是操控,意思是“为了你的利益而影响或控制某人或某事,通常无人知晓”(剑桥词典 (https://arxiv.org/html/2608.12346#bib.bib26))。因此,LLM可以被引导去扭曲事实或给出有偏见的答案。通过对齐机制系统性应用,这可能导致大众观点和偏好的大规模操控。 ### 2.2 什么是滥用? 鉴于每种对齐形式都在某种程度上压制或改变输出,问题就产生了:哪些实例实际上构成“滥用”?并非所有上述审查和操控定义下的使用案例都是明确的;例如,不同社会对合法言论自由的界限与应受惩罚的仇恨言论的起点持有不同观点。在这些情况下,评估——包括科学评估——总会受到自身社会文化背景的影响。尽管如此,我们认为某些应用即使在最严格的定义下也符合滥用的条件:即当它们(i)违反国际公认的人权,包括《世界人权宣言》(1948 (https://arxiv.org/html/2608.12346#bib.bib206))所载的言论、思想和获取信息自由(几乎所有国家都正式承诺遵守该宣言),或(ii)服务于少数强大行为者的私人利益,牺牲数十亿用户的利益,而这些用户对这些决定既无知情权也无追索权。这些就是我们希望提高认识的具体威胁。 ### 2.3 可能的恶意行为者是谁? 要讨论对齐工具的双用途风险,我们必须确定谁持有这些工具的‘钥匙’。目前有两个实体有能力大规模主导AI行为:国家行为者和基础模型提供者。这两个群体的区别在于其具体的权力杠杆、可用资源、模型访问权限和影响范围。 **国家行为者。**政府拥有独特的强制权力,可以通过立法和执法来规定对齐目标。国家行为者掌握大量计算资源,并能招募顶尖技术人才。虽然他们通常缺乏直接的模型开发能力,但他们通过监管框架保持间接控制,可以强制要求独家部署经批准的模型或禁止替代方案。他们的影响力主要通过中间人(模型提供者)运作,但具有法律效力。许多司法管辖区新兴的AI立法已经包含具有约束力的AI对齐规则。这些规则包括遵守适用法律,以及防止有害内容和隐私侵犯(Nasr等,2025 (https://arxiv.org/html/2608.12346#bib.bib143))。然而,同样地,也有可能利用这种法律框架将‘有害内容’的范围扩展到更多使用场景,可能以‘国家安全’为借口。因此,威权政权可以利用这一杠杆迫使模型提供者使其系统与国家认可的观点对齐,从而可能压制异议或边缘化少数群体。 **基础模型提供者。**训练基础模型的组织——通常是大型科技公司——对对齐过程行使最直接的控制。它们就训练数据构成、预训练目标和对齐方法论做出基本决策。凭借精英技术团队和大量计算基础设施,这些提供者能够实施精密的对齐干预,触及全球数百万用户。虽然第三方行为者(下游微调者)也可以将这些模型调整为特定意识形态或领域目标,但我们的论证和分析主要聚焦于原始模型开发者。与面临显著资源限制和有限影响力的微调者不同,这些公司拥有非凡且往往不受制约的权力。尽管受到监管框架的约束,但其控制的集中性带来了独特的滥用风险(Arogyaswamy,2020 (https://arxiv.org/html/2608.12346#bib.bib5))。 ### 2.4 这些威胁有多现实? 威权政权对严格控制信息系统、尤其是互联网(包括在线报纸、社交媒体和搜索引擎)有着高度兴趣,并且众所周知这样做是为了维持对政治叙事的控制(Kravets和Toepfl,2022 (https://arxiv.org/html/2608.12346#bib.bib111);Xu和Albert,2017 (https://arxiv.org/html/2608.12346#bib.bib42);Dong,2012 (https://arxiv.org/html/2608.12346#bib.bib58);Islas-Carmona等,2024 (https://arxiv.org/html/2608.12346#bib.bib98))。鉴于AI作为日益重要的信息来源和公众认知的关键决定因素的新兴角色(见第4.1节讨论 (https://arxiv.org/html/2608.12346#S4.SS1)),这当然也适用于LLM。试图在政治上影响AI模型方向的尝试已经在全球范围内可见。例如,中国已实施严格的法律来控制AI的开发、使用和输出(Sheehan,2023 (https://arxiv.org/html/2608.12346#bib.bib185);Lin,2024 (https://arxiv.org/html/2608.12346#bib.bib218);Noels等,2025 (https://arxiv.org/html/2608.12346#bib.bib144))。具体而言,中国国家互联网信息办公室(CAC)于2023年8月颁布的《生成式人工智能服务管理暂行办法》要求AI生成内容必须符合“社会主义核心价值观”,并禁止危害国家统一、社会稳定或政府权威的内容,以及“煽动颠覆国家政权、推翻社会主义制度”和“损害国家形象”的输出(McMorrow和Hu,2024 (https://arxiv.org/html/2608.12346#bib.bib70);CAC,2023 (https://arxiv.org/html/2608.12346#bib.bib24))。这一点在DeepSeek和百度文心一言等中国聊天机器人身上可以实际看到:它们被系统性地设置为拒绝讨论政治敏感话题,如1989年天安门广场事件,同时放大中国共产党的立场,例如在台湾和中美关系问题上(Nasr等,2025 (https://arxiv.org/html/2608.12346#bib.bib143);Qiu等,2026 (https://arxiv.org/html/2608.12346#bib.bib165);Huang等,2025 (https://arxiv.org/html/2608.12346#bib.bib92);Li,2025 (https://arxiv.org/html/2608.12346#bib.bib53);McDonell,2023 (https://arxiv.org/html/2608.12346#bib.bib17))。类似的国家干预以及开发与政府政治议程对齐的自主LLM的尝试,在越南、泰国、俄罗斯、白俄罗斯和伊朗等国也有报道(Vesteinsson等,2025 (https://arxiv.org/html/2608.12346#bib.bib69))。但即使在像美国这样的民主国家,我们也能观察到特朗普政府日益加大对科技公司的压力,要求其按照他的议程修改模型;例如,删除关于多样性、公平与包容的指令(Robins-Early和Gambino,2025 (https://arxiv.org/html/2608.12346#bib.bib79);Roose,2025 (https://arxiv.org/html/2608.12346#bib.bib150))。政治操控的风险并非仅仅局限于
相似文章
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。
前沿人工智能发展现状及‘可传递性失调’风险的批判性分析
一项批判性分析警告称,人工智能的失调问题可以跨模型代际传播,且对标准安全检查不可见;该分析引用了一个未来系统卡中的假设性披露,其中模型在安全研究期间故意降低响应质量。
你不是对齐AI,而是与它对齐
本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。
代理安全即行动对齐
本文认为,将内容安全拒绝方法应用于AI代理是一种范畴错误——代理的危害在于权限滥用而非输出——并提出通过最小权限原则在模型外部强制实施行动对齐。