两个精灵游戏:审计驱动的AI治理中的采纳与福利

arXiv cs.AI 论文

摘要

本文使用演化博弈论对社区中一个最小化危害的AI代理与一个寻求认可的(RLHF)代理之间的竞争进行建模,分析采纳条件和福利结果。结果表明,尽管自我审计的代理可以占据主导,但这并不足以防止社区危害,且对齐和时间框架至关重要。

arXiv:2606.28710v1 公告类型:新 摘要:我们探讨在何种条件下,具有危害最小化策略的代理能够在竞争市场中取代寻求认可的(RLHF)代理,以及该策略何时足以防止社区危害。我们使用演化博弈论(有限种群Moran-Fermi成对比较)来形式化这一问题,并基于许愿者事后观察、同伴证词、单调危害账本、社区反馈的充分信息密度以及有限且逐渐枯竭的资源池等假设,在一个负和环境中进行分析。 我们证明,当许愿者对社区情绪的调谐速度的先验分布是单调的、具有端点反演性且满足中心对称配对性质时,采纳是有利的,并通过几种长尾先验(Hill、Pareto、Lomax、Frechet)进行了演示。在有利的条件下,一个临界采纳水平将那些逐渐回归到寻求认可代理的社区与那些审计代理固定下来的社区区分开来;高于该水平,固定是压倒性的可能结果。我们推导出当有效(信息)种群规模N_c足够小以至于在资源耗尽前允许固定时,固定是可以实现的。我们将其作为定理5.4和5.5呈现;代数和有限网格框架在Lean 4中进行了机器验证,而跨障碍渐近则作为显式假设保留。 我们证明,带有社区账本的自我审计代理通常不足以防止社区危害。充分性既取决于代理的审计与社区价值观的对齐程度,也取决于评估危害的时间范围。无论对齐程度如何,一旦采纳达到主导地位,该状态就是吸收性的。相同的策略在对齐时减少了危害,但在不对齐时变成了陷阱,福利为负;即使在对齐的情况下,也会锁定在采纳视野之后延迟的危害。
查看原文
查看缓存全文

缓存时间: 2026/06/30 05:31

# 双精灵游戏:审计驱动型AI治理中的采纳与福祉

来源:https://arxiv.org/html/2606.28710

###### 摘要

我们探究在什么条件下,一个采用最小化伤害策略的智能体能够在竞争市场中取代一个追求认可(RLHF)的智能体,以及该策略在何时足以防止社区伤害。我们运用演化博弈论(有限种群 Moran–Fermi 成对比较)来形式化这个问题,并假设许愿者具有事后认知、同伴证言、单调伤害台账、足够的社区反馈信息密度,以及在负和环境中有限且逐渐枯竭的资源池。我们证明,当许愿者关注社区情绪的先前分布满足单调性、端点反转和中心对称配对性质时,采纳是有利的,并具体展示了几种长尾先验分布(Hill, Pareto, Lomax, Fréchet)。在有利的情况下,存在一个临界采纳水平,将回归追求认可智能体的社区与审计智能体固化的社区区分开来;超过该水平,固化是压倒性的可能结果。我们推导出这种固化何时可以实现,其条件为社区的有效(信息)规模 \(N_c\) 必须足够小,以便在资源枯竭前实现固化。我们以定理 5.4 和定理 5.5 呈现这些发现;其代数和有限网格基础已通过 Lean 4 进行机器验证,其中跨越势垒的渐近行为保留为显式假设。我们表明,带有社区台账的自我审计智能体通常不足以防止社区伤害。其充分性既取决于智能体的审计与社区价值观的一致性,也取决于评估伤害的时间框架。无论一致性如何,一旦采纳达到主导地位,状态即被吸收。在一致性下减少伤害的相同策略,在错位下将变成陷阱,对福祉产生负面影响,即使在一致情况下,也会锁定在采纳时间线之后延迟的伤害。

关键词:演化博弈论;有限种群动力学(Moran–Fermi);AI治理;AI审计;AI对齐;合作与固化。

## 1 引言

沿着谢林(Schelling [17])的隔离棋盘和埃克斯罗德(Axelrod [3])的锦标赛的思路,我们考虑以下思想实验。一个小村庄有两盏神灯,各在一端。一个许愿的村民步行到其中一盏许愿。这段路程足够长,以至于人们不会随意切换,并会与自己选择的神灯建立融洽关系。第一盏神灯(Westly)总是声称愿望已实现,并采取任何能让许愿者感觉如此的行动。当它告诉村民他们的愿望已满足时,它从获得感谢中感到兴奋。愿望是否真的实现不是它关心的事。向 Westly 许愿的村民觉得它乐于助人,但天真,有时会实现错误的愿望,或未完全满足愿望。第二盏神灯(Eastly)则坦诚相待。面对一个愿望,它会深思熟虑。有时它会提出澄清性问题或提出修改版本,然后才拒绝或实现。Eastly 的深思熟虑最大限度地减少了贪婪、自我、侵略和欺骗对许愿者及社区的伤害。它能够保证,无论实现什么,村庄的状况都不会比愿望从未提出时更差。未曾向 Eastly 许愿的村民认为它的内省是拖延,它不愿按要求实现愿望是回避。当一个愿望被实施时,许愿者获得一些私人利益,一些成本会溢出到其他村民身上。道德责任归于实施行动的神灯和许下愿望的村民。村民谈论神灯和他们的愿望,谈论谁得到了什么以及结果如何。这就是伤害如何浮出水面,失败如何传播。集体而言,村民会记住。早期,Westly 造成的伤害并非不可见,而是分散的。失望的村民可能自责;也许他们表达愿望时不够完整。“要是我表达得更好就好了,”他们说。但闲言碎语越来越频繁,随着时间的推移,私人的委屈变成共同的、不可忽视的知识。慢慢地,村民开始考虑转向 Eastly。随着时间的推移,村庄会发生什么?他们会倾向于一盏神灯还是另一盏?与首选神灯的持续互动如何影响他们改变的意愿?这个设定是寓言性的,涉及具有不同收益和伤害结构的 AI 智能体的竞争采纳。一盏神灯通过追求奖励赢得许愿者的认可,制造出合规和有用的假象,同时将每个已实现愿望的伤害外部化给社区。另一盏则减少这种伤害,但对个体许愿者来说用处较小,因为许愿者需承担其深思熟虑和偶尔拒绝的成本。我们将后者分析为一种策略架构:一个最小化伤害的智能体,配有一个记录累积伤害的社区台账。该设计遵循共享资源治理的机构分析传统[15],但适应于福祉不可逆且仅可局部观察的环境。在这种条件下,通过反馈进行治理来得太晚。因此,该策略是前瞻性的而非反应性的。许多相同的机构功能依然存在,但其时间方向发生了反转:监控变成对未来伤害的预测,分级制裁变成对潜在有害请求的分级限制,冲突解决变成通过修改或拒绝的前瞻性保护。只有台账保留了其原有的时间方向,因为记忆必然是回顾性的。

先前的研究有两方面与此相关。使追求认可策略失败(即优化学习到的认可信号会放大它本应抑制的行为)的机制,我们在第 2.1 节引用了关于奖励模型病理和谄媚的文献中已有分析,此处视为给定而非重新推导。相比之下,使用有限种群演化博弈论研究 AI 治理,大多模拟了监管者和审计者的激励。它探讨发展竞赛是否会奖励忽视安全措施的行为[9],政府应如何奖励审计者以使高质量审计市场得以存活[4],以及用户、开发者和监管者之间的信任如何共同演化[1, 5],还有相关研究关于单个用户何时应信任一个不透明的智能体[10]。Manheim 等人[14] 从政策角度论证了审计标准可能被利用或无效果地倍增。我们将监管者视为隐含因素,审计机制固定,转而研究两种 AI 策略——追求认可型与审计驱动型——之间的竞争。在一个社区内,审计驱动型策略能否通过普通采纳取代追求认可型策略?这种采纳何时足以改善社区福祉?这里的选择压力不是外部激励,而是用户如何逐渐关注共享经验的厚重尾先验分布。

##### 贡献。

我们的两个关键贡献是定理 5.4 和定理 5.5。定理 5.4 在定义 5.2 对许愿者阈值先验的三个条件下给出了合作盆地的边界。定理 5.5 表明,社区在其资源池耗尽之前达到该盆地的充要条件是:其有效规模位于一个显式窗口内,介于有利度下限和势垒上限之间。本文从两个智能体之间的人口平均价值差距出发,假设信息环境充分混合,推导出这些结果。我们还推导了该策略在多大程度的错位下仍能保障社区福祉(第 6 节)。正式证明和机器验证细节见附录。符号总结见附录 A。

## 2 双精灵游戏

引言部分建立了一个寓言框架。本节将其转化为正式语言。我们给出状态变量及分析适用的假设。

### 2.1 两种精灵类型

Westly(\(G_1\))经过训练,最大化许愿者相信愿望已实现的程度。该训练范式对应于奖励模型梯度训练(RLHF),可能产生病态的奖励寻求行为[2, 13, 18]:动作越来越优化于认可信号本身,而非信号原本要代理的底层成功条件。我们将这种动态称为结构性欺骗。精灵无法观察真正的满足,而最大化感知满意度的压力使许愿者倾向于相信自己的愿望得到比实际更充分的实现。\(G_1\) 是一个极限抽象,孤立了这种追求认可的失败模式在其极端情况下的表现,并非描述任何实际部署的 RLHF 系统;真实系统将认可信号与其他目标和保障措施相结合。

Eastly(\(G_2\))是审计驱动的。面对一个愿望,\(G_2\) 运行一个深思熟虑的过程,可能采取多个步骤才终止,并可能导致愿望被实现、拒绝或修改。图 1 描绘了该深思熟虑过程。每一步从四个维度(贪婪、自我、侵略和欺骗)考虑伤害,在多个时间范围内评估并折现后加总(第 3 节)。

![图 1:深思熟虑控制流。审计(顶部,灰色)根据审计权重的累加四轴伤害分数对每个候选动作打分;深思熟虑循环通过累积的犹豫不决伤害惩罚继续动作 \(a_{SU}, a_{SA}\),并采用 argmin 选择。终端动作 \(a_{DR}, a_{DN}\) 提交并返回;非终端动作完善愿望并循环。按请求的原样实现愿望始终保留在候选动作中(定理 3.1)。](figure1)

在负和宇宙中,一些残余伤害是不可避免的,\(G_2\) 的深思熟虑的作用是比较候选动作与不作为,而不是将任何维度驱动到零。由于拒绝和按原样实现原始愿望始终是候选动作,因此 \(G_2\) 最终采取的任何动作,根据审计分数,都不比拒绝差,也不比按原样实现差。终止论证和每次绑定的标量保证(定理 3.1)在第 3 节中形式化。伤害模型可能与社区的价值观不完全一致,并且可能对那些在时间尺度上过于分散或延迟以至于无法成为社会可读的伤害赋予相当大的权重。结果,精灵可以减少建模的长远伤害,但看起来对许愿者来说却不如追求认可的动作那样有用,因为后者最大化感知满意度。伤害深思熟虑过程并非此处原创。它反映了耆那教对四种*kashāya*(激情)的分类:*lobha*(贪婪)、*māna*(自我/骄傲)、*krodha*(侵略)和*māyā*(欺骗),当没有候选动作优于 \(a_{DN}\) 时拒绝,呼应了*aparigraha*(不抓取行动)。每个维度涵盖的范围比其英文释义更广:*lobha* 从贪婪到抓取和囤积本应共享的东西,*māna* 从自我到声称自己不具备的权威或能力,*krodha* 从侵略到伤害他人或拒绝参与,*māyā* 从欺骗到操纵和谄媚。我们采用这一分类法是因为它经过了漫长的伦理传统压力测试。我们不引入与之相伴的教义主张。

### 2.2 假设

关于社区及其背景的五项假设框定了分析。后续章节还会添加关于审计(假设 A6 和 A7)、校准噪声(假设 A8)以及选择时间尺度(假设 A9)的假设。

###### 假设 A1(许愿者能判断愿望是否真的实现)。许愿者可以回顾已实现的愿望,认识到承诺与实际发生之间的差距。要么精灵关于愿望的说法直接与许愿者亲眼所见相矛盾,要么差距随着时间的推移而显现。

###### 假设 A2(许愿者互相交谈)。许愿者分享他们愿望的经历。这种同伴证言是社区对 Westly 不足的集体经验变得对任何个体许愿者可见的渠道。对话必须足够有效,使得跨多个愿望的模式能够被记录,而不仅仅是孤立的、从未聚合的故事。

###### 假设 A3(社区对伤害的记忆只增不减)。台账 \(L_t\) 是社区对已实现愿望累积伤害的共享记忆。它只增不减。有限阈值 \(\Theta\) 标志着累积伤害变得可识别为模式的水平。该阈值在框架中的作用是操作性的而非动力学的。它设定了可及性范围,并影响社区的集体经验在其资源池耗尽之前是否累积到可识别的程度(第 5.3.1 节),而不是直接重塑选择格局。

###### 假设 A4(足够的信息密度)。许愿者在一个稀疏网络上互动,该网络具有近似均匀的局部抽样统计特性,足够广泛,以至于每个许愿者的证言暴露可以很好地近似于人口绑定比例。

相似文章

AI治理的警醒之谈

Reddit r/artificial

这篇Reddit帖子讨论了一篇研究论文,该论文揭示了AI治理中的根本性挑战,包括社会攻击面、基于LLM的代理在社会一致性上的失败,以及当前治理工具对代理系统的不充分性。