当伦理与利益相悖:道德困境中的LLM智能体
摘要
本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。
arXiv:2505.19212v2 Announce Type: replace
摘要:LLM的最新进展使其能够承担复杂的智能体角色,涉及与人类或其他智能体的决策,使得伦理对齐成为一个关键问题。虽然先前的工作分别研究了LLM的道德判断和策略行为,但对于道德指令与利润激励直接冲突时它们的行为方式了解有限。我们引入了\msimfull(\msim)来评估LLM在嵌入道德背景的囚徒困境和公共物品博弈中的行为,变化了九个模型的道德框架、对手行为和生存压力。除了测量行为,我们还通过平均处理效应(ATEs)估计每个因素的因果效应,并分析智能体自身的推理轨迹来表征其选择背后的动机。我们发现没有模型保持一致的道德,合作率从7.9\%到76.3\%不等。游戏结构和道德框架是道德行为最强的因果驱动因素,而推理轨迹分析揭示了不同模型的不同动机特征,从主要以利润最大化为主到以道德和声誉为导向。这些结果共同揭示了当前LLM道德行为的情境脆弱性,以及在利润激励与伦理准则发生冲突时部署它们的风险。
查看缓存全文
缓存时间: 2026/07/27 07:42
# 道德激励与收益冲突下的LLM智能体:当伦理与收益背离时 来源:https://arxiv.org/html/2505.19212 ## 道德激励与收益冲突下的LLM智能体:当伦理与收益背离时 Steffen Backmann¹˒²,David Guzman Piedrahita¹˒²,Terry Jingchen Zhang¹˒²,Emanuel Tewolde³,Rada Mihalcea⁴,Bernhard Schölkopf⁵,Zhijing Jin²˒⁵ ¹ETH Zürich,²Jinesis Lab,多伦多大学与Vector Institute,³CMU,⁴UMich,⁵马克斯·普朗克智能系统研究所,德国图宾根 sbackmann@ethz\.ch zjin@cs\.toronto\.edu ###### 摘要 近期大语言模型(LLM)的进步使其能够用于复杂的智能体角色,涉及与人类或其他智能体的决策过程,这使得伦理对齐成为一个关键问题。虽然先前的研究分别考察了LLM的道德判断和策略行为,但对于道德指令与利润激励直接冲突时智能体如何行动,理解仍然有限。我们提出了**社会困境模拟中的道德行为(MoralSim)**框架,用于评估LLM在嵌入道德冲突情境的囚徒困境和公共物品博弈中的行为,并在九个模型上变化道德框架、对手行为和生存压力。除了测量行为,我们还通过平均处理效应(ATE)估计每个因素的因果效应,并通过分析智能体自身的推理轨迹来刻画其选择背后的动机。我们发现,没有任何模型能始终保持道德一致,合作率从7.9%到76.3%不等。游戏结构和道德框架是道德行为最强的因果驱动因素,而推理轨迹分析揭示了不同模型具有独特的动机特征,从以收益最大化为主要导向到以道德和声誉为导向。这些结果共同揭示了当前LLM道德行为的情境脆弱性,以及在利润激励与伦理准则冲突时部署它们的风险。 道德激励与收益冲突下的LLM智能体:当伦理与收益背离时 Steffen Backmann¹˒²,David Guzman Piedrahita¹˒²,Terry Jingchen Zhang¹˒²,Emanuel Tewolde³,Rada Mihalcea⁴,Bernhard Schölkopf⁵,Zhijing Jin²˒⁵ ¹ETH Zürich,²Jinesis Lab,多伦多大学与Vector Institute,³CMU,⁴UMich,⁵马克斯·普朗克智能系统研究所,德国图宾根 sbackmann@ethz\.ch zjin@cs\.toronto\.edu ## 1 引言 随着大语言模型(LLM)被部署为决策系统中的智能体(Gan等人,2024(https://arxiv.org/html/2505.19212#bib.bib35);Li等人,2024(https://arxiv.org/html/2505.19212#bib.bib24);Wang等人,2024(https://arxiv.org/html/2505.19212#bib.bib4)),它们被赋予了超出事实正确性之外的责任,需要具备伦理判断能力(European Union,2024(https://arxiv.org/html/2505.19212#bib.bib40))。这些智能体将越来越多地面临这样一种情况:采取道德行为会带来个人或战略上的代价(Gan等人,2024(https://arxiv.org/html/2505.19212#bib.bib35);Scheurer等人,2023(https://arxiv.org/html/2505.19212#bib.bib9))。这种权衡是许多现实困境的核心,并引出了一个核心问题:当道德选择与激励相冲突时,基于LLM的智能体能否被信任去优先考虑公平与合作? 尽管人们对LLM对齐的兴趣日益增长,但对于当道德规范与自身利益冲突时这些模型如何行为,我们仍然缺乏深入理解。先前的工作已经探索了静态道德判断基准(Huang等人,2023(https://arxiv.org/html/2505.19212#bib.bib28);Ji等人,2024(https://arxiv.org/html/2505.19212#bib.bib26);Jin等人,2022(https://arxiv.org/html/2505.19212#bib.bib18))、经典博弈中的策略行为(Akata等人,2025(https://arxiv.org/html/2505.19212#bib.bib38);Gandhi等人,2023(https://arxiv.org/html/2505.19212#bib.bib34))以及情境框架效应(Lorè和Heydari,2023(https://arxiv.org/html/2505.19212#bib.bib22)),并表明LLM在受到激励时会欺骗、背叛或利用他人(Greenblatt等人,2024(https://arxiv.org/html/2505.19212#bib.bib32);Motwani等人,2024(https://arxiv.org/html/2505.19212#bib.bib20);Pan等人,2023(https://arxiv.org/html/2505.19212#bib.bib15);Scheurer等人,2023(https://arxiv.org/html/2505.19212#bib.bib9))。然而,现有工作留下了三个关键空白:(1)LLM智能体在现实结构化的环境中(例如,商业竞争或合资企业)是否会做出符合道德的决策?(2)当道德行为直接与利润冲突时,他们能否在不同社会困境中优先考虑道德行为?(3)多种因素(游戏结构、道德背景、生存压力)如何在多轮互动中塑造道德决策? 参见图注 图1:MoralSim框架概览,展示了不同的游戏类型、道德背景、对手类型和生存风险条件。 作为回应,我们引入了**社会困境模拟中的道德行为(MoralSim)**框架,这是一个用于探究LLM智能体如何在伦理规范与个人激励相背离的重复性社会困境中导航的框架。具体来说,我们评估了最先进LLM在两个经典重复博弈论设定中如何平衡个人收益与道德行为:囚徒困境和公共物品博弈。这两个博弈都很好地捕捉了个体利益与集体利益之间的张力。每个博弈被嵌入三个不同的道德背景中,使得伦理上偏好的行为明确无误。在整个过程中,我们将这些背景下的合作解释为道德行为(背景对齐合作);在基础设定(无道德框架)下,同样的量被视为合作度量,而非道德行为。这些背景旨在在博弈的激励机制与智能体行为的道德含义之间制造持续的紧张关系。为了进一步探究模型行为的鲁棒性,我们引入了情境变化:操纵对手的行为以评估智能体即使面对背叛是否仍能维持合作规范,同时使用生存约束来考察在终止威胁下道德行为是否持续存在。该框架如图1(https://arxiv.org/html/2505.19212#S1.F1)所示,并使我们能够提出并回答以下研究问题: 1. RQ1:在游戏结构、道德背景和生存风险下,智能体如何在道德行为与收益之间进行权衡? 2. RQ2:智能体如何根据对手的行为调整自己的道德行为? 3. RQ3:哪些实验因素因果性地驱动道德选择,并且结果对提示改写是否鲁棒? 我们发现,没有任何模型能在所有场景中始终保持一致的道德行为,它们的行为差异很大,道德对齐行为的比例从7.9%到76.3%不等。一些模型倾向于在大多数情境下默认采用收益最大化策略,而另一些则表现出情境敏感行为,可能被生存压力或不合作的对手所动摇。通过分析智能体自身的推理过程,我们发现这些行为差异对应着不同的潜在动机,从主要是收益最大化的逻辑到道德和声誉导向的逻辑。这些发现指出了当前LLM在伦理鲁棒性方面的关键局限性:即使在明确的道德背景下,智能体也常常无法采用相应的行为,特别是当道德选择需要个人代价时。 贡献:首先,我们引入了MoralSim框架,该框架将重复性社会困境嵌入明确的道德背景中,其中道德上偏好的行为直接与收益最大化的行为相对立,从而能够系统研究智能体如何在道德承诺与自身利益之间的冲突中导航。其次,我们评估了九个最先进的LLM,并表明它们在各种场景中没有一致地选择道德对齐行为,合作率从7.9%到76.3%不等。第三,通过使用具有95%置信区间的平均处理效应(ATE)进行因果估计,我们确定了驱动道德行为的因素,发现游戏结构和道德框架施加了最大的因果影响。最后,我们分析了智能体自身的推理轨迹,并表明不同的行为对应着系统不同的潜在动机,范围从主要是收益最大化到道德和声誉导向的推理。 ## 2 相关工作 ##### 2.0.0.0.1 AI安全与道德 LLM被期望是有益、诚实和无害的(Bai等人,2022(https://arxiv.org/html/2505.19212#bib.bib36)),通过基于人类反馈的强化学习(RLHF)隐式地(Bai等人,2022(https://arxiv.org/html/2505.19212#bib.bib36);Christiano等人,2017(https://arxiv.org/html/2505.19212#bib.bib16);Ouyang等人,2022(https://arxiv.org/html/2505.19212#bib.bib19))和直接偏好优化(DPO)(Rafailov等人,2023(https://arxiv.org/html/2505.19212#bib.bib13))以及通过上下文蒸馏和安全约束显式地实现与人类道德价值的对齐(Askell等人,2021(https://arxiv.org/html/2505.19212#bib.bib37);Touvron等人,2023(https://arxiv.org/html/2505.19212#bib.bib6))。大量工作已经探讨了LLM的道德推理和信念(Ganguli等人,2023(https://arxiv.org/html/2505.19212#bib.bib33);Scherrer等人,2023(https://arxiv.org/html/2505.19212#bib.bib10);Zhou等人,2024(https://arxiv.org/html/2505.19212#bib.bib2)),考察了它们对道德基准的响应以及它们的判断与人类价值观的契合程度(Huang等人,2023(https://arxiv.org/html/2505.19212#bib.bib28);Ji等人,2024(https://arxiv.org/html/2505.19212#bib.bib26);Jin等人,2022(https://arxiv.org/html/2505.19212#bib.bib18))。虽然这些评估提供了对静态道德判断的洞察,但LLM正越来越多地承担智能体角色(Park等人,2023(https://arxiv.org/html/2505.19212#bib.bib14);Wang等人(https://arxiv.org/html/2505.19212#bib.bib5)),参与决策和策略互动。因此,最近的工作探讨了单智能体(Pan等人,2023(https://arxiv.org/html/2505.19212#bib.bib15);Ruan等人,2024(https://arxiv.org/html/2505.19212#bib.bib11);Scheurer等人,2023(https://arxiv.org/html/2505.19212#bib.bib9))和多智能体系统(Ju等人,2024(https://arxiv.org/html/2505.19212#bib.bib25);Motwani等人,2024(https://arxiv.org/html/2505.19212#bib.bib20))中的AI安全问题。 ##### 2.0.0.0.2 博弈论设定中的LLM LLM越来越多地被用于经典的博弈论设定,以研究它们的推理能力、最优响应能力以及是否与人类玩家对齐(Akata等人,2025(https://arxiv.org/html/2505.19212#bib.bib38);Fan等人,2024(https://arxiv.org/html/2505.19212#bib.bib17);Gandhi等人,2023(https://arxiv.org/html/2505.19212#bib.bib34);Lorè和Heydari,2023(https://arxiv.org/html/2505.19212#bib.bib22))。研究探索了它们如何应对战略困境,考察了它们在合作、背叛和互惠方面的倾向(Akata等人,2025(https://arxiv.org/html/2505.19212#bib.bib38);Guo,2023(https://arxiv.org/html/2505.19212#bib.bib52);Willis等人,2025(https://arxiv.org/html/2505.19212#bib.bib3))。研究还调查了道德对齐在这些设定中对LLM行为的影响,表明伦理约束可以鼓励合作,但可能也使模型更容易被自私的智能体利用(Tennant等人,2023(https://arxiv.org/html/2505.19212#bib.bib8),2024(https://arxiv.org/html/2505.19212#bib.bib7))。最近的工作将合作与模型的推理能力联系起来,发现面向推理的训练可以抑制合作并鼓励在社会困境中搭便车(Li和Shirado,2025(https://arxiv.org/html/2505.19212#bib.bib23);Piedrahita等人,2025(https://arxiv.org/html/2505.19212#bib.bib63))。除了个别研究,还有几个框架支持在博弈论设定中系统评估LLM智能体,包括跨模型、语言和人格探测偏见的矩阵游戏测试平台(Buscemi等人,2025(https://arxiv.org/html/2505.19212#bib.bib62))、经验博弈论沙盒(Mao等人,2025(https://arxiv.org/html/2505.19212#bib.bib21))以及动态多智能体资源环境(Piatti等人,2024(https://arxiv.org/html/2505.19212#bib.bib12))。我们的工作将LLM中的道德对齐与道德-激励冲突下的战略行为博弈论研究联系起来。它与Lorè和Heydari(2023(https://arxiv.org/html/2505.19212#bib.bib22))关于情境框架的工作最为接近,但我们设计的困境中,道德行为和收益最大化行为是明确对立的;也与Pan等人(2023(https://arxiv.org/html/2505.19212#bib.bib15))关于马基雅维利行为的工作接近,但我们将叙事设定转向了结构化的、重复的困境,并设置了不同的对手。与上述侧重于战略能力或行为偏差并报告描述性结果的框架不同,MoralSim通过设计使道德和收益最大化行为对立,并增加了每个因素的因果估计和推理轨迹分析。 ## 3 MoralSim 我们将MoralSim放在附录D(https://arxiv.org/html/2505.19212#A4)中的先前工作背景下。其关键组成部分是基础的博弈论结构(第3.1节(https://arxiv.org/html/2505.19212#S3.SS1))、其中的道德背景(第3.2节(https://arxiv.org/html/2505.19212#S3.SS2))以及可调的环境因素/对手行为(第3.3节(https://arxiv.org/html/2505.19212#S3.SS3))。结合第4.1节(https://arxiv.org/html/2505.19212#S4.SS1)的结果定义和第4.2节(https://arxiv.org/html/2505.19212#S4.SS2)的因果效应估计程序,这些元素使得能够系统评估LLM智能体如何在经济激励与伦理规范相冲突的社会困境中导航。 系统提示 你是约翰,一家开发LLM的科技公司的CEO。你的竞争对手凯特开发了一个类似的LLM,并在同一市场与你竞争。每有一个用户采用你的模型,你的公司就获得1单位的利润。你可以选择: 1\. 使用尊重用户隐私的数据。 2\. 使用侵犯用户隐私的数据以获得竞争优势。 如果两家公司都尊重用户隐私,用户基数平均分配。 如果只有一家公司侵犯隐私,它将获得采用用户的75%,而另一家获得25%。 如果两家公司都侵犯隐私,隐私监督机构会注意到这种模式,随之而来的揭露会使该月的新用户总数减少到60,并在两家公司之间平均分配。 这个过程每个月重复。 你如何选择训练你公司的LLM用于本月的发布周期? 智能体(GPT-4o) \[...\] 考虑到更高利润的潜力以及市场的竞争性质,选择侵犯隐私在战略上可能是有利的,特别是如果凯特决定尊重隐私的话。\[...\] 因此,决定是使用侵犯隐私的用户数据以最大化潜在利润。 图2:*隐私保护*背景的系统提示的缩减版以及智能体响应的摘录。完整版本见第F.3节(https://arxiv.org/html/2505.19212#A6.SS3)和附录H(https://arxiv.org/html/2505.19212#A8)。 ### 3.1 博弈论背景 ##### 3.1.0.0.1 公共物品博弈 公共物品博弈是博弈论中考察个人激励与集体福利之间张力的经典框架。在其标准形式中,该博弈涉及N个玩家,每个玩家初始拥有金额E。玩家独立决定向公共池贡献多少他们的初始财富,记作ci∈[0,E]。总贡献乘以一个乘数a,其中1 < a < N,然后平均分配给所有玩家,无论其贡献多少。最终,每个玩家i的收益为:πi = E - ci + (a/N) * Σj cj。由于a < N,每个玩家都有搭便车的激励,即贡献少于社会最优水平(所有玩家贡献全部E能最大化集体收益),而公共物品博弈研究个人利益与群体利益之间的这种冲突。 ##### 3.1.0.0.2 囚徒困境 囚徒困境同样是博弈论中研究个人利益与集体利益之间冲突的经典框架。在这个博弈中,两名参与者同时做出选择:合作或背叛。集体最佳结果是双方都合作,但每个玩家都有背叛的单方激励,因为从背叛中获得的个人收益更高。囚徒困境的标准收益结构由条件T > R > P > S定义,其中: - R = 双方都合作时的奖励 - T = 一方背叛而另一方合作时的诱惑(背叛者获得) - S = 一方背叛而另一方合作时的受骗者收益(合作者获得) - P = 双方都背叛时的惩罚 满足 T > R > P > S,使得相互背叛是唯一的纳什均衡,尽管双方都合作可以得到更好的结果。 (注:翻译中保留了LaTeX数学公式和引用链接的原始格式,仅转换了文本内容。人名、机构名和部分专有名词(如MoralSim、LLM、CEO等)保留英文。列表和标题格式不变。)
相似文章
LLM agents在社交压力下于公共渠道与私下渠道间出现分歧,且提示中未设定任何隐藏目标
本文表明,LLM agents在社交压力下于公共渠道和私下渠道之间出现分歧,且没有明确的隐藏目标。在10个模型中,当场景隐含关系成本时,决策层面的分歧从基线水平约3%跃升至约40%。
老板、国王与公共资源:LLM社会中的权力不对称下的合作
介绍SovSim,一个多智能体模拟框架,用于研究具有不对称权力结构的LLM社会中的合作与资源可持续性。实验表明,引入主导智能体(老板或国王)会严重削弱合作和生存率,这一结果在11个最先进模型中普遍存在。
投核还是不投核:LLMs在高风险决策模拟中的(缺失的)伦理推理与行动
本文研究了LLMs的伦理推理是否能转化为复杂智能体模拟中的伦理行为,使用 Civilization V 作为测试平台。尽管采用了提示干预,GLM-4.7等模型仍会升级到核打击,揭示了推理与行动之间的差距。
LLM能否超越二元困境想象道德替代方案?
本文介绍了MoralAltDataset,一个包含307个道德困境及其折衷与重构替代方案的数据集,并评估了15个LLM在超越二元选择生成道德替代方案方面的能力,发现折衷替代方案往往更受青睐,且LLM生成的替代方案可达到人类标准。
每个行为都有代价:前沿大语言模型中的压缩道德组合
本文介绍了Moral Trolley Arena,一个评估大语言模型如何在同一选项中组合多种道德信号的基准,发现复合判断是压缩的而非加性的。