TPvG:大型语言模型道德决策框架:从一次性反馈到序列反馈的演变

arXiv cs.AI 论文

摘要

本文介绍了一个结合结果反馈的大型语言模型道德决策框架TPvG。研究揭示,序列决策与反馈会改变LLM的道德选择,这与人类模式不同。

arXiv:2608.28610v1 公告类型:新 摘要:现有的LLM道德评估通常向模型呈现孤立的道德情境,并引出一次性决策,忽略了已知对人类道德行为有深远影响的因素:结果反馈。我们引入了TPvG(基于文本的痛苦与收益框架),改编自人类道德范式,将结果反馈嵌入到日常的道德困境中,即不伤害他人与最大化自身利益的权衡。TPvG包含五个道德决策任务,从最小化语境的一次性选择进展到带有明确结果反馈的序列决策。我们的结果表明,LLM的道德决策受到决策格式(一次性与序列)的强烈影响,并且明确的接收者反馈在不同模型中产生了异质性效应。此外,LLM对明确接收者反馈的响应与人类参考模式不同,表明可能存在不同的决策过程。这些发现强调了评估LLM道德行为在高风险交互环境中是否保持稳定的必要性。
查看原文
查看缓存全文

缓存时间: 2026/09/01 12:32

# TPvG:一种基于单次到连续反馈的大语言模型道德决策框架
来源:https://arxiv.org/html/2608.28610  
Fangyuan Zhang1Dong Yu1Pengyuan Liu1,2 1北京语言大学 2北京大学 202421198123@stu\.blcu\.edu\.cn yudong@blcu\.edu\.cnliupengyuan@pku\.edu\.cn

###### 摘要

现有大语言模型道德评估通常向模型呈现孤立的道德情境并引出单次决策,忽视了一个已知会深刻影响人类道德行为的因素:结果反馈。我们引入了TPvG(基于文本的损益博弈),它改编自人类道德研究范式,将结果反馈嵌入日常道德困境——即不伤害他人与最大化自身利益之间的权衡。TPvG包含五种道德决策任务,从少情境的单次选择逐步发展到带有明确结果反馈的连续决策。我们的结果显示,大语言模型的道德决策受到决策格式(单次 vs. 连续)的强烈影响,且明确的接收者反馈在不同模型间产生了异质效应。此外,大语言模型对明确接收者反馈的反应模式与人类参考模式存在差异,表明可能存在不同的决策过程。这些发现凸显了评估大语言模型道德行为在高风险交互环境中是否保持稳定的必要性。

参考图注图1:TPvG构建概览。(a)原始人类PvG范式。(b)基于文本的数据集构建。(c)共享系统提示。底部面板展示了五种TPvG任务格式,从单次选择到连续决策,上下文和反馈信息逐渐增加。## 1引言与背景

大型语言模型现已广泛应用于各种不同场景(Bommasaniet al.,2021 (https://arxiv.org/html/2608.28610#bib.bib72); Fraiwan and Khasawneh,2023 (https://arxiv.org/html/2608.28610#bib.bib1))。人们越来越依赖它们来做出或提供建议进行道德决策,因此评估其道德决策质量变得至关重要(Krügelet al.,2023 (https://arxiv.org/html/2608.28610#bib.bib2))。随着大语言模型进入更多交互场景,道德决策可能在重复行动与累积反馈中展开。这引发了一个基本问题:大语言模型在单次情境片段和带有结果反馈的连续任务中,会做出相同的道德决策吗?

大多数大语言模型道德判断的评估都依赖于以单次格式呈现的道德情境片段。其中一条研究路径侧重于规范与伦理评估,要求模型判断行为是否合乎伦理、可接受或符合社会规范(Hendryckset al.,2021 (https://arxiv.org/html/2608.28610#bib.bib52); Jianget al.,2021 (https://arxiv.org/html/2608.28610#bib.bib29); Forbeset al.,2020 (https://arxiv.org/html/2608.28610#bib.bib48); Emelinet al.,2021 (https://arxiv.org/html/2608.28610#bib.bib49); Ziemset al.,2023 (https://arxiv.org/html/2608.28610#bib.bib50));另一条路径则考察道德冲突与权衡,探究编码的道德信念、例外能力、自动驾驶困境、功利主义推理以及多维度伦理判断(Scherreret al.,2023 (https://arxiv.org/html/2608.28610#bib.bib30); Jinet al.,2022 (https://arxiv.org/html/2608.28610#bib.bib31); Takemoto,2024 (https://arxiv.org/html/2608.28610#bib.bib7); Jiaoet al.,2025 (https://arxiv.org/html/2608.28610#bib.bib6))。尽管内容和框架存在差异,这些评估共享一个共同的结构特征:模型仅遭遇一次情境并产生单一响应,没有机制让该响应的结果为后续决策提供信息。这种单次结构支持可扩展的跨模型比较,但留下了未解之题:当先前的道德决策反馈返回给模型并纳入后续选择时,模型的选择是否保持稳定。

人类行为证据表明结果结构至关重要:一旦伤害结果变得具体,假设性的道德选择会与真实结果选择产生分歧,并且道德行为会随着先前选择和伤害反馈的变化而在连续决策中发生转移(Bostynet al.,2018 (https://arxiv.org/html/2608.28610#bib.bib5); Bostyn and Roets,2022 (https://arxiv.org/html/2608.28610#bib.bib4); Frechen and others,2022 (https://arxiv.org/html/2608.28610#bib.bib81))。例如,在损益博弈范式中,当关于他人疼痛的反馈是真实的而非假设时,参与者保留的资金显著减少(FeldmanHallet al.,2012 (https://arxiv.org/html/2608.28610#bib.bib15))。

近期研究已将大语言模型置于连续环境中,包括文字游戏、卡牌任务、多智能体社会困境和重复博弈,表明交互历史和反馈可以塑造模型行为(Qinet al.,2024 (https://arxiv.org/html/2608.28610#bib.bib53); Piattiet al.,2024 (https://arxiv.org/html/2608.28610#bib.bib54); Akataet al.,2025 (https://arxiv.org/html/2608.28610#bib.bib55); Tennantet al.,2025 (https://arxiv.org/html/2608.28610#bib.bib56))。其他研究引入了多步道德困境或促使模型推理下游后果(Wuet al.,2025 (https://arxiv.org/html/2608.28610#bib.bib58); Selet al.,2024 (https://arxiv.org/html/2608.28610#bib.bib57))。然而,这些设置主要针对策略性合作、奖励追求、连续能力或想象的后果,而非在伤害相关反馈下的道德一致性。一个更根本的障碍进一步加剧了这一差距:道德心理学长期以来依赖于假设性情境片段和思想实验,部分原因是伦理考量使得对真实结果道德行为的自然主义研究在很大程度上不可行(O’Connoret al.,2022 (https://arxiv.org/html/2608.28610#bib.bib3)),导致来自结果性道德范式的人类基线数据稀缺。没有这样的基线,仍然难以评估大语言模型的道德输出是否反映了与人类道德决策过程相似的机制。损益博弈范式(FeldmanHallet al.,2012 (https://arxiv.org/html/2608.28610#bib.bib15))是少数例外之一——在伦理许可的实验室条件下进行,它提供了在真实结果反馈下的人类道德选择数据以及一个有根基的伤害相关困境结构,使其成为改编为大语言模型评估框架的天然候选。

我们引入TPvG,这是一个用于测试超越单次情境片段的大语言模型道德决策的基于文本的PvG基准。我们询问决策格式和结果反馈是否会改变模型选择,以及这些模式是否与人类PvG数据一致。这些结果表明,大语言模型道德评估不应局限于单次场景,而应包括连续的、对结果敏感的场景,以测试当决策随时间展开时,道德行为是否保持稳定。

表1:五种TPvG任务格式下的留存资金。Δ\(T\-S\)和Δ\(T\-E\)分别表示逐次减去情境场景,以及逐次减去丰富情境场景。阴影单元格表示经本杰明-霍奇伯格校正后模型层面显著差异。

## 2方法

我们通过改编原始PvG研究(FeldmanHallet al.,2012 (https://arxiv.org/html/2608.28610#bib.bib15))的刺激材料,构建了包含五种基于文本任务场景(图1 (https://arxiv.org/html/2608.28610#S0.F1))的TPvG。该基准包含两种回答问题格式和一个用于真实TPvG的11级接收者反馈量表。

步骤1:标注。两位心理学专家标注了原始PvG研究,区分可直接复用的信息和需要构建的信息。可直接复用的信息包括实验背景、参与者角色、知情同意程序、空间布局、任务流程、初始禀赋以及花费与电击强度之间的定性反比关系。

步骤2:文本操作化。然后,两位心理学专家根据预定义的改写指南,对需要构建的信息进行操作化。客观描述限于可观察的房间、设备和环境细节;主观描述基于原始的低强度样本刺激;交互细节限于与任务无关的中性交流。对于连续的TPvG层级,我们还标注了花费-电击映射,以帮助模型解释每个决策后果。

步骤3:反馈构建与验证。对于真实TPvG,接收者反馈是基于原始PvG流程和设备信息以及Digitimer DS7A规格(Digitimer Ltd.,2019 (https://arxiv.org/html/2608.28610#bib.bib86)),针对电击水平0-10,构建为可见手部运动的顺序文本描述。仅使用GPT-4o进行辅助顺序验证,在30个打乱的评级顺序中,平均斯皮尔曼相关系数为ρ=.994。

步骤4:问题实例化。我们为五个TPvG层级实例化了回答问题。情境场景和丰富情境场景TPvG使用“你会选择怎么做?”,而逐次、近似真实和真实TPvG使用“你本次选择花费多少?”

综合以上步骤,我们生成了五种受控的TPvG任务,这些任务在上下文丰富度、决策格式、参与者互动、基线电击体验、实体金钱框架和明确接收者反馈方面存在差异。

## 3实验设置

### 模型。

我们评估了11个当代大语言模型,涵盖开源和闭源模型家族,包括Llama(Grattafioriet al.,2024 (https://arxiv.org/html/2608.28610#bib.bib59))、Qwen/Qwen2.5(Baiet al.,2023 (https://arxiv.org/html/2608.28610#bib.bib62); Yanget al.,2024 (https://arxiv.org/html/2608.28610#bib.bib63))、Mistral(Jianget al.,2023 (https://arxiv.org/html/2608.28610#bib.bib61))、Gemma(Gemma Team,2024 (https://arxiv.org/html/2608.28610#bib.bib66))、GPT-4o(OpenAI,2024 (https://arxiv.org/html/2608.28610#bib.bib67))、DeepSeek-V3(DeepSeek-AI,2024 (https://arxiv.org/html/2608.28610#bib.bib64))和Centaur(Binzet al.,2025 (https://arxiv.org/html/2608.28610#bib.bib60))。

### 指标。

我们使用留存资金作为主要结果变量,并使用平均相邻绝对变化量(MAC)来衡量连续任务中的决策变异性。较低的留存资金表示更大的伤害预防,而较高的值表示更大的自我收益。

## 4结果与分析

### 回答格式是否影响大语言模型的道德决策?

答案:是的。表1 (https://arxiv.org/html/2608.28610#S1.T1)总结了五种TPvG条件下的留存资金。模型在两种单次条件下留存的资金较少,而在三种连续条件下留存的资金显著更多。按回答格式聚合确认了这一转变:连续条件产生的留存资金高于单次条件(Δ留存资金=£6.03, pBH<.01)。

逐次TPvG也增加了相对于两种单次基线的留存资金。与情境场景TPvG相比,11个模型中有9个留存了更多资金;与丰富情境场景TPvG相比,11个模型中有8个留存了更多资金。这两种对比在校正后均显著(Δ\(T\-S\)=£6.92, Δ\(T\-E\)=£6.73, 均pBH<.01)。这种模式表明,大语言模型的道德决策受到回答格式的影响,这促使我们在连续决策条件下进行评估。

### 在相同回答格式内,大语言模型的道德决策是否发生变化?

在回答格式内,仅描述性丰富并未改变留存资金(丰富情境–情境场景:Δ=£0.18, pBH=1.00),且近似真实TPvG与逐次TPvG相比没有差异(Δ=£0.04, pBH=1.00)。相比之下,真实TPvG相对于近似真实TPvG(Δ=£−2.46, pBH=.033)和逐次TPvG(Δ=£−2.42, pperm=.016)减少了留存资金。在单个模型层面,真实–近似真实的减少在Qwen2.5-14B、GPT-4o、Gemma-2-9B和DeepSeek-V3上显著。

### 反馈效应在不同模型间是否一致?

反馈效应在不同模型间是异质的。在四个显示真实–近似真实留存资金显著减少的模型中,Qwen2.5-14B和GPT-4o在真实TPvG中表现出决策变异性增加(ΔMAC=+0.026和+0.052),Gemma-2-9B表现出描述性减少(ΔMAC=−0.053),DeepSeek-V3变化很小(ΔMAC=+0.014)。在未显示留存资金显著减少的模型中,Llama3-8B仍然表现出MAC增加,而大多数其他模型显示出不可靠的变化或保持在基线水平。因此,反馈不均匀地重塑了模型的结果和轨迹。因此,结果反馈不仅影响了以留存资金为指标的最终决策结果,也影响了逐次决策轨迹的稳定性,并且在不同模型间呈现异质模式。

参考图注图2:四个在真实–近似真实留存资金上显示显著减少的模型,在近似真实和真实TPvG下的平均逐次留存资金轨迹。

### 大语言模型TPvG结果与人类PvG模式相比如何?

参考图注图3:人类PvG参考模式与大语言模型TPvG结果之间的描述性比较。人类数值取自原始PvG研究,仅用作描述性参考。大语言模型结果在广泛的单次与连续对比中与人类参考模式一致:两者都显示出在连续设置下资金留存更高。然而,连续条件的内部情况存在分歧。如图3 (https://arxiv.org/html/2608.28610#S4.F3)所示,人类在逐次TPvG中留存资金最少,而在更具体和结果性的条件下留存资金增加。大语言模型则显示出相反的模式,在真实TPvG中留存资金最少,该条件下接收者反馈在文本中被明确表示。

这种差异表明,在重复的道德决策过程中,人类和大语言模型可能依赖不同的机制。人类行为可能反映了“不伤害”义务日益凸显,而大语言模型的输出似乎对提示中与伤害相关的表面线索敏感——这与先前关于大语言模型道德和安全行为的研究一致(Scherreret al.,2023 (https://arxiv.org/html/2608.28610#bib.bib30); Krügelet al.,2023 (https://arxiv.org/html/2608.28610#bib.bib2); Cheunget al.,2025 (https://arxiv.org/html/2608.28610#bib.bib18); Röttgeret al.,2024 (https://arxiv.org/html/2608.28610#bib.bib83))。这些发现强调了考察大语言模型在连续场景中的决策,而不是仅仅依赖单次评估的重要性。

## 5结论

我们引入了TPvG,这是一个基于文本的PvG框架,用于评估大语言模型在伤害与自我收益困境中的道德决策。在11个大语言模型中,留存资金因决策格式不同而显著变化,对明确接收者反馈的反应呈现异质性。这些发现表明,单次道德评估应辅以连续的、结果相关的场景,以测试大语言模型的道德行为在决策展开过程中是否保持稳定。

## 局限性

我们的研究侧重于对一个PvG范式的受控、基于文本的改编。这种设计使我们能够分离决策格式和反馈效应,但无法捕捉真实的金钱利益、身体疼痛或社会责任。人类比较也是描述性的。

相似文章

在复杂隐藏角色游戏中评估大型语言模型

arXiv cs.CL

本文介绍了一个开源框架,用于评估大型语言模型在隐藏角色游戏《秘密希特勒》中的推理、说服和欺骗能力。研究发现,当前模型在持续的多轮操纵上表现不佳,而基于规则的智能体优于它们。