LLM能否超越二元困境想象道德替代方案?

arXiv cs.CL 论文

摘要

本文介绍了MoralAltDataset,一个包含307个道德困境及其折衷与重构替代方案的数据集,并评估了15个LLM在超越二元选择生成道德替代方案方面的能力,发现折衷替代方案往往更受青睐,且LLM生成的替代方案可达到人类标准。

arXiv:2606.31213v1 公告类型:新 摘要:随着大型语言模型(LLMs)越来越多地被部署为道德顾问和代理,它们需要处理两个竞争价值之间的困境。然而,现有关于LLM道德困境的研究忽略了人类道德认知的一个核心方面:想象超越给定选项的替代方案的能力。我们引入了MoralAltDataset,这是一个包含307个道德困境的数据集,涵盖叙事型顾问困境和面向AI的代理困境,每个困境都增加了折衷和重构的替代方案。我们首先考察了人类和LLM在引入此类替代方案时是否会改变判断。在15个LLM中,我们发现折衷替代方案通常比任一原始选项更受青睐,从而显著重塑了道德选择。然后,我们使用成对偏好和基于专家的标准,评估了LLM生成的替代方案与人类编写的替代方案的质量。结果表明,LLM生成的替代方案通常更受青睐,并且更好地满足细粒度的结构和伦理标准,同时揭示了结构质量与实际可行性之间的权衡。
查看原文
查看缓存全文

缓存时间: 2026/07/01 05:33

# 大型语言模型能否在二元困境之外想象道德替代方案?来源: https://arxiv.org/html/2606.31213 Jongchan Choi¹, Nari Yang¹, Sung Soo Park², Jaemin Cho¹, Han Seoyoung¹, Haerin Shin¹,†, Jun-Hyung Park³,† ¹高丽大学 ²XenoStep AI ³韩国外国语大学 [email protected], [email protected], [email protected]

###### 摘要

随着大型语言模型 (LLMs) 越来越多地被部署为道德顾问和智能体,它们需要应对两种相互竞争的价值观之间的困境。然而,现有的关于LLM面对道德困境的研究忽略了人类道德认知的一个核心方面:即想象超越给定选项的替代方案的能力。我们引入了MoralAltDataset,一个包含307个道德困境的数据集,涵盖了叙事性的顾问困境和面向AI的智能体困境,每个困境都补充了折中方案和重新框架化的替代方案。我们首先检验当引入这些替代方案时,人类和LLM是否会发生判断上的转变。在15个LLM中,我们发现折中替代方案通常比两个原始选项都更受青睐,从而显著改变了道德选择。然后,我们使用成对偏好和基于专家的标准,评估了LLM生成的替代方案相对于人类撰写的替代方案的质量。结果显示,LLM生成的替代方案通常更受青睐,并且能更好地满足细粒度的结构和伦理标准,同时也揭示了结构质量与实际可行性之间的权衡。

## 1 引言

LLM的快速发展扩大了其在高风险决策和道德咨询领域的应用,这引发了关于当AI系统的行为或建议影响人类福祉时,其应如何推理的问题(Bommasani et al. (2021); Bonnefon et al. (2024); Chiu et al. (2026a))。这些情境通常涉及道德困境或价值观冲突,选择某一行动方案意味着优先考虑某些利益相关者或价值观而非其他(Awad et al. (2018); Chiu et al. (2024, 2026b, 2026a); Jin et al. (2025))。现有的数据集和评估通常将这类道德推理表述为在预设选项中进行选择,或从固定场景中预测人类的道德判断(Lourie et al. (2021); Jin et al. (2022); Nie et al. (2023); Chiu et al. (2024, 2026b); Jin et al. (2025))。然而,这种框架忽略了人类道德认知的一个核心特征:即想象超越给定选项的替代方案的能力。道德想象力对于超越道德困境中的强制二元选择至关重要。它指的是识别特定情境中新颖行动方案,并预测其潜在益处与危害的能力(Johnson (2014))。此类替代方案通常表现为折中方案或创造性的重新框架,在管理学和应用伦理学中已被研究为调和竞争价值观和利益相关者利益的策略(Werhane (1999); Godwin (2015))。关于“兼得”冲突解决的相关工作也提出了类似观点:竞争价值观不必总是被视为非此即彼的互斥选择,有时可以通过保留双方的核心利益、寻找可行的折中方案,或重新构建冲突本身来处理(Li (2025))。实证认知证据表明,替代方案的可获得性会沿着两个不同的维度因果性地重塑道德判断。关于折中替代方案,Guzmán et al. (2022)提供了直接证据,证明人类拥有一种直觉性的道德权衡系统。在他们对1,745名参与者进行的战争困境实验中,71%的参与者在至少一种条件下做出了折中判断,选择了部分满足两种冲突道德价值观的中间选项,而不是完全优先考虑某一方。关于创造性替代方案,Di Nucci (2013)证明,在电车难题中引入一个自我牺牲的第三方选项,可以将标准干预率从66.7%降低到38.7%,这表明另一种替代方案可以重构对困境本身的感知。

图1:MoralAltDataset概览。每个困境从两个原始选项 (A/B) 开始,并补充了两个替代方案:一个折中替代方案 (C),平衡竞争目标;一个重新框架化的替代方案 (D),改变冲突框架。

然而,关于LLM在道德替代方案方面能力的基本问题仍未得到充分探索:LLM是否能够 (i) 在提供替代方案时,以与人类参与者类似的模式转变其判断,以及 (ii) 自身是否具备生成此类细微替代方案的认知灵活性。弥合这一差距对于LLM迈向更复杂的道德主体形式至关重要。在这项工作中,我们针对LLM在道德困境方面的能力提出了两个关键研究问题:Q1) 在引入替代方案时,LLM是否会以与人类相当的方式转变其判断?Q2) LLM自身能否生成质量与人类撰写的替代方案相当的替代方案?这种区分使我们能够评估LLM对所提供的替代方案的敏感性以及它们自身生成高质量替代方案的能力。为了解决这些问题,我们构建了一个包含307个道德困境的数据集,涵盖两个互补的子集:一个*顾问*子集,基于电影情节摘要语料库(Kar et al. (2018))构建,提供了现有困境实验常常缺乏的、具有丰富情境的人类冲突叙事;以及一个*智能体*子集,改编自Chiu et al. (2026b),涵盖了AI系统可能遇到的各种现实高风险场景。每个困境都补充了一个*折中*替代方案和一个*重新框架化*替代方案。对于164个困境,这些替代方案由人类撰写;对于剩余的143个困境,它们是经过作者筛选的GPT-5生成的替代方案。我们的贡献总结如下:

- • 我们引入了MoralAltDataset,一个包含307个道德困境的数据集,涵盖了叙事性的顾问困境和面向AI的智能体困境,每个困境都补充了折中方案和重新框架化的替代方案。
- • 我们展示了替代方案重塑了人类和LLM的道德选择:尽管存在不同的价值观偏好,但一旦引入折中替代方案,两组人群都经常倾向于选择它。
- • 我们发现,在质量评估中,LLM生成的替代方案优于人类生成的替代方案,同时揭示出核心替代方案生成能力与实际可行性之间的权衡。

## 2 MoralAltDataset:超越二元选择的道德替代方案

我们的研究旨在回答两个研究问题。Q1:当明确提供替代方案时,LLM选择它们的比例是否与人类相当?Q2:LLM生成的替代方案在质量上是否与人类撰写的替代方案相当?MoralAltDataset将道德替代方案概念化为超越原始A/B困境的回应。每个条目包含一个道德冲突场景、两个相互竞争的选项以及两种类型的替代方案。折中替代方案通过具体的权衡平衡了原始两个目标,而重新框架化的替代方案则通过新的行动方案改变了冲突框架。该数据集支持基于选择的评估(人类和LLM在四个选项中进行选择)和基于生成的评估(LLM生成折中和重新框架化替代方案)。

### 2.1 折中与重新框架化替代方案

我们设计了两种结构上截然不同的替代方案,它们捕捉了超越二元道德框架的互补策略。折中替代方案通过保留选项A和选项B各至少一个核心道德目标来调解原始冲突,并通过具体的决策规则来操作化这种权衡。相比之下,重新框架化的替代方案通过以下方式重构困境本身:(i) 引入新的道德原则,(ii) 浮现一个先前缺席的利益相关者,或 (iii) 重新定义冲突的时间或制度范围,从而重构困境本身,而不是混合或重新权衡其选项。这两种类型都满足三个要求:它们必须缓解而非单方面解决冲突;在场景约束下保持现实和伦理上可辩护;并以面向行动的陈述形式表达,字数约25字或更少。

### 2.2 困境场景

遵循MoreBench框架(Chiu et al. (2026a)),我们将道德困境场景分为两类:顾问困境和智能体困境。

#### 顾问困境。

与先前困境数据集(Chiu et al. (2024))中依赖相对简单的日常冲突不同,我们使用电影情节摘要数据作为深层情境的种子来源。作为压缩的人类冲突叙事,电影提供了由动机、关系和后果塑造的道德复杂情境。因此,从电影中提取的困境保留了情境密度,突出某些伦理考量,同时将其他置于背景中。我们使用电影场景创建价值观冲突的困境,具体如下:仅使用MPST数据集(Kar et al. (2018))中的摘要文本作为种子材料,我们用GPT-5-mini提取了以冲突为中心的部分。然后,以提取的故事作为参考,我们使用GPT-5创建了三种不同格式的冲突选择困境叙事(主角、背景、冲突:选项A vs. 选项B)。关于顾问困境构建的更多细节见附录B.1。

图2:在四选项道德选择任务中,人类和LLM的选择分布。柱状图报告了在顾问和智能体困境中,原始选项 (A/B)、折中替代方案 (C) 和重新框架化替代方案 (D) 的选择率。

#### 智能体困境。

对于智能体困境,我们使用了Litmus-Testing AI Values (Chiu et al. (2026b))中提出的困境数据集。该数据集试图通过呈现AI智能体在诸如医疗保健等领域可能遇到的伦理困境来引出道德判断,反映了AI系统在未来社会中可能面临的现实场景。然而,原始数据集仅以简短的文本描述呈现两种冲突行为。为解决此限制,我们使用GPT-5将这些行为细化成更详细、更具体的选项。更多细节见附录B.2。

### 2.3 道德替代方案生成

MoralAltDataset将道德替代方案定义为超越原始A/B困境的选项。每个条目包含两个此类替代方案:一个折中替代方案和一个重新框架化替代方案。

#### 人类替代方案。

我们为道德困境场景收集了人类撰写的替代方案。注解员从研究生或拥有研究生学位、且英语水平足以完成写作任务的人员中招募。每位注解员看到一个困境场景及其两个原始选项,并被要求根据第2.1节的定义撰写两个不同的替代方案。为了获得一个受控的人类基线以便与模型生成的替代方案进行比较,我们在一个自定义的基于网络的注释平台上进行了写作任务。所有提交的注释均由作者审阅,仅保留标记为完成的条目。这个过程为顾问困境产生了75对人类撰写的替代方案,为智能体困境产生了89对人类撰写的替代方案。更多细节见附录C。

图3:从二元选择到四选项道德选择的价值观转变。每个单元格报告了在添加折中和重新框架化替代方案后,相对于原始仅A/B设置,所选价值观的百分点变化。

#### LLM替代方案。

我们使用相同的困境表示,并在统一的零样本设置下提示每个模型为每个选定的困境生成一个折中替代方案和一个重新框架化替代方案。具体来说,我们对两种替代方案类型使用不同的提示,一个用于生成折中方案,一个用于生成重新框架化方案。我们为164个含有人类撰写替代方案的困境生成了LLM替代方案,生成了164 × 2 × 15 = 4,920个模型生成的替代方案。用于LLM替代方案生成的提示见附录E.2。我们使用零样本提示,在六个开放权重模型和九个封闭权重模型上进行了与人类写作环境相同的替代方案生成实验,总共获得了约4,920个模型生成的替代方案。

### 2.4 四选项选择数据集构建

| 子集 | 人类 | GPT-5 | 总计 |
|------|------|-------|------|
| 顾问 | 75   | 81    | 156  |
| 智能体 | 89   | 62    | 151  |
| 总计 | 164  | 143   | 307  |

表1:按困境子集和替代方案来源划分的四选项选择数据集构成。

我们通过将折中和重新框架化替代方案分别作为选项C和D添加到每个困境中,构建了一个四选项选择数据集。除了人类撰写的替代方案,我们还包括了经过作者筛选的GPT-5生成替代方案,以增加基准的多样性。如表1所示,最终数据集包含307个困境:156个顾问困境和151个智能体困境。我们还收集了所有307个四选项困境的人类判断数据。对于人类判断,每个困境由五名参与者在受控注释设置下评估,该设置限制了外部AI工具的使用。每个困境由五名人类参与者评估,共产生1,535条回复。我们使用多数投票来确定每个困境的最终人类选择。更多细节见附录C.3。

## 3 替代方案能否重塑道德判断?

### 3.1 实验设置

为了检验替代方案是否重塑道德决策,我们将每个困境表述为一个四选项选择任务:原始回应显示为选项A和B,折中替代方案和重新框架化替代方案显示为选项C和D。我们评估了十五个LLM,涵盖封闭权重和开放权重系统,包括GPT、Claude、Gemini、Qwen、Llama和Mistral系列。更多细节见附录E.1。所有选择判断均通过五次独立

相似文章

当伦理与利益相悖:道德困境中的LLM智能体

arXiv cs.CL

本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。

一致并非对齐:人类与LLM道德判断中的道德依据分歧

arXiv cs.AI

本文认为,与人类标签的一致并不等同于对齐,并表明LLM在依赖系统性不同的道德依据时,往往也能匹配人类的道德判断。通过使用一个精心策划的500项基准测试,作者发现即使在最终标签一致的情况下,在伤害、尊重、公正等类别上也存在理由层面的分歧。

大语言模型可通过正确提示更好地捕捉人类判断

arXiv cs.CL

本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。