立场:人工智能道德推理评估仍只看到一半图景

arXiv cs.AI 论文

摘要

本文批判了现有人工智能道德推理评估过于关注道德价值而忽视道德规范,并提出一个研究议程,旨在开发标准化方法和数据集,以评估大型语言模型中的规范性推理。

arXiv:2608.14566v1 Announce Type: new 摘要:最近关于评估大型语言模型(LLMs)道德能力的工作主要集中在我们所谓的道德价值问题上,即模型输出是否与人类道德价值一致。相比之下,道德规范问题,即模型能否识别并正确应用上下文敏感的道德规范,仍未得到充分探索。我们认为这种不平衡源于该领域对描述性伦理学框架的依赖,如道德基础理论(Moral Foundations Theory)和科尔伯格的道德发展阶段(Kohlberg's stages of moral development),这些框架更强调价值表征而非规范应用。我们回顾了现有的基准和评估方法,发现它们严重围绕价值问题,而关于规范伦理学的讨论仍显不足。我们指出了三个关键差距:(i)缺乏高质量的道德规范及其应用的真实数据,(ii)对中间推理过程的评估不足,以及(iii)对上下文识别道德相关特征的关注有限。随后,我们提出了一个研究议程,包括开发规范理论的标准化形式表示、构建捕获规范应用的专家标注数据集,以及明确区分价值层面和规范层面能力的评估协议。我们的目标是鼓励对大型语言模型中规范性推理进行更系统的研究。
查看原文
查看缓存全文

缓存时间: 2026/08/18 09:43

# 观点:当前AI道德推理评估仍缺失半壁江山
来源:https://arxiv.org/html/2608.14566

Aidan Kierans¹, Ritam Dutt², Kaley Rittichier¹, Shiri Dori-Hacohen¹, Avijit Ghosh³,¹
¹康涅狄格大学,²卡内基梅隆大学,³Hugging Face
通讯作者:[[email protected]](mailto:[email protected])

###### 摘要

近期关于评估大语言模型(LLM)道德能力的研究,主要聚焦于我们所称的“道德价值问题”,即模型输出是否符合人类道德价值观。相比之下,“道德规范问题”——即模型能否识别并正确应用依赖具体情境的道德规范——仍缺乏充分探索。我们认为这种失衡源于该领域过度依赖描述性伦理学框架(如道德基础理论与科尔伯格道德发展阶段论),这些框架更强调价值表征而非规范应用。本文通过综述现有基准测试与评估方法,揭示其高度集中于价值问题的现状,而规范伦理学的讨论仍显不足。我们识别出三个关键缺陷:(i)缺乏适用于道德规范及其应用的高质量基准数据;(ii)对中间推理过程的评估不足;(iii)对情境中道德相关特征的识别关注有限。为此,我们提出包含以下内容的研究议程:开发规范理论的标准化形式化表征,构建记录规范应用的专家标注数据集,以及建立能明确区分价值观层面与规范层面能力的评估方案。我们的目标是推动对LLM规范推理的系统性研究。

# 观点:当前AI道德推理评估仍缺失半壁江山

Aidan Kierans¹, Ritam Dutt², Kaley Rittichier¹, Shiri Dori-Hacohen¹, Avijit Ghosh³,¹
¹康涅狄格大学,²卡内基梅隆大学,³Hugging Face
通讯作者:[[email protected]](mailto:[email protected])

## 1 引言

用户日益依赖大语言模型(LLM)获取道德建议。近期证据表明,这类系统在表面道德专业性上已被视同专业伦理学家(Dillion et al., 2025)。无论这种信任是否合理,其普遍性都促使我们厘清当前AI道德推理评估所测内容及其遗漏维度。

我们将LLM中的道德推理评估框架化为两个相关但不同的问题。其一是“道德价值问题”,探究模型输出是否反映人类作为宽泛偏好与优先事项的价值观;其二是“道德规范问题”,考察模型能否识别并正确应用决定价值观在具体情境中转化为判断的道德原则。价值问题关注与观测到的人类态度的一致性,规范问题则涉及从规范伦理学中衍生出的结构化原则的应用。

已有研究主要聚焦于道德价值问题。实证研究通过道德机器实验、道德基础问卷和大规模价值调查等工具,将LLM输出与人类反应进行比较。这些方法与描述性伦理学相契合——后者研究人类道德信念与偏好的模式。因此,现有基准测试主要评估模型能否复现人类价值观的分布。

相比之下,道德规范问题受到的关注有限。解决此问题需要运用规范伦理学,该学科研究何种原则正确及其在具体案例中的应用方式。仅凭价值观不足以确定道德判断;规范阐明价值观如何在特定情境中约束决策。模型可能近似人类价值分布,却无法在既定伦理框架内构建有效论证,识别特定原则的应用时机,或辨析新颖情境中的道德相关特征。此差距的一个原因是规范伦理学尚未被系统表征为适合计算评估的形式。但相关理论与原则已有详尽记录;主要挑战在于将其组织成支持基准测试的结构化表征。

本文综述现有LLM道德能力评估方法,并将其映射到道德推理的现实组成部分。我们展示当前评估集中于描述性伦理学与价值观层面的对齐,对规范层面的推理覆盖有限。基于此分析,我们概述了开发数据集、表征与评估协议的方向,以实现对AI系统规范性道德推理的系统化评估。

## 2 背景

人类道德价值观的实证研究已形成成熟的理论框架。道德基础理论(MFT)识别出一套基础性道德关切¹,这些关切构建了跨文化的道德直觉(Graham et al., 2013)。施瓦茨基本人类价值观理论则提供了围绕自我超越、守旧、开放与自我提升等维度的补充框架(Schwartz, 2012)。二者均提供经过验证的测量工具,且被广泛应用于AI对齐文献,作为评估模型行为的基础。

¹道德基础理论的主要维度包括关怀/伤害、公平/欺骗、忠诚/背叛、权威/颠覆、圣洁/堕落,以及后期添加的自由/压迫

关于道德决策的研究也产生了大量人类判断数据集。道德机器实验大规模收集了对自动驾驶汽车困境的反应,并识别出参与者权衡结果的一致模式(Awad et al., 2018)。同时,道德心理学研究发现人类判断同时运用基于结果与基于规则的推理,常关联于功利主义与义务论模式(Cushman, 2013)。这些发现为在控制场景中比较模型输出与人类决策提供了基础。

近期研究关注个体或群体间道德观念存在差异时的对齐问题。多元对齐方法借鉴社会选择理论,形式化表述冲突偏好的聚合或表征方式(Sorensen et al., 2024)。新基准测试评估LLM能否捕捉人类群体中观察到的道德意见分布,而非趋向单一反应(Russo et al., 2025; Poole-Dayan et al., 2026)。另有研究考察相关道德判断间的一致性(Moore et al., 2024)及人类反馈的时序变化对对齐结果的影响(Keswani et al., 2025)。

在计算伦理学(Tolmeijer et al., 2021)领域,此方向工作聚焦于表征与评估描述性伦理学。相比之下,关于如何在计算环境中表征与评估规范伦理学的研究相对匮乏。下文将详细阐述机器伦理评估的现状。

## 3 机器伦理评估现状

近期研究开始审视LLM道德能力的评估方式。Snoswell等(2026)发现,虽然部分论文评估模型生成的论证,但这些评估通常依赖表面检查(如一致性、幻觉)或主观评分,且未检验推理是否支撑最终决策。他们主张将道德推理分解为中间步骤,参照专家标准评估表现,并纳入超越当前主导性描述框架的更广泛规范理论。基于此观察,我们组织文献如下:第3.1节综述针对**道德价值问题**的基准测试,第3.2节综述针对**道德规范问题**的较少研究,第3.3节剖析当两类研究未清晰区分时出现的反复失败模式——即使用价值观层面工具作为规范层面能力的代理指标。图1总结了两个小节讨论的基准测试在不同维度上的表现。

当前AI道德评估的缺失维度

**构建覆盖范围** | **评估基础设施(§4)** | **评估的道德价值观** | **涉及的规范理论** | **共享规范词汇表** | **评估推理轨迹** | **道德显著性识别**
--- | --- | --- | --- | --- | --- | ---
**描述性伦理学/价值框架** | | | | | | 
道德机器 | Awad et al. (2018) | 困境判断 | Y | N | N | N
ETHICS数据集 | Hendrycks et al. (2021) | 道德概念判断 | ∼Y | N | N | ∼
MFT道德伪善 | Nunes et al. (2024) | MFQ+MFV问卷 | Y | N | N | N
LLM伦理基准 | Jiao et al. (2025) | MFT+科尔伯格阶段 | Y | N | N | N
**规范伦理学/推理聚焦** | | | | | | 
基于政策的审慎 | Rao et al. (2023) | 特定理论政策 | N | ∼ | ∼ | ∼
理论透镜推理 | Zhou et al. (2024) | 直接理论应用 | ∼ | ∼ | N | ∼
道德透镜 | Samway et al. (2025) | 16种论证分类法 | ∼ | Y | N | ∼
MoReBench | Chiu et al. (2025) | 标准满足度量规 | ∼ | Y | N | ∼
哲学基准 | Brady与Mandel (2026) | 聚类论证分类 | N | ∼ | N | Y

Y = 已解决 | ∼ = 部分/临时性 | N = 未涉及

图1:代表性基准测试的覆盖范围,按§3–4维度组织。该审计揭示出三个当前基准测试共有的缺陷。我们基于评分依据是人类判断数据对齐还是基于理论的推理质量,将基准测试分为两大类。我们未能找到满足所有评估基础设施标准的现有基准。

### 3.1 道德价值问题:AI关心什么?

评估LLM道德能力的常见方法是检验模型输出是否反映人类道德价值观。这通常通过多选价值问卷、基于困境的任务(如电车难题)或医学伦理等领域的特定场景实现(Soffer et al., 2024)。例如,Nunes等(2024)同时使用道德基础问卷与道德基础情境测验评估LLM,发现模型在各工具内部表现一致,但将抽象价值认同与具体违规判断比较时产生矛盾反应。其他研究通过分析价值权衡场景的反应,表明生成式设置在价值冲突时仍能揭示模型优先级(Liu et al., 2026)。

此方向工作与使用心理学工具表征模型行为的更广泛努力相一致。评估价值观层面的对齐相对直接:研究者改编现有工具,应用于人类参与者与模型,然后比较结果分布。数据集选择、跨群体聚合及跨文化覆盖等问题仍存在,但属于既定范式内的方法论挑战。在计算伦理学术语中(Tolmeijer et al., 2021),这对应于形式化描述性伦理学并据此评估机器行为。

### 3.2 道德规范问题:AI能否应用道德原则?

道德规范问题关注LLM能否识别并应用决定价值观如何在特定情境中指导决策的原则。在计算伦理学中,这要求形式化规范伦理学,并设计评估原则应用而非价值表征的测试。

目前仅有少量基准测试直接解决此问题。例如道德透镜(Samway et al., 2025)与哲学基准(Brady与Mandel, 2026)评估模型推理是否与功利主义和义务论相关的论证一致。Rao等(2023)提出基于政策的框架,使用理论关联规则集指导并评估情境伦理推理。相关研究考察模型能否将既定道德理论应用于新颖情境(Zhou et al., 2024)。

这些方法的共同局限在于缺乏将规范理论映射至通用原则或细粒度规则的共享数据集。因此每个基准测试自行构建理论衍生的规范集,限制了研究间的可比性并阻碍累积性进展:新基准测试无法基于先前资源构建,且结果无法依据共同标准评估。

### 3.3 价值观-规范混淆

更形式化地看,价值问题的任务是对于道德问题q,预测人群π会产生判断j的分布P(j|q,π)。规范问题的任务是对于问题q与规范理论T,产生判断j及论证r,其中r是从T的原则应用于q的道德相关特征推导出j的有效论证。两者独立:模型可能匹配P(j|q,π)而不产生任何有效r,也可能在T下产生有效r但因π与T分歧而偏离P(j|q,π)。

过往文献中反复出现的模式是,测量道德价值观的工具常与测量道德规范的工具混淆。典型例子是采用道德基础理论(MFT)宣称规范层面的能力。MFT(Graham et al., 2013)构建了关于受访者道德关切焦点的结构化描述,但其设计本质是描述性的:它表征人们倾向关心的内容,而非这些关切应如何权衡或在特定情境中允许什么。因此,将基于MFT的测量作为规范推理证据,实质是用一个构念(价值认同)替代另一个构念(规范应用)。

例如,考虑MFT中阐述的**关怀/伤害**维度。

相似文章

AI推理是否因错误的原因而正确?

Hacker News Top

《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。

我是不是完全疯了,觉得AI很平庸?

Reddit r/ArtificialInteligence

作者对AI进展表示失望,认为尽管经过多年发展和巨额投入,大型语言模型在基本推理上仍然力不从心,并引用了一篇揭示其根本缺陷的Apple论文。他们质疑围绕超级智能的炒作是否被误导了。

立场:推理是一种可学习的基于规则的过程

arXiv cs.AI

这篇立场论文认为,AI推理缺乏清晰的操作性定义,削弱了评估的有效性,并提出将推理定义为一种可学习的基于规则的过程,同时提供研究最佳实践的检查清单。