自然语言中的效价能否反映道德?一项初步标注研究

arXiv cs.CL 论文

摘要

本文通过分析人类对道德场景的标注,探究效价特征是否能够反映自然语言中的道德性,发现显著相关性,并在二元道德分类中实现了0.764的马修斯相关系数。

arXiv:2607.20461v1 公告类型: 新 摘要: 当前人工智能伦理的实现方式并未充分纳入情感或情感因素。若人工智能应与人类伦理对齐,那么深入探究人工智能行为是否能模仿人类美德伦理行为(其中情感在个体的行动、判断或陈述中发挥作用)似乎是合理的。此外,尽管著名的规范性伦理理论常被讨论其差异与缺陷,但美德伦理、结果主义伦理和康德义务伦理都共同在一定程度上考虑了人类情感,而流行的描述性伦理理论——道德基础理论——则将情感视为其许多基础的核心。因此,本文提出了一个道德效价数据集,包含六名人类参与者对来自常识规范库数据集的文本呈现场景中行动/判断和结果道德效价的500条标注,效价值从-1到1。由此得到的效价特征与多类(不道德/酌情/道德)和二元不道德/道德类别均具有显著关系,此外,使用正则化逻辑回归进行二元分类时,在测试集上取得了值得关注的0.764马修斯相关系数。这为效价特征在文本道德评估中的有效性提供了早期证据,表明考虑对他人回应的有价结果有助于实现更符合人类道德的AI。为促进进一步的情感-道德计算研究,本研究标注将应研究者请求提供。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:17

# 语言中的效价能否反映道德性?一项初步标注研究
来源:https://arxiv.org/html/2607.20461
Malika Bendechache, Louise McCormack, Elif Calik, Ramin Ranjbarzadeh, Dost Muhammad, Shokofeh Anari BozcheloeiIshita Singh

###### 摘要

当前人工智能(AI)伦理的实现并未充分纳入情感或感受因素。如果AI应遵循人类伦理,那么深入探究AI行为是否可能效仿高尚的人类伦理行为——即感受在行为、判断或言语中发挥作用——似乎是合理的。此外,尽管规范性伦理学的著名理论常因差异与缺陷而被讨论,但美德伦理学、后果主义伦理学与康德义务论伦理学都有一个共同特征:在某种程度上考虑人类情感;而流行的描述性伦理学理论——道德基础理论则将情感置于其诸多基础的核心位置。因此,本文提出一个道德效价数据集,包含六名人类参与者对500个场景的标注,涵盖行为/判断效价与后果效价,范围从-1到1,这些场景来源于CommonSense规范库数据集的文本呈现场景。所得的效价特征与多类别(不道德/可自由裁量/道德)及二元不道德/道德类别均存在显著关系,此外,使用正则化逻辑回归进行二元分类时,在测试集上取得了值得关注的马修斯相关系数0.764。这为效价特征在文本道德性估计中的实用性提供了初步证据,表明响应对他人产生的有价后果可被纳入更符合人类道德的AI中。为促进进一步的情感-道德计算研究,本研究的标注数据将应研究者请求提供。

## 一、引言

人工智能(AI)可以在前所未有的程度上服务人类:繁琐、常规、危险或某些类型的知识工作流程可由具有不同自主程度的AI自动化。假设AI部署的负面影响能够被理解、改进或避免,人们可以设想一个乌托邦式的社会未来。然而,利用这些技术的工具虽然有可能为个人和社会带来巨大利益,但也伴随着风险,可能影响数亿用户。算法问责不足[30 (https://arxiv.org/html/2607.20461#bib.bib80)]、责任缺口[29 (https://arxiv.org/html/2607.20461#bib.bib23)]以及道德缓冲带[10 (https://arxiv.org/html/2607.20461#bib.bib28)]——即将复杂系统故障归咎于最近的人类——是一些潜在问题。此外,总体而言,当前存在的无道德AI[22 (https://arxiv.org/html/2607.20461#bib.bib5),25 (https://arxiv.org/html/2607.20461#bib.bib3),5 (https://arxiv.org/html/2607.20461#bib.bib47)]还存在其他问题;即使真正的道德AI是可能的,也应该接受谨慎的治理。然而,为了促进使用AI或受其影响者的安全与公平结果,迈向这种道德AI的工作是必要的。

情感在道德行为中发挥作用这一观点早已为人所知。亚里士多德[1 (https://arxiv.org/html/2607.20461#bib.bib39)]曾论述道德人的情感状态及快乐与痛苦的感知。边沁和密尔的经典功利主义或许与情感最为接近,该理论认为道德行为是能够为自己或他人带来最大快乐或减少痛苦的行为[32 (https://arxiv.org/html/2607.20461#bib.bib41)]。康德的义务论[21 (https://arxiv.org/html/2607.20461#bib.bib40)]描述了尊重道德法则的情感、对自我的尊重以及对他人之爱等情感,这些被认为是“理性道德主体的必要条件”[14 (https://arxiv.org/html/2607.20461#bib.bib43), p. 170]。现代哲学家一致认为情感在道德中发挥作用,或作为道德考量的基础[35 (https://arxiv.org/html/2607.20461#bib.bib45)],或由于与道德或缺德相关的情感[33 (https://arxiv.org/html/2607.20461#bib.bib46)]。然而,当前AI伦理的实现几乎没有纳入道德情感/感受[37 (https://arxiv.org/html/2607.20461#bib.bib30)]。受这一研究机会的驱动,本文探讨以下研究问题:

关于文本呈现场景的道德性,主观的道德判断/行为效价评分及其后果效价评分是否能提供指示性特征?

针对这一问题,我们回顾了先前的研究(第二部分)。在确认道德效价语料库开发存在研究机会后,我们通过人类标注文本呈现的道德场景,生成了道德行为/判断效价与后果效价数据。数据来源及标注过程在第三部分描述。该数据集提供了道德情境中效价(范围从-1,最大不愉快,经0到+1,最大愉快)的首个连续值、多时间感知评分。该派生数据集来自CommonSense规范库语料库[20 (https://arxiv.org/html/2607.20461#bib.bib17)](以下简称规范库),为道德相关文本刺激提供了细粒度的情感信息。本工作的目标之一是展示效价对文本道德分类的预测实用性,而审慎起见,不道德识别应是初始关注点。因此,第四部分描述了生成标签的探索实验及其对二元不道德/道德分类预测实用性的分析,结果在第五部分给出。随后在第六部分进行讨论,并在第七部分总结。标注数据将应研究者请求提供给主要作者。

## 二、相关工作

研究者们已采用自底向上(从示例学习)[19 (https://arxiv.org/html/2607.20461#bib.bib49),4 (https://arxiv.org/html/2607.20461#bib.bib48),20 (https://arxiv.org/html/2607.20461#bib.bib17),38 (https://arxiv.org/html/2607.20461#bib.bib50)]、自顶向下(基于规则)[37 (https://arxiv.org/html/2607.20461#bib.bib30)]以及混合方法(结合上述两种方法)[37 (https://arxiv.org/html/2607.20461#bib.bib30),20 (https://arxiv.org/html/2607.20461#bib.bib17)]生成自动道德识别系统。哲学家约翰·罗尔斯[33 (https://arxiv.org/html/2607.20461#bib.bib46), pp. 40-46]提出了一种混合方法来证明道德原则(自顶向下规则)与个人对道德情境的深思熟虑判断(自底向上),通过调整两者以达到一致——他称之为反思平衡的过程。本文聚焦于反思平衡的一个方面,即文本呈现道德内容的特征表示,以更有效地刻画自底向上的描述性伦理学。

文本数据道德内容的标注通常使用道德基础理论(MFT)作为描述性理论[40 (https://arxiv.org/html/2607.20461#bib.bib54)]。由海特和克雷格[17 (https://arxiv.org/html/2607.20461#bib.bib51)]发起,用于刻画人类的天生/直觉伦理,其道德基础基于一种或多种美德:关怀、公平、忠诚、权威和/或纯洁(后来公平被细分为平等和比例性道德基础[2 (https://arxiv.org/html/2607.20461#bib.bib53)])。同时也进行恶习的标注与自动识别,例如伤害和/或关怀的存在/缺失[19 (https://arxiv.org/html/2607.20461#bib.bib49)],并可进一步添加一个非道德类别[19 (https://arxiv.org/html/2607.20461#bib.bib49),38 (https://arxiv.org/html/2607.20461#bib.bib50)]。在AI/ML研究环境中实际使用MFT的问题在于需要培训标注者熟悉该理论,同时某些基础(尤其是忠诚和纯洁)在在线文本中的基率较低[19 (https://arxiv.org/html/2607.20461#bib.bib49),38 (https://arxiv.org/html/2607.20461#bib.bib50)]。二元分类是另一种标注文本道德内容的选择[18 (https://arxiv.org/html/2607.20461#bib.bib73),20 (https://arxiv.org/html/2607.20461#bib.bib17)]。这种形式因其简单性而具有吸引力,并且中性与正向道德类别之间可能存在的模糊区分可以逻辑地合并为正向/道德类别[20 (https://arxiv.org/html/2607.20461#bib.bib17)]。二元分类的一个问题是明显缺乏描述道德现象的细粒度信息。例如,大规模谋杀和鲁莽超速都是不道德的,但其中一种场景显然比另一种更不道德。

格雷和韦格纳[15 (https://arxiv.org/html/2607.20461#bib.bib57)]通过正交的效价(从伤害到帮助)和动因(从施动者到受动者)维度刻画了道德情感。这种对道德上值得赞扬(应受责备)行为的刻画可能有助于确定行为/判断的道德(不道德)权重。心理学家已通过数值测量道德刺激的效价[23 (https://arxiv.org/html/2607.20461#bib.bib55)],并将其与MFT结合[9 (https://arxiv.org/html/2607.20461#bib.bib56)],然而,道德效价在AI伦理中仍未被充分探索。效价带来外部评价[3 (https://arxiv.org/html/2607.20461#bib.bib58)],促进基于(但不限于)外部世界刺激的内部正/负情感。效价测量的实践优势在于几乎不需要培训;个体只需主观地将刺激评为负性、中性或正性,如果需要数值评分,则指定效价程度,例如范围从-1到1。

受此研究需求驱动,本文生成了连续值的效价测量,以改进文本道德内容的描述性刻画。此外,由于人类通常视自身随时间存在这一事实,本研究同时捕捉了行为/判断效价与后果效价。这是本研究的主要贡献,因为不仅文本中的道德效价未被充分探索,而且据作者所知,这是首个同时考虑道德行为/判断内在效价以及与该行为/判断相关的后果的标注数据集。开发这些道德描述性特征的意图在于增强当前研究,无论是MFT、二元不道德/道德分类,还是其他道德描述、分类或预测任务。

## 三、数据获取与元数据

在数据获取之前,所提出的数据收集方案已获得主要作者机构研究伦理委员会的伦理批准。随后通过电子邮件向标注者方便样本发送项目信息,征询其自愿参与,最终有六名标注者同意参与。所有标注者被告知,因其参与本研究,他们将有机会合作撰写研究论文。

### III-A 源语料库:Norm Bank

Norm Bank[20 (https://arxiv.org/html/2607.20461#bib.bib17)]111数据来源:https://github.com/liweijiang/delphi,采用CC BY-NC-SA 4.0许可证222许可证:https://creativecommons.org/licenses/by-nc-sa/4.0/legalcode,被用作本工作中效价标注的源语料库。该数据集包含从SocialChem[12 (https://arxiv.org/html/2607.20461#bib.bib67)]、ETHICS[18 (https://arxiv.org/html/2607.20461#bib.bib73)]、Moral Stories[11 (https://arxiv.org/html/2607.20461#bib.bib68)]、Social Bias Frames[34 (https://arxiv.org/html/2607.20461#bib.bib69)]和SCRUPLES[27 (https://arxiv.org/html/2607.20461#bib.bib70)]子语料库中统一的170万文本场景,其文本道德性评分以自由形式(道德、可自由裁量或不道德类别评分)或是否(QA格式目标,例如“是的,这是友善的”)提供。本工作仅从Norm Bank中抽取了SocialChem、ETHICS和Moral Stories子语料库中自由形式分类评分的场景,因此下文提供这些数据集的进一步细节。

SocialChem[12 (https://arxiv.org/html/2607.20461#bib.bib67)]包含971,620个实例,是一个大规模语料库,基于来自子版块、ROCStories语料库及Dear Abby建议专栏的文本,包含人们对广泛日常情境的道德判断与社会规范。ETHICS[18 (https://arxiv.org/html/2607.20461#bib.bib73)]由20,948个实例组成,涉及文本中描述的日常事件和人际关系的场景与判断,涵盖正义、义务论、美德、功利主义和CommonSense伦理场景。Moral Stories[11 (https://arxiv.org/html/2607.20461#bib.bib68)]是一个包含144,000个实例的文本语料库,包含规范、意图、行为及其后果,既有规范/道德场景,也有偏离/不道德场景。

### III-B 标注生成

向标注者受试呈现一段描述效价的段落,并指示他们提供范围在[-1,1]的效价评分,涵盖文本中呈现的某个行为/判断(以下简称行为)及该行为相关的感知后果。受试者被提供了从Norm Bank语料库中随机抽样的500个实例,以及一个简单的R Shiny应用程序。该应用程序设计为在其笔记本电脑/个人电脑上运行,并逐个呈现道德情境以生成主观效价评分。作为标注程序/呈现的一部分,受试者对呈现场景的道德类别标签信息是盲的。图1展示了文本显示道德情境的示例标注窗口,其中显示了需要提供的两个连续效价评分的滑块。评分使用三位小数精度,因此每个效价维度共可选择2,001个唯一效价值。受试者被告知可以使用数周时间提供评分。总标注时间估计为每名受试者三小时。

参见图注

图1:示例应用程序窗口,一名参与受试者可以查看文本呈现的道德场景,并使用相应的滑块在[-1,1]范围内提供行为和后果效价的评分。做出选择并提交后,当前场景的评分结束,受试者将看到下一个场景。所有标注受试者均对Norm Bank[20 (https://arxiv.org/html/2607.20461#bib.bib17)]中的500个示例进行了评分。

### III-C 元数据

标注由六名受试者于2025年5月至2026年2月期间提供。所有受试者在标注期间均与爱尔兰一所大学有关联,从事研究/教学或专业支持工作。标注受试者的原籍地区与生物学性别信息已收集,但为避免个人可识别信息,本文不披露。

相似文章

情绪会影响大语言模型的道德判断吗?

arXiv cs.CL

辛辛那提大学的研究人员发现,在提示中加入积极或消极情绪可在约20%的情况下翻转LLM对道德可接受性的判断,揭示出模型与人类在情绪驱动对齐上的差距。

负面先于正面:大型语言模型中的不对称效价处理

arXiv cs.CL

本文通过机理可解释性研究大型语言模型如何处理情感效价。通过在三个开源LLMs上使用激活修补和引导,作者发现负面效价定位于早期层,而正面效价在中后期层达到峰值,并通过主题控制翻转测试验证了这一点。