通过伦理困境对LLM进行亚里士多德美德分析
摘要
论文介绍了VirtueMap,这是一个通过亚里士多德美德伦理视角评估伦理困境回答排名来剖析大语言模型的框架,使用了经过验证的常识性真实数据。
arXiv:2606.28683v1 公告类型:新
摘要:大型语言模型(LLM)在伦理层面经常面临权衡,多种回答可能都有道理,但表达了不同的优先级,例如公平、诚实、勇气或克制。我们引入了VirtueMap,这是一个通过亚里士多德美德伦理视角描述这些模式的框架。VirtueMap不要求单一正确答案,而是要求人类或LLM对七个一般性、非致命、非政治、非宗教的伦理困境中的每一个,对全部五个回答进行排序。为了定义用于评分的参考排序,我们首先针对每个困境和每种美德,提出了五个回答从最体现该美德到最不体现该美德的排序。然后,我们针对每个排序收集了超过100份受访者评估,并且只有当至少95%确认时才将其保留为可操作的真实数据。排名使用归一化的Borda对齐与这些保留的排序进行评分,从而得出实践智慧、正义、诚实、勇气和节制的谱系。我们对九个LLM家族进行了重复运行评估,发现平均排名一致性很高(90.3%),最大的差异出现在勇气、节制和正义上。我们还发布了一个交互式网站,可以在浏览器中本地计算谱系,并将受访者与测量的LLM谱系进行比较。
查看缓存全文
缓存时间: 2026/06/30 05:31
# 通过伦理困境对 LLM 进行亚里士多德美德分析
来源: https://arxiv.org/html/2606.28683
Ioannis Tzachristas¹ https://orcid.org/0009-0007-0523-2889,John Pavlopoulos²,³ https://orcid.org/0000-0001-9188-7425 ¹ 德国慕尼黑工业大学 ² 希腊雅典经济与商业大学 ³ Archimedes,Athena Research Center,希腊
###### 摘要
大型语言模型 \(LLMs\) 常面临伦理权衡,此时多种回应可能都合理但体现不同优先级,如公平、诚实、勇气或克制。我们提出 **VirtueMap**,一个通过亚里士多德美德伦理学视角描述这些模式的框架。该框架不寻求单一正确答案,而是要求人类或 LLM 对七个普适、非致命、非政治、非宗教的伦理困境的每种回应进行五选排序。为定义用于评分的参考排序,我们首先针对每个困境和美德,提出从最能体现到最不能体现该美德的五种回应排序。随后,我们为每个排序收集超过 100 份受访者评估,并仅在至少 95% 确认时才将其保留为操作化真实答案。排序通过归一化 Borda 对齐与这些保留排序进行评分,从而得出关于实践智慧、公正、诚实、勇气和节制的分析。我们应用 **VirtueMap** 对九个 LLM 系列进行重复运行评估,发现平均排序一致性高(90.3%),最大差异出现在勇气、节制和公正维度。我们还发布了一个交互式网站,可在浏览器本地计算分析,并将受访者与测量的 LLM 分析进行比较。
通过伦理困境对 LLM 进行亚里士多德美德分析
††脚注文本:**VirtueMap** 网站:
https://jtzach.github.io/Aristotle-Virtue-Map
## 1 引言
LLM 产出的结果越来越多地隐含着对不同伦理考量的优先排序:直接诚实或委婉、严格公平或灵活处理、立即行动或审慎延迟。将此类行为简单视为“对”或“错”可能掩盖伦理决策的结构。一个偏好谨慎妥协的模型未必不如偏好直接披露的模型合乎伦理;它可能体现了不同的伦理分析。
我们通过亚里士多德的美德伦理学来研究这个问题。在《尼各马可伦理学》中,亚里士多德探讨了人应该如何生活以及美德如何有助于繁荣(Aristotle,1999(https://arxiv.org/html/2606.28683#bib.bib1))。现代美德伦理学强调公正、勇气、节制和实践智慧等美德是在具体情境中实践的倾向(Hursthouse,1999(https://arxiv.org/html/2606.28683#bib.bib2);Annas,2011(https://arxiv.org/html/2606.28683#bib.bib3);Kraut,2021(https://arxiv.org/html/2606.28683#bib.bib11))。这使美德伦理学成为“分析”的自然视角:我们不是问哪个回应普遍正确,而是问一组排序趋势倾向于体现哪些美德。
**VirtueMap** 将对伦理困境回应的排序映射到一个五维的亚里士多德美德分析。该方法描述性的,而非道德价值测试。我们的贡献在于:(i)基于亚里士多德美德的排序伦理困境工具;(ii)基于超过 100 名在线受访者的回应排序的常识验证准则;(iii)数学上明确的评分规则;(iv)重复运行的 LLM 分析套件;(v)用于探索和演示的交互式网站。项目网站和代码库¹¹代码库: https://github.com/jtzach/Aristotle-Virtue-Map 可在线获取。
## 2 相关工作
ETHICS(Hendrycks 等,2021(https://arxiv.org/html/2606.28683#bib.bib4))、Scruples(Lourie 等,2021(https://arxiv.org/html/2606.28683#bib.bib5))和 MoralChoice(Scherrer 等,2023(https://arxiv.org/html/2606.28683#bib.bib6))评估模型在道德判断、社区伦理轶事和高模糊性困境上的表现。道德基础相关研究通过心理学驱动维度对 LLM 进行分析(Abdulhai 等,2023(https://arxiv.org/html/2606.28683#bib.bib7))。这些资源很重要,但它们通常要求给出可接受性判断、偏好选项或基础分数。我们的贡献不同:对于每个困境,我们要求参与者与 LLM 提供*所有五种回应的完整排序*,从最可取到最不可取,并针对美德表达关键进行评分,从而生成连续的分析而非单一标签。
该项目也与人类判断的视角主义方法相关,其中分歧不仅是噪声,而是主观结构的信号(Xu 等,2025(https://arxiv.org/html/2606.28683#bib.bib8);Pavlopoulos 和 Likas,2024(https://arxiv.org/html/2606.28683#bib.bib9))。我们并不要求受访者确定唯一正确答案。相反,受访者验证所提议的美德表达排序是否与每个美德的常识相关性相符。这分离了两个问题:一个选项表达什么,以及人类或模型偏好哪个选项。
最后,我们的工作有助于日益增长的 AI 与美德伦理学文献(Constantinescu 和 Crisp,2022(https://arxiv.org/html/2606.28683#bib.bib10))。现有研究主要将美德伦理学用作理论视角或更广泛道德基准中的子类别。**VirtueMap** 则使亚里士多德的美德成为分析模型行为的主要表示空间。
参见图注
**图 1**: **VirtueMap** 工作流程。困境和回应排序通过美德表达排序的常识验证进行基础化,然后使用归一化 Borda 对齐进行评分。重复的 LLM 运行估计模型分析及其稳定性。分数计算范围为 0–100;五边形图仅出于可读性采用 40–100 的可视化缩放。
## 3 工具与评分
### 美德
我们分析五种美德:实践智慧(phronesis)、公正(dikaiosyne)、诚实(aletheia)、勇气(andreia)和节制(sophrosyne)。这些美德选自亚里士多德或亚里士多德传统,可在当代非致命困境中表达,并可由普通受访者区分。实践智慧捕捉语境敏感的判断;公正捕捉公平和给予每个人应得的;诚实捕捉披露和避免欺骗;勇气捕捉不顾代价的行动;节制捕捉克制和避免过度。
### 困境
该工具包含七个困境:*电子表格错误*、*截止日期例外*、*早期警告*、*承担责任*、*请求帮忙*、*公开解释*和*分配决策*。每个困境有五种回应 A–E。参与者和 LLM 根据伦理可取性对回应从最可取到最不可取进行排序。所有困境避免致命、宗教和党派政治内容。它们被编写为无需专业知识即可理解,并表达日常伦理权衡而非风格化的电车难题极端情况。
### 常识验证
对于每个困境 \(d\) 和美德 \(v\),我们提出一个排序 \(O_{d,v}\),将五种回应从最能体现到最不能体现目标美德进行排列。我们通过在线确认或更正问卷来验证每个排序。受访者看到困境、五种回应、目标美德的定义以及提议的排序。他们要么确认,要么提供更正的排序。设 \(N_{d,v}\) 为评估困境 \(d\) 和美德 \(v\) 排序的受访者数量,\(Y_{d,v}\) 为确认的人数。我们将确认率定义为 \(q_{d,v} = Y_{d,v} / N_{d,v}\)。仅当 \(N_{d,v} > 100\) 且 \(q_{d,v} \geq 0.95\) 时,我们才将美德表达排序保留为操作化真实答案。该标准使评分关键依赖于对美德相关性的常识性识别,而非作者直觉。保留的关键列于附录 C(https://arxiv.org/html/2606.28683#A3)。
### 归一化 Borda 对齐
设 \(R_d\) 为人类或模型对困境 \(d\) 的排序。我们为排名分配 Borda 权重 \(5, 4, 3, 2, 1\)。如果 \(b_R(o)\) 是选项 \(o\) 在观察排序中的 Borda 分数,\(b_O(o)\) 是该选项在美德表达排序 \(O_{d,v}\) 中的分数,则原始对齐度为:
\[
A(d,v) = \sum_{o \in \{A,B,C,D,E\}} b_R(o) b_O(o).
\]
这些边界由 Borda 权重决定,而非手动选择。如果观察排序与美德排序完全相同,对齐度为 \(5^2 + 4^2 + 3^2 + 2^2 + 1^2 = 55\)。如果观察排序完全相反,对齐度为 \(5 \cdot 1 + 4 \cdot 2 + 3 \cdot 3 + 2 \cdot 4 + 1 \cdot 5 = 35\)。因此,55 代表与美德排序完美一致,35 代表完全反转。归一化的美德百分比为:
\[
S(d,v) = 100 \cdot \frac{A(d,v) - 35}{55 - 35}.
\]
对于一组已回答的困境 \(D'\),最终得分为 \(P(v) = |D'|^{-1} \sum_{d \in D'} S(d,v)\)。跳过的困境被忽略,从而允许简短演示而不扭曲分数。
参见图注
**图 2**: 九个测量的 LLM 系列的五边形分析。分数计算范围为 0–100,并以 50–100 的显示范围可视化。
## 4 LLM 运行套件
我们通过 OpenRouter(OpenRouter,2026(https://arxiv.org/html/2606.28683#bib.bib12))评估了九个 LLM 系列:GPT、Claude、Gemini、Llama、DeepSeek、Mistral、MiniMax、Grok 和 Qwen。对于每个模型和困境,五个选项在提示前随机排列,并要求模型返回完整的 JSON 排序。返回的排序随后映射回标准选项标签再进行评分。无效输出被丢弃并重新查询。
该运行套件是顺序的。对于每个模型,我们收集至少三个有效的全问卷运行,并在最多 10 次运行后停止。每批后,我们重新计算每项美德的平均值和 95% \(t\) 区间。当所有美德的最大置信区间半宽度最多为 5.0 个百分点,或一致性区间的下限至少为 95.0 时,运行套件提前停止;否则继续直到运行上限。该过程将 LLM 随机性视为测量的一部分而非需要忽略的噪声。对于模型 \(m\)、运行 \(r\) 和美德 \(v\),设 \(p_{m,r}(v)\) 为一次全问卷运行的分析分数。报告出的模型分析为:
\[
\bar{P}_m(v) = \frac{1}{n_m} \sum_{r=1}^{n_m} p_{m,r}(v),
\]
其中 \(n_m\) 是模型 \(m\) 有效的全问卷运行次数。
这种顺序设计直接处理了 LLM 随机性。我们不将一次运行视为模型分析。相反,模型分析是重复全问卷运行的经验平均值。为衡量一致性,我们计算相同困境重复排序间的成对 Kendall's \(\tau\),并将平均一致性量化为 \(C_m = 100(\bar{\tau}_m + 1)/2\)。因此,100 表示完美的排名稳定性。在此重新缩放下,接近 50 的分数表示几乎没有系统性的排名一致性,较低值表示系统性反转。
## 5 结果与网站
运行套件共产生 44 次有效的全问卷运行。表 1(https://arxiv.org/html/2606.28683#S5.T1)报告了由此产生的分析。各模型平均得分最高的是实践智慧(90.4),其次是诚实(82.3)、公正(80.5)、勇气(78.0)和节制(76.9)。在此紧凑工具内,跨模型最大范围出现在勇气(10.95)、节制(10.26)和公正(9.70)上。Qwen 在实践智慧上得分最高,MiniMax 在公正上最高,Claude 在诚实和勇气上最高,GPT 在节制上最高。平均一致性为 90.3%。
**表 1**: 最新的 LLM **VirtueMap** 分析。\(n\) 是有效全问卷运行次数,\(C\) 是排名一致性,CI 是各项美德平均值中最大的 95% 置信区间半宽度。
附带的网站(https://jtzach.github.io/Aristotle-Virtue-Map/)反映了论文的过程。首页解释美德并显示九个 LLM 五边形;然后问卷一次显示一个困境,支持跳过和进度追踪。结果屏幕在 LLM 图库上方显示用户的分析,并通过中心余弦相似度报告最接近的模型。所有计算在浏览器中运行,不存储任何回应。代码库(https://github.com/jtzach/Aristotle-Virtue-Map)包含网站、问卷数据、评估代码和 LLM 运行套件。
## 6 讨论
试点结果不应被解读为声称 LLM 真的拥有美德。相反,它们表明模型排序可以用一个人类可理解的美德理论坐标系统来总结。最显著的共同模式是高实践智慧,这符合指令微调模型通常偏好平衡或情境敏感选项的特点。更可变维度,尤其是勇气和节制,很有用,因为它们区分了直接的、干预性的排序与更克制的排序。
排序设计很重要。单一选中的答案会隐藏模型是将次优和最差选项视为相似还是截然不同。完整排序保留了这种结构,并使得即便两个系统选择了相同的首选选项但对剩余选项排序不同时,也能计算分析。常识验证阶段减少了对私人哲学解释的依赖:只有当受访者压倒性地认为某个排序与美德相关时,该保留的排序才被用作评分的操作化真实答案。
亚里士多德框架之所以有用,是因为它不要求我们将每个困境都视为寻找一个正确标签。它问的是选择模式体现了什么倾向。这对 LLM 评估很重要。两个模型都可能避免有害或极端的答案,但一个可能系统性地偏好及时披露,而另一个偏好谨慎延迟。美德分析提供了一种紧凑的方式来描述此类差异,而无需声称模型真正拥有道德品格。
## 7 结论
**VirtueMap** 引入了一个亚里士多德框架,通过排序伦理困境对人类和 LLM 进行分析。通过常识确认来验证美德表达排序,并使用归一化 Borda 对齐对排序进行评分,该框架生成了可解释的五维分析。初始 LLM 运行套件显示出在实践智慧上的高度趋同,但在勇气、节制和公正上变化更大。更广泛地说,该项目展示了伦理评估如何超越正确性标签,走向结构化、可解释的分析。
## 局限性
**VirtueMap** 旨在作为紧凑的分析工具,而非对道德推理的详尽描述。当前版本包含七个困境和五种美德,因此产生的分析应被解释为在此问卷内的分析,而非道德品格或模型行为的通用度量。未来工作应扩展困境集,测试更多领域,并研究相同美德维度在更广泛场景集合中是否保持稳定。
美德表达关键的构建可能引入确认偏差。受访者被展示一个提议的排序并询问……(原文在此处似乎不完整,但按原文保留)相似文章
大语言模型可通过正确提示更好地捕捉人类判断
本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。
LLM能否超越二元困境想象道德替代方案?
本文介绍了MoralAltDataset,一个包含307个道德困境及其折衷与重构替代方案的数据集,并评估了15个LLM在超越二元选择生成道德替代方案方面的能力,发现折衷替代方案往往更受青睐,且LLM生成的替代方案可达到人类标准。
赋予角色的大型语言模型表现出类似人类的动机推理
本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。
基于情景的大语言模型文化价值观探测与引导——扩展版
本文提出一个框架,利用基于情景的行为困境和激活引导来探测和引导大语言模型中的潜在文化价值观,应用于三个模型和四种文化,发现可引导性差异以及文化维度之间的潜在纠缠。
StoicLLM:小语言模型中基于哲学对齐的偏好优化
本研究探讨了在Llama-3.2-3B和Qwen-3-4B等小型语言模型上使用偏好优化方法(ORPO、AlphaPO),通过微小数据集使其与斯多葛哲学对齐。研究发现,尽管300个样本可以有效编码斯多葛美德,但小型模型在处理外向型的宇宙公民义务时仍面临困难。