有界道德:定义道德计算的空间
摘要
本文将赫伯特·西蒙的有限理性扩展到道德认知领域,为有限智能体形式化了道德广度与道德深度之间的权衡。论文认为,伦理理论是在受限空间内的局部最优策略,这对AI对齐具有重要意义。
arXiv:2607.00002v1 公告类型:新
摘要:道德认知传统上被建模为对固定伦理理论(义务论、后果主义、美德伦理学)的遵循,这些理论以静态规则或价值函数的形式实现。我们提出有界道德(Bounded Morality),一个用于分析有限智能体所面临的道德问题计算需求的形式化框架。扩展赫伯特·西蒙的有限理性概念,我们将道德情境形式化为两个正交维度:道德广度(被视为道德相关实体的范围)和道德深度(评估其交互所需的推理整合)。有限资源在这些维度之间施加了不可避免的权衡,定义了道德计算的可行空间。在这个空间内,伦理理论对应于适应不同需求模式的局部高效策略,而非相互竞争的道德真理解释。该框架产生了约束下道德遗憾和道德进步的形式化概念,并暗示人工系统中的道德对齐取决于道德推理能力的规模与分配,而非对人类判断的直接模仿。
查看缓存全文
缓存时间: 2026/07/02 05:40
# 有限道德:界定道德计算的空间 来源:https://arxiv.org/abs/2607.00002 查看PDF(https://arxiv.org/pdf/2607.00002) > 摘要:传统上,道德认知被视为遵循固定的伦理理论——义务论、后果论、德性伦理学——并以静态规则或价值函数的形式实现。我们提出有限道德,一个用于分析有限智能体所面临的道德问题计算需求的形式化框架。借鉴赫伯特·西蒙的有限理性概念,我们沿两个正交维度形式化道德情境:道德广度,即被视为具有道德相关性的实体范围;以及道德深度,即评估实体间相互作用所需的推理整合程度。有限资源在这两个维度之间施加了不可避免的权衡,从而定义了道德计算的可行性空间。在该空间中,伦理理论对应于适应不同需求情境的局部高效策略,而非对道德真理的相互竞争的阐述。该框架提供了在约束条件下道德遗憾和道德进步的形式化概念,并暗示人工系统中的道德对齐取决于道德推理能力的规模与分配,而非对人类判断的直接模仿。 ## 提交历史 来自:Max Kanwal \[查看邮箱(https://arxiv.org/show-email/6b7b7b6b/2607.00002)\] **\[v1\]**2026年4月1日星期三17:35:43 UTC(85 KB)
相似文章
LLaMA 3.1-8B-Instruct中的框架条件道德计算:伦理推理的机械可解释性审计
本文使用机械可解释性对LLaMA 3.1-8B-Instruct中的伦理推理进行审计,发现了“情境锚定效应”,即特定领域的表征在道德计算中占主导地位,并提出了“机械对齐”作为研究计划。
考虑语境:塑造道德信念以实现价值对齐
本文主张,在AI价值对齐中聚合道德评估时必须考虑语境因素,表明忽略语境可能导致违反弱帕累托原则,类似于辛普森悖论。
每个行为都有代价:前沿大语言模型中的压缩道德组合
本文介绍了Moral Trolley Arena,一个评估大语言模型如何在同一选项中组合多种道德信号的基准,发现复合判断是压缩的而非加性的。
MET:理论驱动与文化感知的多语言道德推理
本文介绍了 MCLASH(一个多语言道德决策基准)、MET(一种基于理论的提示方法,用于文化感知的道德推理),以及 MET-D(一种自蒸馏训练方法,可跨不同模型家族和规模改进多语言道德推理)。
超越 Goodhart's Law:用于评估多智能体系统合规性的动态基准
本文介绍了 MAC-Bench,一个用于评估多智能体系统程序合规性的动态对抗基准。它提出了 SERV 流水线以生成无污染场景,以及新的指标如合规加权成功率 (CSR) 和马基雅维利差距 (MG)。