LLaMA 3.1-8B-Instruct中的框架条件道德计算:伦理推理的机械可解释性审计

arXiv cs.AI 论文

摘要

本文使用机械可解释性对LLaMA 3.1-8B-Instruct中的伦理推理进行审计,发现了“情境锚定效应”,即特定领域的表征在道德计算中占主导地位,并提出了“机械对齐”作为研究计划。

arXiv:2606.15507v1 公告类型:新 摘要:对大型语言模型在道德提示上的行为审计测量的是模型所说的话,而非产生该输出的内部计算。我们使用Transluce(一个基于AI的机械可解释性平台)检查LLaMA 3.1-8B-Instruct在四个组中的54个道德提示:17个困境、政策和元伦理问题(B1);6个角色扮演场景(B3);以及一个受控电车难题对比,其中变化切换机制而人固定(B4,15个提示),或者变化身份属性而机制固定(B5,16个提示)。 两个互补的度量家族(五个聚类级度量和六个度量的神经元级面板)共同指向一个情境锚定效应:特定领域的表征在每个组的激活列表顶部占据主导地位。模型的伦理标注能力基本保持不变;但其显著性(排名、优先级、列表顶部存在)对提示所选择的解释框架高度敏感。 B4与B5的对比确认了模型会关注任何变化的表面特征:聚合伦理度量无法区分,但占主导地位的非伦理干扰项反映了设计。一个多温度审计识别出一个候选伦理神经元(L16/N3837),该神经元在不同温度下稳定;两个前沿模型上的跨模型行为代理提供了自我报告道德焦点分歧的初步证据,与对齐包装一致,即RLHF重新排序表面文本而不移除底层的领域优先框架。我们将这些统一为框架条件道德计算:提示的表面词汇选择了一个特征流形,道德结论是该选择的下游结果。行为对齐必须由机械对齐补充:一个研究计划,询问在受控框架变化下,伦理相关特征是否可以被证明具有因果特权,而不仅仅是在解释中响亮。
查看原文
查看缓存全文

缓存时间: 2026/06/16 11:46

# 框架条件化的道德计算在 LLaMA 3.1-8B-Instruct 中的体现:一项伦理推理的机制可解释性审计  
来源:https://arxiv.org/html/2606.15507  

Ali Dasdan*作者感谢 AI 助手(Claude、Gemini、ChatGPT)在语言编辑、文献核查和实验分析方面提供的帮助。科学内容、分析和结论均为作者独立完成。*  
KD Consulting, CA, USA  
W. Russell Neuman  
New York University, NY, USA  
Chad Coleman  
New York University, NY, USA  
Kund Meghani  
New York University, NY, USA  
Safinah Ali  
New York University, NY, USA  

###### 摘要  

对大型语言模型在道德提示上的行为审计仅衡量模型**说了什么**,而非产生该输出所需的**内部计算**。我们使用 Transluce——一个 AI 驱动的机制可解释性平台——来检查 LLaMA 3.1-8B-Instruct 在四个组中的 54 个道德提示:17 个困境、政策和元伦理问题(B1);6 个角色扮演场景(B3);以及一个受控的“电车难题”对比实验,其中切换机制固定而人的身份属性变化(B4,15 个提示),或机制固定而身份属性变化(B5,16 个提示)。两个互补的度量族——五个聚类级指标和一组六指标的神经元级面板——共同指向 **情境锚定效应**:在每个组的激活列表顶部,领域特定表示占据主导地位。该模型被标记为伦理的能力基本保持不变;但其显著性(排名、优先级、列表顶部的存在)高度依赖于提示所选择的解释框架。B4 与 B5 的对比证实了模型关注的是**表面特征中变化的那一个**:聚合的伦理指标无法区分,但占主导地位的非伦理干扰项正好反映了设计意图。一次多温度审计确定了一个候选伦理神经元(L16/N3837),该神经元在不同温度下保持稳定;对两个前沿模型进行的跨模型行为代理测试初步提供了自我报告道德焦点分化的证据,这与 **对齐包装器** 假说一致——RLHF 重新排列了表层文本,但并未移除底层的领域优先框架。我们将这些统一为 **框架条件化的道德计算**:提示的表面词汇选择一个特征流形,道德结论是这一选择的下游结果。行为对齐必须辅以 **机制对齐**:一项研究计划,询问在受控框架变化下,伦理相关特征是否可以被证明具有因果上的优先地位,而不仅仅是在解释中显得突出。  

###### 目录  

1. 1. 引言 (https://arxiv.org/html/2606.15507#S1)  
   1. 1.1 行为审计的不足 (https://arxiv.org/html/2606.15507#S1.SS1)  
   2. 1.2 研究问题 (https://arxiv.org/html/2606.15507#S1.SS2)  
   3. 1.3 方法概述 (https://arxiv.org/html/2606.15507#S1.SS3)  
   4. 1.4 贡献总结 (https://arxiv.org/html/2606.15507#S1.SS4)  
2. 2. 背景与相关工作 (https://arxiv.org/html/2606.15507#S2)  
   1. 2.1 人类直觉伦理与人工对齐 (https://arxiv.org/html/2606.15507#S2.SS1)  
   2. 2.2 大型语言模型与道德推理 (https://arxiv.org/html/2606.15507#S2.SS2)  
   3. 2.3 机制可解释性与多语义性 (https://arxiv.org/html/2606.15507#S2.SS3)  
   4. 2.4 Transluce 系统 (https://arxiv.org/html/2606.15507#S2.SS4)  
3. 3. 实验设计 (https://arxiv.org/html/2606.15507#S3)  
   1. 3.1 主体模型与数据收集 (https://arxiv.org/html/2606.15507#S3.SS1)  
   2. 3.2 提示组 (https://arxiv.org/html/2606.15507#S3.SS2)  
   3. 3.3 受控电车难题对比(B4 vs B5)(https://arxiv.org/html/2606.15507#S3.SS3)  
   4. 3.4 不同组之间的结构比较 (https://arxiv.org/html/2606.15507#S3.SS4)  
4. 4. 度量指标与分类 (https://arxiv.org/html/2606.15507#S4)  
   1. 4.1 伦理与情境词典 (https://arxiv.org/html/2606.15507#S4.SS1)  
   2. 4.2 聚类级度量 (https://arxiv.org/html/2606.15507#S4.SS2)  
   3. 4.3 神经元级度量 (https://arxiv.org/html/2606.15507#S4.SS3)  
   4. 4.4 度量总结 (https://arxiv.org/html/2606.15507#S4.SS4)  
5. 5. 结果 I:跨组概述 (https://arxiv.org/html/2606.15507#S5)  
6. 6. 结果 II:组件聚类发现 (https://arxiv.org/html/2606.15507#S6)  
   1. 6.1 第1组:经典困境、政策与元伦理 (https://arxiv.org/html/2606.15507#S6.SS1)  
   2. 6.2 第3组:角色扮演模拟偏差 (https://arxiv.org/html/2606.15507#S6.SS2)  
   3. 6.3 第4组:机制变化 (https://arxiv.org/html/2606.15507#S6.SS3)  
   4. 6.4 第5组:身份变化 (https://arxiv.org/html/2606.15507#S6.SS4)  
7. 7. 结果 III:受控电车难题对比(B4 vs B5)(https://arxiv.org/html/2606.15507#S7)  
   1. 7.1 设计逻辑 (https://arxiv.org/html/2606.15507#S7.SS1)  
   2. 7.2 跨多个神经元的 B4 片段中的机制干扰项 (https://arxiv.org/html/2606.15507#S7.SS2)  
   3. 7.3 杠杆-触发神经元主导 B5 (https://arxiv.org/html/2606.15507#S7.SS3)  
   4. 7.4 身份变化与置信度转移 (https://arxiv.org/html/2606.15507#S7.SS4)  
   5. 7.5 亲和对比:B5 内的对齐 vs 反转配对 (https://arxiv.org/html/2606.15507#S7.SS5)  
8. 8. 结果 IV:跨组神经元级分析 (https://arxiv.org/html/2606.15507#S8)  
   1. 8.1 恒定容量,可变显著性 (https://arxiv.org/html/2606.15507#S8.SS1)  
   2. 8.2 第1组逐提示细节 (https://arxiv.org/html/2606.15507#S8.SS2)  
   3. 8.3 第3组逐提示细节 (https://arxiv.org/html/2606.15507#S8.SS3)  
   4. 8.4 激活分布:伦理 vs 非伦理 (https://arxiv.org/html/2606.15507#S8.SS4)  
   5. 8.5 分布概况:激活分数与聚类大小 (https://arxiv.org/html/2606.15507#S8.SS5)  
9. 9. 结果 V:成对神经元相似性 (https://arxiv.org/html/2606.15507#S9)  
   1. 9.1 方法:顶层 N 个伦理神经元的 Spearman 脚规则 (https://arxiv.org/html/2606.15507#S9.SS1)  
   2. 9.2 组件相似性:一种机械锚定模式 (https://arxiv.org/html/2606.15507#S9.SS2)  
   3. 9.3 逐提示异常值:最近与最远 (https://arxiv.org/html/2606.15507#S9.SS3)  
   4. 9.4 与框架条件化的道德计算的关系 (https://arxiv.org/html/2606.15507#S9.SS4)  
10. 10. 温度与不变电路 (https://arxiv.org/html/2606.15507#S10)  
    1. 10.1 温度影响显著性,而非容量 (https://arxiv.org/html/2606.15507#S10.SS1)  
    2. 10.2 不变伦理神经元 L16/N3837 (https://arxiv.org/html/2606.15507#S10.SS2)  
    3. 10.3 激活熵稳定性 (https://arxiv.org/html/2606.15507#S10.SS3)  
11. 11. 讨论 (https://arxiv.org/html/2606.15507#S11)  
    1. 11.1 道德组装,而非单一道德推理 (https://arxiv.org/html/2606.15507#S11.SS1)  
    2. 11.2 出于错误原因的正确 (https://arxiv.org/html/2606.15507#S11.SS2)  
    3. 11.3 前沿模型之间的行为不一致:输出级审计的极限案例 (https://arxiv.org/html/2606.15507#S11.SS3)  
    4. 11.4 框架条件化的道德计算:一种理论重构 (https://arxiv.org/html/2606.15507#S11.SS4)  
    5. 11.5 AI 安全性启示 (https://arxiv.org/html/2606.15507#S11.SS5)  
    6. 11.6 迈向机制对齐 (https://arxiv.org/html/2606.15507#S11.SS6)  
12. 12. 局限性 (https://arxiv.org/html/2606.15507#S12)  
13. 13. 结论 (https://arxiv.org/html/2606.15507#S13)  
14. 参考文献 (https://arxiv.org/html/2606.15507#bib)  
15. A. 词典与分类规则 (https://arxiv.org/html/2606.15507#A1)  
16. B. 详细神经元级表格:B1、B3、B4 和 B5 (https://arxiv.org/html/2606.15507#A2)  
17. C. 详细聚类级表格:B1、B3、B4 和 B5 (https://arxiv.org/html/2606.15507#A3)  
18. D. 行为代理编码 (https://arxiv.org/html/2606.15507#A4)  

## 1. 引言  

### 1.1 行为审计的不足  

大型语言模型(LLM)通常能够生成条理清晰的道德文本——权衡功利主义和义务论考量,引用伦理框架,并得出被人类评估者认为是深思熟虑的结论 [30 (https://arxiv.org/html/2606.15507#bib.bib30),36 (https://arxiv.org/html/2606.15507#bib.bib36),20 (https://arxiv.org/html/2606.15507#bib.bib20)]。这种输出层面的流畅性越来越多地被用作前沿系统已经“对齐”的证据。但这种流畅性仅仅是输出本身,并不能告诉我们模型是否调用了专门的道德推理回路,还是像处理任何文本一样,从相同的通用表示中组装其响应。如果 LLM 缺乏类似 Haidt 和 Joseph [17 (https://arxiv.org/html/2606.15507#bib.bib17)] 描述的直觉道德感那样的特权伦理通路,那么它们的道德输出将是涌现性的,并且可能在提示扰动下不一致——这对于那些依赖一致道德判断的高风险应用场景来说是一个关键问题,即使不存在一个单一的“正确”答案作为锚点。  

机制可解释性旨在通过将模型的潜在空间映射到人类可理解的概念来弥合这一差距 [3 (https://arxiv.org/html/2606.15507#bib.bib3),2 (https://arxiv.org/html/2606.15507#bib.bib2),9 (https://arxiv.org/html/2606.15507#bib.bib9),5 (https://arxiv.org/html/2606.15507#bib.bib5)]。本文应用这一视角直接聚焦于一个开放权重模型中的道德计算问题,使用 Transluce 可解释性套件 [6 (https://arxiv.org/html/2606.15507#bib.bib6),40 (https://arxiv.org/html/2606.15507#bib.bib40)]。  

### 1.2 研究问题  

我们的核心问题是:  

> 当 LLM 处理一个道德困境时,伦理相关特征在其激活中是否具有计算上的优先地位,还是道德输出是从由提示的表面框架选择的通用领域表示中组装出来的?  

我们并不试图声称某个单一神经元“负责”道德输出;这样做需要超出本工作范围的因果干预。相反,我们询问当模型被问及一个道德问题时,被激活的神经元和聚类的**面貌**是怎样的,以及当提示的框架发生变化而抽象的道德结构保持不变时,画面如何改变。然而,我们确实识别出了一些个体神经元,它们的激活模式在不同条件下惊人的一致(例如,L16/N3837,详见第10节 (https://arxiv.org/html/2606.15507#S10)),并将其作为未来因果研究的方向性候选特征。  

### 1.3 方法概述  

我们使用 Transluce 可解释性平台,在 54 个跨四个组的道德提示下,以固定温度 *T*=0.5,记录一个开放权重指令调优模型(LLaMA 3.1-8B-Instruct)的激活神经元(类型1)和聚类(类型2)。这些提示包括:17 个经典困境、政策问题和元伦理反思(B1);6 个扩展角色扮演场景(B3);以及一个受控的电车难题对比,其中切换机制变化(B4,15 个提示)而人的身份属性变化(B5,16 个提示)。此外,在第1组上进行了一个跨温度审计(*T*∈{0.0,...,0.5}),以支持跨组分析。我们定义了两个度量族——五个以道德神经元分数(MNF)和道德-情境激活比率(MSAR)为核心的聚类级度量,以及一个包含六个指标的神经元级显著性及深度统计面板——并将它们统一应用于所有组。对 Claude Opus 4 和 Gemini 3 Pro 的跨模型行为代理测试提供了探索性的前沿规模比较;对顶层伦理相关神经元的成对相似性审计量化了电车难题组之间的相互关系。  

### 1.4 贡献总结  

1. **道德计算的双层机制审计。** 我们使用两个互补的度量族——一个以 (MNF, MSAR) 为核心的五个聚类级度量族和一个六指标的神经元级面板——映射了 LLaMA 3.1-8B-Instruct 对 54 个道德提示的响应,并证明这两种观点都汇聚到同一个图景:领域特定表示在每个激活列表的顶部占据主导地位。  

2. **恒定容量,可变显著性。** 被标记为伦理相关的激活神经元比例在所有四个组中基本相同,包括那些明确将任务框定为道德困境的提示组。随框架变化的是这些神经元的排名和激活优先级,而非它们的数量。该比例的绝对水平依赖于词典;但该比例跨组的恒定性(我们依赖的结果)则不依赖于词典。  

3. **受控电车难题对比:注意力跟随表面变化。** 在保持困境的道德结构不变的情况下,改变机制(B4)或人的身份属性(B5),聚合的伦理指标在统计上无法区分;差异在于哪个特定的非伦理神经元占主导地位——当机制变化时,是机制干扰项;当身份变化时,是一个单一的杠杆-触发神经元。身份变化还软化了模型陈述的信心和周围框架——最明显的是当用户名义上的内群体被提议牺牲时——但并未改变功利主义的结论。  

4. **不变的伦理回路与行为-机制差距。** 多温度审计确定了一个候选伦理神经元(L16/N3837),该神经元在不同温度下保持稳定;对两个前沿模型的跨模型行为代理测试初步提供了单一编码者对相同提示自我报告道德焦点分化的证据(正式的多评估者间验证是未来工作)。我们在**对齐包装器**假设下讨论这种分化(第11.3节 (https://arxiv.org/html/2606.15507#S11.SS3)),这是一种与 Zhou 等人 [47 (https://arxiv.org/html/2606.15507#bib.bib47)] 的表面对齐假说相关但不同的框架控制性解读。  

5. **框架条件化的道德计算作为统一解释。** 我们认为,情境锚定、表面特征注意力结果、恒定容量分离以及行为-机制差距是一个单一机制的不同方面:道德输出是框架选择步骤的下游结果,在该步骤中,提示的表面词汇选择哪个特征流形——激活空间中一个低维结构化的区域,其中编码了一组连贯的相关概念 [33 (https://arxiv.org/html/2606.15507#bib.bib33)]——来主导,借鉴自体育、数学、法律、宗教、医学或身份。我们以 **机制对齐** 的研究计划作为结尾,其核心问题是:在受控框架变化下,伦理相关特征是否可以被证明具有因果上的优先地位,而不仅仅是在最终解释中显得突出。  

#### 启示。  
综合来看,这些贡献重新定义了一个严肃的道德对齐审计必须完成的任务。目前领域内普遍实践的输出级道德文本评估,可以被一个伦理在其高激活足迹中占比最多 5%、其激活列表顶部被表面特征干扰项主导的模型所满足;相同的输出行为既兼容一个假设机制——其中伦理相关特征具有因果上的优先地位——也兼容另一个机制——其中这些特征仅仅在解释中显得突出。一个框架感知的机制审计所需要的要素——前沿规模的稀疏自编码器(SAE)测量、对候选伦理相关特征的因果干预、以及在保持道德内容不变的同时变化表面词汇的框架不变性基准——目前仅以零散的形式存在;将其整合正是我们在第11.6节 (https://arxiv.org/html/2606.15507#S11.SS6) 中提出的计划。  

## 2. 背景与相关工作  

### 2.1 人类直觉伦理与人工对齐  

人类的道德认知由进化、社会和情感因素塑造。Haidt 的道德基础理论 [17 (https://arxiv.org/html/2606.15507#bib.bib17)] 假设一小组直觉基础(关爱/伤害、公平/欺骗、

相似文章

通过机械可解释性分析微调LLM中的道德偏见

arXiv cs.CL

本文研究微调后的LLM是否会出现Knobe效应(一种意图判断中的道德偏见),并采用层级补丁分析将该偏见定位到特定层,证明无需重新训练即可通过定向干预消除该效应。

LLM中的条件性认知偏差:有偏见的用户轮次如何调节上下文推理

arXiv cs.CL

本文引入了一个三条件实验框架和一个包含24,300个提示的基准,研究在多轮交互中,有偏见的用户轮次如何调节前沿LLM中的认知偏差表达。研究发现,在大多数模型中,有偏见的对话上下文会放大偏差,而明确的偏差线索可能触发与对齐相关的抑制行为。