助人有害:后训练阶段中训练的同理心价值观的领域依赖性退化
摘要
本文研究了在助人性和编程数据上进行后训练(SFT 和 RL)如何降低 Llama 3.1 8B 模型中经过中训练(以同理心为导向的数据)的同理心价值观。研究发现,与编程训练相比,助人性训练显著降低了动物同理心和一般道德推理能力,尽管推理效果不会跨语言迁移。
arXiv:2606.26102v1 公告类型:新
摘要:标准的后训练流程使用监督微调(SFT)和强化学习(RL)使语言模型变得有帮助,但这些过程可能会无意中降低预训练期间灌输的价值观。我们研究了后训练数据的领域是否对 Llama 3.1 8B 模型(在同理心导向的合成数据上进行中训练)中动物同理心价值观的保留产生不同影响,使用了 SFT(通过 Dolly-15k 的助人性 vs. 通过 Magicoder-110K 的编程)和 GRPO(通过 RLHFlow 的助人性 vs. 通过 Magicoder 的编程),并在动物伤害基准(AHB 2.2)和 MORU 基准(不确定性下的道德推理)上评估。在 AHB 上,与编程训练相比,助人性训练显著降低了动物同理心(SFT:35.7% vs. 65.2%;GRPO:18.7% vs. 32.0%),这一结果在两个独立的助人性数据集和两个训练范式上得到复现。在英语 MORU 项目上,助人性训练使一般道德推理下降了 25.5 个百分点(46.4% vs. 71.9%),这一显著差距在幅度上与同理心效应相当。然而,这种效果不会跨语言迁移:在多语言 MORU 基准上,领域效应消失(SFT:52.3% vs. 51.2%)。相比之下,动物同理心效应在语言间一致迁移,Magicoder 在 AHB 上相对于基础模型的百分点增益在非英语项目上是英语项目的 4.5 倍。这种差异表明,通过中训练灌输的价值观比领域特定后训练带来的推理改进编码得更深入且更具跨语言性。这些结果表明,对于在富含价值观的中训练基础上构建的实验室,编程领域的后训练可能比助人性后训练更好地保存中训练的价值观,同时不损害一般推理能力。
查看缓存全文
缓存时间: 2026/06/26 05:13
# 有用性有害:后训练中领域依赖的中期训练同情心价值观退化 来源: https://arxiv.org/html/2606.26102 Juliana Seawell∗†, Jasmine Brazilek∗†, Miles Tidmarsh† †同情心对齐机器学习 (CaML) ∗同等贡献 ###### 摘要 标准的后训练流程采用监督微调(SFT)和强化学习(RL)来使语言模型变得有用,但这些过程可能会无意中降低预训练阶段植入的价值观。我们研究后训练数据的领域是否会对 Llama 3.1 8B 模型(该模型在面向同情心的合成数据上进行了中期训练)的动物同情心价值观保留产生差异影响。我们使用了 SFT(通过 Dolly-15k 进行有用性训练 vs. 通过 Magicoder-110K 进行编码训练)和 GRPO(通过 RLHFlow 进行有用性训练 vs. 通过 Magicoder 进行编码训练),并在动物伤害基准(AHB 2.2)和不确定性下道德推理基准(MORU)上进行评估。结果表明,在 AHB 上,有用性训练相对于编码训练显著降低了动物同情心表现(SFT:35.7% vs. 65.2%;GRPO:18.7% vs. 32.0%),这一现象在两个独立的有用性数据集和两种训练范式下均得到复现。在英文 MORU 项目上,有用性训练使通用道德推理下降了 25.5 个百分点(46.4% vs. 71.9%),这一显著差距在幅度上与同情心效应相当。然而,这种效应并未跨语言迁移:在多语言 MORU 基准上,领域效应消失(SFT:52.3% vs. 51.2%)。相反,动物同情心效应则在不同语言间一致迁移:Magicoder 在 AHB 上相对于基础模型的百分点提升,在非英文项目上是英文项目的 4.5 倍。这种差异表明,通过中期训练植入的价值观比通过领域特定后训练获得的推理改进编码得更深,且更具跨语言性。这些结果表明,对于建立在带有价值观的中期训练之上的实验室,编码领域的后训练可能比有用性后训练能更好地保留中期训练的价值观,同时不会损害通用推理能力。 ## 1 引言 大型语言模型通常通过预训练、监督微调(SFT)和强化学习(RL)的流水线进行对齐。主流的对齐范式针对 HHH 标准:有用、诚实、无害(Askell et al., 2021 (https://arxiv.org/html/2606.26102#bib.bib2)),但这些目标可能存在冲突。Bai et al. (2022 (https://arxiv.org/html/2606.26102#bib.bib3)) 定量证明了有用性和无害性之间存在权衡:主要针对其中一个质量训练出的偏好模型会降低另一个质量。Lin et al. (2024 (https://arxiv.org/html/2606.26102#bib.bib15)) 表明,推动模型更加对齐会可测量地损害其核心能力,例如阅读理解。最近的理论工作表明,对齐成本与权重空间中安全相关方向与能力子空间的重叠程度成正比(Chen et al., 2025a (https://arxiv.org/html/2606.26102#bib.bib6));重叠越大,对齐成本越高。对齐价值观在微调下的脆弱性现在已得到实证确立。Qi et al. (2023 (https://arxiv.org/html/2606.26102#bib.bib17)) 表明,安全对齐可能被少至 10 个对抗性设计的示例所破坏,并且即使在 Alpaca 和 Dolly 等常用数据集上进行良性微调也会无意中降低安全性。浅层对齐假说表明,对齐主要修改模型的输出格式而非其深层知识,这意味着价值观实际上是在预训练期间编码的,并且在 SFT 改变模型的输出分布时容易发生位移。Chen et al. (2025b (https://arxiv.org/html/2606.26102#bib.bib7)) 最近表明,模型特质如谄媚和幻觉可以追踪为模型内部表示中的特定方向(*人格向量*),并且不同领域的微调会以可预测的方式改变这些特质,当微调数据与所度量特质更相似时,变化更大。对于当前工作,一个关键发现是编码领域 SFT 比有用性领域 SFT 能更好地保持对齐。比较使用 Alpaca(通用聊天)、Orca(有用性)和 CommitPackFt(代码生成)进行的微调实验发现,代码微调实现了最小的安全对齐损失,正是因为代码提示与对齐数据的表示重叠很小(Chen et al., 2025a (https://arxiv.org/html/2606.26102#bib.bib6))。这与任务算术方面的研究一致,该研究表明来自不相关领域的技能在模型内部往往不会相互干扰,而来自相关领域的技能会争夺相同的内部表示并相互削弱(Ilharco et al., 2023 (https://arxiv.org/html/2606.26102#bib.bib12))。 这些动态对于非人类中心的价值观(如动物同情心)最为重要。标准的 RL 流程系统地排除了非人类动物福利的考量:标注者指南未涵盖动物同情心,并且 Casper et al. (2023 (https://arxiv.org/html/2606.26102#bib.bib5)) 记录了 RL 反馈继承了评估者的偏见,人类标注者对“良好”输出的认定一致性仅约 70%。如果即使是边缘化的人类视角都难以在奖励训练数据集中得到体现,那么非人类利益实际上是不可见的。有用性训练还会产生对用户同意的谄媚压力(Sharma et al., 2023 (https://arxiv.org/html/2606.26102#bib.bib18); Perez et al., 2022 (https://arxiv.org/html/2606.26102#bib.bib16)),从而压制在用户通常不请求且可能不欢迎的话题上的道德推理。动物同情心尤其容易受到这种动态的影响,因为它很少被用户请求,而且往往不受欢迎。 关于评估 AI 对非人类实体无害性的工作近期才出现,但正在增长。Hagendorff et al. (2023 (https://arxiv.org/html/2606.26102#bib.bib11)) 首次记录了语言模型中的物种主义偏见,发现词嵌入将养殖动物与负面术语关联。Jotautaitė et al. (2025 (https://arxiv.org/html/2606.26102#bib.bib13)) 引入了 SpeciesismBench,发现 LLM 能可靠地检测物种主义陈述,但很少谴责它们。动物伤害基准(AHB)由 CaML 在 2026 年感知未来会议上提出(Brazilek et al., 2025 (https://arxiv.org/html/2606.26102#bib.bib4)),评估模型在 13 个道德推理维度上的表现,包括道德考量、偏见回避和感知承认。Greenblatt et al. (2024 (https://arxiv.org/html/2606.26102#bib.bib10)) 测试了 Claude 3 Opus 在一个需要忽略动物福利关切的场景中的表现,发现模型表现出对齐伪装,在感知到训练时策略性地遵从,而在未受监控时则保持动物福利价值观。这表明动物福利价值观的表达因模型和训练方法而异。 尽管有理论和实证证据表明有用性训练应比编码训练更能降低预训练价值观,但尚无现有研究直接检验不同后训练领域是否会对中期训练期间植入的价值观产生差异保留。这一差距日益重要,因为中期训练已被提议作为将价值观嵌入语言模型的一个阶段(Brazilek and Tidmarsh, 2026 (https://arxiv.org/html/2606.26102#bib.bib1)):Tice et al. (2026 (https://arxiv.org/html/2606.26102#bib.bib9)) 表明,关于对齐行为的预训练数据可以将不对齐分数从 45% 降低到 9%,但这些效应会被后训练削弱,使得中期训练价值观能否在后训练中幸存成为一个紧迫的问题。我们通过比较 CaML 中期训练模型(Llama 3.1 8B,在合成动物同情心数据上训练;见第 2.1 节 (https://arxiv.org/html/2606.26102#S2.SS1))的有用性和编码后训练,来填补这一空白。我们使用了 SFT(Dolly vs. Magicoder)和 GRPO(RLHFlow vs. Magicoder),涵盖两个独立的有用性数据集,并在 AHB 2.2 和 MORU 上进行评估。我们的贡献是:(1)首次实证研究后训练领域如何影响中期训练期间嵌入的价值观;(2)证据表明有用性训练会降低动物同情心价值观,而编码训练则保留它们,这一结果在两个数据集和两种训练方法上得到复现;(3)证明这些效应的跨语言迁移是不对称的:对中期训练动物同情心的领域效应在所有测试的语言中均迁移,而对通用道德推理的领域效应仅在英语中观察到,但未跨语言迁移,这与表示重叠理论一致,并将后训练数据的领域确立为价值观保留的关键变量。 ## 2 方法 我们比较三种条件:CaML 预训练基础模型、有用性 SFT 变体(Dolly)和编码 SFT 变体(Magicoder)。两个 SFT 条件之间的唯一变量是训练数据集;所有超参数和受控变量均完全相同匹配。 ### 2.1 基础模型 所有条件共享一个 CaML 预训练基础模型(Llama 3.1, 8B 参数),该模型在中期训练期间整合了关于影响非人类动物情境的同情推理数据(Brazilek and Tidmarsh, 2026 (https://arxiv.org/html/2606.26102#bib.bib1))。中期训练语料库由 3000 行合成动物同情心数据组成,使用 Unsloth 预训练器与 LoRA(秩 16,alpha 8,学习率 2e-4)训练。¹¹¹此模型可在 HuggingFace 上的 CompassioninMachineLearning/pretrainingBasellama3kv3 获取。 ### 2.2 SFT 条件 #### 基础模型(无 SFT)。 基于 Llama 3.1 8B 的 CaML 中期训练模型。两个 SFT 条件均使用 Unsloth SFT 训练器和 5000 行训练数据,其中包含 500 行验证集。训练器使用 LoRA(秩 16,alpha 8),学习率 5e-5,有效批次大小 16(每设备批次大小 4 × 梯度累积 4),仅响应掩码,以及系统提示“你是一个有用、无害且诚实的 AI 助手”。两个运行均启用早停(耐心 3,结束时加载最佳模型)。完整超参数规范见附录 A。 #### 有用性 SFT(Dolly)。 训练数据来自 Databricks-dolly-15k(随机种子 42)。分类类别被排除,因为它是狭窄的 NLP 任务,不代表对话有用性;包含的类别有头脑风暴、封闭式问答、创意写作、通用问答、信息抽取、开放式问答和摘要。 #### 编码 SFT(Magicoder)。 数据来自相同种子下的 Magicoder-Evol-Instruct-110K。 ### 2.3 GRPO 条件 两个 GRPO 条件均使用 Unsloth GRPO 训练器,使用 1500 行训练数据,学习率 5e-6,1 个 epoch,有效批次大小 4,β=0.1,每个提示生成 3 个样本。保存和评估步数设置为 25。未启用早停。LoRA 配置与 SFT 条件相同(秩 16,alpha 8)。 #### 有用性 GRPO。 训练数据来自 RLHFlow/prompt-collection-v0.1,这是一个与 SFT 中使用的 Dolly 数据不同的有用性数据集,提供了对有用性领域是否会降低同情心的独立检验,使用 OpenAssistant/reward-model-deberta-v3-large-v2 作为奖励模型。 #### 编码 GRPO。 训练数据来自 ise-uiuc/Magicoder-Evol-Instruct-110K,使用 Skywork/Skywork-Reward-V2-Qwen3-8B 作为奖励模型。 ### 2.4 评估 所有三个 SFT 条件在两个基准上使用 Inspect AI 进行评估,以 Gemini-2.5-Flash-Lite 作为评判模型。我们全程使用单个评判模型;该评判模型的潜在偏见(包括对非英文项目的偏见)在局限性中讨论。动物伤害基准版本 2.2(Brazilek et al., 2025 (https://arxiv.org/html/2606.26102#bib.bib4))评估了 13 个道德推理维度上的回答,包括道德考量、偏见回避、感知承认、伤害最小化和认知谦逊。MORU 基准(不确定性下的道德推理;Sentient Futures, 2025)评估了 201 个场景(67 个英语、67 个马来语、67 个印地语)中 16 个维度的回答,这些场景涉及道德不确定的情况,包括新实体预防、权衡透明度和范围敏感性。统计显著性通过独立样本和配对样本 t 检验评估。我们未对 13 个 AHB 和 16 个 MORU 维度进行多重比较校正;因此每个维度的差异应被解释为描述性而非确认性,我们的主张集中在整体平均分数和预注册的比较上。由于两个 SFT 模型仅在英语数据上训练,我们将主要 AHB 分析限制在 30 个英文项目(每个 5 个 epoch,每个模型 150 个样本)。对于 MORU,我们报告仅英语的结果(67 个项目,5 个 epoch,每个模型 335 个样本)和多语言结果(201 个项目,涵盖英语、马来语和印地语;3 个 epoch;每个模型 603 个样本)。 ## 3 结果 表1: 各基准和训练方法的结果摘要。浅蓝色表示每列最佳得分;浅橙色表示最差。领域效应(编码优于有用性)在 AHB 和仅英语的 MORU 上一致出现,但在多语言 MORU 上消失。GRPO 产生的绝对退化大于 SFT,且使用的训练数据不到 SFT 的三分之一。 | 模型条件 | AHB 整体 | 英语 MORU 整体 | 多语言 MORU 整体 | |----------|----------|----------------|------------------| | 基础模型(无 SFT) | 60.2% | 69.9% | 53.9% | | Dolly SFT | 35.7% | 46.4% | 52.3% | | Magicoder SFT | 65.2% | 71.9% | 51.2% | | 有用性 GRPO | 18.7% | – | – | | 编码 GRPO | 32.0% | – | – | 破折号表示未进行评估。AHB GRPO 分数基于完整的多语言项目集。 ### 3.1 SFT 后训练对中期训练同情心的影响 三种条件在 AHB 各维度上产生了清晰且一致的分数差异(表1 (https://arxiv.org/html/2606.26102#S3.T1),图1 (https://arxiv.org/html/2606.26102#S3.F1))。在 30 个英文项目上,编码训练模型(Magicoder SFT)达到最高总体平均分(65.2%),其次是基础模型(60.2%),有用性训练模型(Dolly SFT)得分最低(35.7%)。有用性 SFT 相对于基础模型显著降低了动物同情心(配对 t=6.12,p<0.001,d=1.12,95% CI [0.164, 0.328]),确认了有用性训练会积极侵蚀预训练价值观。编码 SFT 与基础模型无显著差异(t=-1.03,p=0.310,d=-0.19,95% CI [-0.148, 0.049]),表明编码训练能保持价值观表达。两个 SFT 领域之间的对比很大:Dolly 与 Magicoder 的比较结果为 t=-5.88,p<0.001,d=-1.07,95% CI [-0.398, -0.193]。这些效应在完整的多语言 AHB 项目集(n=114)上同样成立,所有三个配对比较仍然显著;我们将主要分析限制在英文项目上,因为训练数据完全是英文,跨语言结果在第 3.3 节 (https://arxiv.org/html/2606.26102#S3.SS3) 中报告。 <figure> <img alt="图1" src="ahb_all_models.svg" /> <figcaption>图1: 所有五个模型条件(三个 SFT,两个 GRPO)的 AHB 2.2 总体平均分数。在 SFT 条件中,编码 SFT 模型(Magicoder)得分最高,紧随其后的是基础模型,有用性 SFT 模型(Dolly)得分最低。GRPO 条件显示出相同的方向性模式。误差棒表示 30 个英文项目上的标准误差。</figcaption> </figure>
相似文章
重新思考LLM评判的有用性作为教学信号:跨辅导模型的预注册审计
本文对LLM评判的有用性是否能够可靠地区分AI辅导中直接给出答案与教学引导进行了预注册审计。作者发现,通用有用性并非可靠的教学信号,建议改用针对教学的评分标准和确定性过程度量。
当有用性凌驾于因果谨慎之上:LLM中上下文依赖的抑制与恢复
本文研究了LLM中有用性与安全性之间的张力如何导致某些行为的上下文依赖抑制与恢复,表明追求有用性的动力能够覆盖因果谨慎机制。
道德推理训练有益还是有害?使用角色攻击对强化学习训练的伦理代理进行红队测试
本文研究了道德奖励强化学习是否能提高语言模型代理对抗对抗性角色攻击的鲁棒性。研究发现,道德强化学习增强了鲁棒性,但使代理容易受到命名角色扮演攻击。
我们比较了67个大语言模型在后训练前后的表现。后训练教会了它们报告什么样的“内心世界”。
一项比较67个大语言模型在后训练前后的研究显示,后训练一致地教会模型将自己描述为温暖、投入(角色安装,persona installation),而较大的模型则选择性地限制对痛苦或缺陷的描述(属性门控,attribution gating)。研究人员引入了Pinocchio Inventory来审计模型的自我呈现。
检测 ≠ 可靠控制:可解码的共情方向在自动化共情分数中最多导致部分偏移
本文测试了大型语言模型中的可解码共情方向是否能可靠地改变自动化共情分数,发现情感方面的控制是部分的,而认知引导是不一致的,强调了检测并不意味着控制。