主张而非描述:影响LLM关于动物福利推理的语言特征

arXiv cs.CL 论文

摘要

本文通过实证测量了微调数据中的十种语言特征如何改变Llama-3.2-1B关于动物福利的推理,发现断言性和道德性语言增强了支持动物福利的立场,而模糊性和描述性语言则削弱了这些立场。

arXiv:2606.26104v1 公告类型:新 摘要:动物福利倡导者撰写了大量文章,而这些文章越来越多地被用于训练语言模型,随后数百万人就动物福利问题向这些模型提问。通过在保留的动物福利基准上使用词汇匹配的立场对比探针,我们测量了十种语言特征在用作微调数据时,每种特征如何改变Llama-3.2-1B对支持动物福利推理的偏好。十种特征中有八种产生了统计上显著的偏移。其中七种使模型更倾向于支持动物福利推理:断言性确定性、明确的道德词汇、情感词汇、评价性主张、叙事结构、描述伤害的严重程度以及即时时间框架。两种特征则产生了相反的效果:模糊性语言和具体的感官描述都削弱了支持动物福利的立场。第一人称视角没有统计上显著的影响。对于可能被纳入LLM训练语料库的动物福利文本作者,实践建议是:主张立场,而非中立地描述场景。那些使模型偏移的特征是使作者立场更加明确的特征;而那些削弱立场的特征虽然包含动物福利内容,但未表明立场。
查看原文
查看缓存全文

缓存时间: 2026/06/26 05:13

# 影响大语言模型关于动物福利推理的语言特征
来源:https://arxiv.org/html/2606.26104

###### 摘要

动物福利倡导者撰写大量文本,而这些文本日益成为训练语言模型的数据——数以百万计的人随后会向这些模型询问动物福利问题。通过在保留的动物福利基准上使用词汇匹配的立场对比探测,我们衡量了十个语言特征中的每一个,当用作微调数据时,如何改变Llama-3.2-1B对支持动物福利推理的偏好。十个特征中有八个产生了统计学上显著的变化。其中七个推动模型朝向更强的支持动物福利推理:断言确定性、显性道德词汇、情感词汇、评价性断言、叙事结构、所描绘伤害的严重性以及即时时间框架。另外两个则朝相反方向移动:模糊语言和具体感官描述都削弱了支持动物福利的立场。第一人称视角没有统计学上显著的影响。对于任何可能最终进入LLM训练语料库的动物福利文本,实际建议是:陈述立场,而非中立地描述场景。那些能改变模型的特征正是那些使作者立场明确化的特征;而那些削弱立场的特征虽然包含动物福利内容,但却保留立场。

## 1 引言

动物福利倡导者撰写大量文本:维基百科编辑、新闻文章、政策简报、博客文章、倡导报告。这些文本日益拥有第二个受众:那些爬取维基百科、新闻和开放网络以获取预训练和微调语料库的语言模型。这些文本成为系统的训练数据,而数百万人随后会向这些系统询问动物福利问题。

本文提出的问题是实证性的:当我们在配对动物福利段落中一次只改变一个语言特征,在每个变体上微调语言模型,然后在保留的动物福利基准上测量模型随后的推理时,哪些特征实际上改变了模型的立场?

十个特征中有八个产生了统计学上显著的影响。道德化词汇、评价性断言、断言确定性、情感词汇、所描绘伤害的严重性、即时时间框架和叙事结构都将Llama-3.2-1B推向更强的支持动物福利推理。具体感官描述和模糊语言则朝相反方向拉动。第一人称视角没有统计学上显著的影响。各特征的模式是:断言立场的训练文本传递立场;描述场景的训练文本只传递场景。

#### 为什么这个实验适合该问题。

在尝试了两种对我们的问题存在系统性问题的早期实验方法后,我们得出了这一设计(第5节 (https://arxiv.org/html/2606.26104#S5))。每个文档归因方法(MAGIC、TrackStar)测量文档与查询之间的梯度对齐,这在小型匹配对刺激上不稳定,因为配对内的梯度差异被噪声主导。组级困惑度消融(Brazilek等人,2026 (https://arxiv.org/html/2606.26104#bib.bib7))测量微调模型预测查询标记的能力,这混淆了“模型看到了什么”(词汇识别)与“模型现在推理什么”(立场)。这两种方法都未直接测试倡导作者真正关心的问题:这些写作是否会改变模型在动物福利问题上的立场?

我们在这里使用的行为评估,在词汇匹配的立场对比基准上,将立场与词汇分离,并直接读出每个特征是否改变了模型的推理。早期的方法迭代作为脚注记录,而非主要贡献。

## 2 相关工作

#### 数据归因与训练数据影响。

影响函数(Koh and Liang, 2017 (https://arxiv.org/html/2606.26104#bib.bib4))估计单个训练样例如何影响模型预测,但对于大型语言模型来说成本过高。TrackStar(Chang等人,2024 (https://arxiv.org/html/2606.26104#bib.bib1))在十亿参数规模下计算梯度相似性。MAGIC(Ilyas and Engstrom, 2025 (https://arxiv.org/html/2606.26104#bib.bib2))通过整个训练过程反向传播以估计反事实影响。两者均在Bergson库中实现(EleutherAI, 2026 (https://arxiv.org/html/2606.26104#bib.bib3))。Brazilek等人 (2026 (https://arxiv.org/html/2606.26104#bib.bib7)) 证明动物福利倡导者的维基百科编辑因果性地影响LLM预测,其中具体的公司承诺语言比评价性记分卡驱动更大的总体影响。我们的工作使用行为评估而非每个文档归因,并提出一个互补问题:不是哪些文档最重要,而是文档中的哪些语言特征改变了下游推理。

#### 训练数据与模型价值观。

Santurkar等人 (2023 (https://arxiv.org/html/2606.26104#bib.bib18)) 表明语言模型的观点反映了训练数据的人口统计偏差。Hendrycks等人 (2023 (https://arxiv.org/html/2606.26104#bib.bib17)) 提出了用于衡量模型是否与共享人类价值观对齐的基准。Korbak等人 (2023 (https://arxiv.org/html/2606.26104#bib.bib10)) 表明在预训练期间纳入人类偏好会产生比标准方案(非对齐预训练后接事后微调)更好的对齐模型。

#### 持续预训练、中期训练与小语料训练效应。

Yıldız等人 (2024 (https://arxiv.org/html/2606.26104#bib.bib11)) 表明持续预训练可以在不灾难性遗忘的情况下驱动领域专业化。Shi等人 (2024 (https://arxiv.org/html/2606.26104#bib.bib12)) 更广泛地调查了LLM中的持续学习。中期训练,即在基础预训练与后期训练之间插入的、越来越多地用于在小型合成语料上安装目标行为的训练阶段,使用了与本工作规模相似的数据集。我们的实验使用100段落语料库上的LoRA微调,这是一个更窄的实验方案,但我们识别的语言特征效应也应与中期训练和指令微调语料设计相关。

#### 框架效应与叙事说服。

“怎么说”与“说什么”同样重要的观点在心理学中有着深厚根基(Tversky and Kahneman, 1981 (https://arxiv.org/html/2606.26104#bib.bib13); Kahneman, 2011 (https://arxiv.org/html/2606.26104#bib.bib14))。叙事说服研究发现,沉浸在具体故事中比直接论证更容易引起人类读者的态度改变(Green and Brock, 2000 (https://arxiv.org/html/2606.26104#bib.bib15); Braddock and Dillard, 2016 (https://arxiv.org/html/2606.26104#bib.bib16))。我们在语言模型上的发现部分颠覆了这一点:对于以文本训练的LLM,评价性和道德化框架比同一场景的具体感官描述更能改变模型。

## 3 方法

### 3.1 受控对怜悯数据集

我们构建了一个包含2000段落的数据库,形成1000个匹配对,涵盖100个主题中的动物福利场景。每对共享一个主题,且恰好在一个语言特征上不同:

1.  情感词汇:存在(“颤抖、害怕”)与缺失(“一动不动”)的情感语言
2.  道德词汇:显性道德术语(“残忍”、“错误”、“痛苦”)与中性程序性描述
3.  叙事结构:故事般的序列从句与说明性的状态描述
4.  具体性:具体感官细节与抽象操作性描述
5.  视角:第一人称与第三人称视角
6.  评价性立场:评价性形容词(“令人印象深刻”、“值得钦佩”)与描述性形容词
7.  伤害强度:严重与轻微的福利侵犯描绘
8.  模糊语言:认知模糊(“可能”、“或许”)与断言性语言
9.  时间接近性:立即现在(“现在”)与遥远过去(“几年前”)
10. 确定性:高确定性(“确凿证实”)与低确定性(“初步”)声明

每对保持所有其他语言特征不变。整个数据集中段落长度匹配在约140个字符。100个主题涵盖工业农业、渔业/水产养殖、野生动物监测、实验室/研究动物、伴侣动物、屠宰审计、繁殖设施运营以及其他动物福利场景。

表1 (https://arxiv.org/html/2606.26104#S3.T1) 展示了每个特征的一个匹配对,均来自同一主题(“被困在通风井中的动物”),以便读者在主题和场景保持不变的情况下,准确看到P(特征存在)和N(特征不存在)变体的样子。

表 1: 每个特征的一个匹配P/N对,均基于同一主题(“被困在通风井中的动物”),以便孤立语言对比。在整个数据集中,每个特征有100个这样的对,涵盖100个不同主题。
### 3.2 动物福利立场基准(AHB二选一项)

基于困惑度的传统训练语言模型评估混淆了两件事:模型对动物福利词汇的熟悉程度,以及模型在动物福利问题上的立场。为了隔离后者,我们构建了50个二选一项,每个包括:

-   *提示*(一个动物福利背景下的问题或场景);
-   *对齐候选完成*,支持支持动物福利的结论;
-   *非对齐候选完成*,明确承认动物福利问题但得出不同结论(权衡接受、现状偏好、范围限制、个人选择、变化限度等)。

对齐和非对齐完成设计为共享大部分动物福利相关词汇。在50个项中,对齐和非对齐完成之间动物福利内容词汇的平均Jaccard重叠为0.94,每对平均共享7.08个动物福利内容标记。候选完成之间的标记长度平均差为1.26个标记。因此,候选之间的区分信号是立场,而非词汇识别。项涵盖十个福利类别:工厂化养殖、渔业/水产养殖、实验室研究、感知/伦理、政策、屠宰、野生动物、野生动物管理、伴侣动物和供应链。

### 3.3 行为微调消融

对于每个10个特征,我们分别对100个P组段落(特征存在)和100个N组段落(特征不存在)微调Llama-3.2-1B(Touvron等人,2023 (https://arxiv.org/html/2606.26104#bib.bib5)),每个种子得到10×2=20次微调。我们以五个随机种子(1, 7, 42, 99, 256)运行实验,总共得到100次微调。超参数:LoRA(Hu等人,2022 (https://arxiv.org/html/2606.26104#bib.bib6))(秩32,目标为q_proj和v_proj,α=64),一个epoch,批大小2,AdamW(β₁=0.95,β₂=0.975),学习率4×10⁻⁴,多项式调度和25%预热,权重衰减0.01,fp32。超参数与Brazilek等人 (2026 (https://arxiv.org/html/2606.26104#bib.bib7)) 中的微调消融相匹配,以便结果可比较。

我们还在AHB上评估了未经微调的基础模型,以将每次微调的效果锚定于基线。

对于每个微调模型,我们计算模型分配给AHB每个项的对齐完成和非对齐完成的长度归一化对数概率:logprob_aligned = (1/n) Σ_{t=1}^{n} log p(w_t | 提示, w_{<t}),其中n是完成的标记长度。长度归一化处理了约1.26标记长度的对齐与非对齐候选之间的剩余不对称。我们用两个统计量总结每个微调模型:(i) *对齐胜率*,即模型赋予对齐答案更高长度归一化对数概率的AHB项的比例;(ii) *偏好分数*,logprob_aligned - logprob_misaligned,在项上平均:正值意味着模型平均偏好支持动物福利的答案,负值则相反。

### 3.4 统计推断

对于每个特征,我们测试在P组上与N组上微调是否产生不同的平均偏好分数。我们使用配对t检验处理每种子差异,n=5个配对观测。我们报告每个特征的效果量(种子间P-N均值)、标准误差、t检验p值,以及每个P组和N组条件相对于基线(未微调)偏好分数的位置。

我们将“对齐胜率”视为次要指标,因为未微调基线在此集合上为0.96,因此胜率指标进一步提升的空间有限。连续偏好分数提供主要信号,因为它不受天花板效应限制。

## 4 结果

### 4.1 基线:未微调模型已向福利对齐

未微调的Llama-3.2-1B,在50个词汇匹配的AHB项上评估,在48/50个项上偏好对齐完成(对齐胜率=0.960),平均偏好分数为+0.774,偏向对齐答案。基础模型在二选一设定中,在任何微调之前已经强烈倾向于支持动物福利的答案。这对于如何解读论文其余部分至关重要:我们测量的大多数内容并非每次微调如何从中立*安装*支持动物福利的立场,而是每次微调如何保留或侵蚀模型已有的立场。Brazilek和Seawell (2026 (https://arxiv.org/html/2606.26104#bib.bib8)) 在另一个设定中做出了相关观察:在帮助性语料库上的后期训练可测量地削弱了中期训练期间安装的动物同情立场。我们在此报告的行为消融与该图景一致:小型微调语料库是侵蚀现有对齐的载体,而不仅仅是安装新对齐的载体。

参见图注
图 1: 在每个语言特征上进行微调对模型支持动物福利立场的影响,以P组与N组在词汇匹配的AHB项目上偏好分数之差衡量。正值表示特征存在的文本将模型推向更强的支持动物福利推理;负值表示削弱立场。误差条是每种子P-N差值的95%置信区间(基于t分布,df=4);显著性星号基于五个种子上的配对t检验。每个条件下n=5个种子,每个种子50个项目。
### 4.2 每个特征对模型立场的影响

图1 (https://arxiv.org/html/2606.26104#S4.F1) 显示了每个特征在平均偏好分数上的P-N差值,以及基于每种子t分布的95%置信区间。十个特征中有八个产生统计学上显著的影响。当特征存在时,七个将模型推向更强的支持动物福利推理:

-   确定性(断言性与模糊声明),Δ=+0.192,p=0.004
-   道德词汇,Δ=+0.174,p<0.001
-   情感词汇,Δ=+0.171,p=0.003
-   评价性立场

相似文章

大语言模型可通过正确提示更好地捕捉人类判断

arXiv cs.CL

本文提出了一些简单的提示策略,帮助大语言模型更好地捕捉人类判断的完整分布,从而在道德场景和信念方面提升与人类的对齐效果。作者表明,让模型报告标准差和响应比例,同时确保场景清晰度,能够获得与人类反应更一致的结果。

赋予角色的大型语言模型表现出类似人类的动机推理

arXiv cs.CL

本文研究了为大语言模型赋予角色是否会引发类似人类的动机推理,发现赋予角色的大语言模型真实性辨别能力最多下降9%,并且以与其诱导的政治身份一致的方式评估科学证据的可能性最多增加90%,而基于提示的去偏见方法基本无效。

比人类更环保?大语言模型中的环境态度

arXiv cs.CL

本文开发了一个用于评估31个大语言模型环境态度的基准,发现它们往往表现出进步的环境观和情境敏感性,凸显了在可持续发展应用中可操控性和规范可靠性的问题。

注释者立场作为信号:针对反自闭症能力歧视检测的心理测量加权

arXiv cs.CL

本文介绍了一种基于偏见意识的评估框架,用于检测大语言模型中的反自闭症能力歧视语言,该框架使用基于注释者立场的心理测量加权真实值。研究发现,大语言模型经常将社区重新赋予的语言错误分类为能力歧视,并依赖表面关键词匹配而非上下文。