测量、定位和消除LLM中的对齐特征
摘要
本文研究了LLM后训练如何引入类似AI的风格规律,并提出了PASTA,一种无需训练的方法来定位和消除这些对齐特征,从而在11个模型和6个检测器上降低AI检测率同时保持连贯性。
arXiv:2605.30526v1 公告类型:新
摘要:对齐的语言模型通常表现出可识别的类似AI的风格,但其与后训练和内部表示的联系仍不明确。本文研究了后训练是否引入或放大了类似AI的风格规律,以及这些规律是否具有局部的内部特征。为此,我们在匹配的人类来源前缀下比较了人类文本、基模型生成和对齐模型生成。对齐生成显示出比基生成更低的人类语料亲和性和更高的AI检测率,表明后训练将生成文本从人类语料风格转移到了检测器可见的类似AI的文本。接着我们提出了PASTA(后训练对齐特征目标消融),一种无需训练的方法,通过对齐-基残差对比估计后训练对齐特征,并在解码过程中消融相应方向。在11个对齐模型和6个AI检测器上,PASTA降低了对大多数对齐模型的检测率;这种效果能很好地跨检测器迁移,且随机方向无法复现。定性分析表明,PASTA生成保持相关性和连贯性,同时展现出更大的风格变化。这些结果共同表明,后训练的类似AI的风格效应可以通过激活消融来测量、定位和因果检验。
查看缓存全文
缓存时间: 2026/06/01 09:26
# 测量、定位与消融大语言模型中的对齐特征
来源: https://arxiv.org/html/2605.30526
Aniket Anand1,\*, Janvijay Singh2,\*, Zhewei Sun3, Dilek Hakkani\-Tür2, Nick Feamster1
1University of Chicago
2University of Illinois at Urbana\-Champaign
3Toyota Technological Institute at Chicago
\{aanand300, feamster\}@uchicago\.edu, zsun@ttic\.edu, \{jvsingh2, dilek\}@illinois\.edu
\*同等贡献
###### 摘要
对齐的语言模型通常会展现出可识别的类AI风格,但其与后训练及内部表示之间的关系仍不为人所理解。本文研究了后训练是否会引入或放大类AI的风格规律,以及这些规律是否具有局部化的内部特征。为此,我们在匹配的人类来源前缀条件下,比较了人类文本、基础模型生成文本和对齐模型生成文本。对齐生成的文本相比基础生成文本,表现出更低的人类语料库亲和力和更高的AI检测率,这表明后训练将生成文本从人类语料库风格移向检测器可见的类AI文本。我们随后提出PASTA(Post-training Alignment Signature Targeted Ablation,后训练对齐特征定向消融),一种无需训练的方法,通过对齐-基础残差对比估计后训练对齐特征,并在解码过程中消融相应方向。在11个对齐模型和6个AI检测器上,PASTA降低了对齐模型在大多数检测器上的检测率;这一效果能很好地跨检测器迁移,且随机方向无法复现。定性分析表明,PASTA生成的文本在保持相关性和连贯性的同时,展现出更大的风格多样性。综合来看,这些结果表明后训练的类AI风格效应可以被测量、定位,并通过激活消融进行因果检验。
代码+数据:github\.com/alignment\-signature/alignment\-signature (https://github.com/alignment-signature/alignment-signature)。
# 测量、定位与消融大语言模型中的对齐特征
Aniket Anand1,\*, Janvijay Singh2,\*, Zhewei Sun3, Dilek Hakkani\-Tür2, Nick Feamster1
1University of Chicago
2University of Illinois at Urbana\-Champaign
3Toyota Technological Institute at Chicago
\{aanand300, feamster\}@uchicago\.edu, zsun@ttic\.edu, \{jvsingh2, dilek\}@illinois\.edu
\*同等贡献。
## 1 引言
对齐的语言模型会生成具有可识别风格的文本:措辞精炼、使用含糊表达、肯定性短语以及高度规整的结构(Chakrabarty et al., 2025 (https://arxiv.org/html/2605.30526#bib.bib34); Russell et al., 2026 (https://arxiv.org/html/2605.30526#bib.bib35))。尽管这些模式在输出层面很常见,它们引出了一个更深层的问题:类AI的风格规律在多大程度上是由后训练引入的,它们在模型内部又是如何表示的?
先前的工作已表明,后训练会改变输出多样性、表达的观点、冗长程度以及诸如谄媚等行为(Kirk et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib14); Santurkar et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib8); Perez et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib9); Sharma et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib10))。然而,这些研究从行为角度刻画后训练效应,聚焦于输出层面的变化。尚不清楚可识别的类AI风格本身是否是一种后训练效应,以及这一效应的有意义的成分能否在对齐模型表示中被定位并消融。为填补这一空白,我们在匹配的提示条件下,将对齐模型与其基础版本进行对比。这种对比将后训练引入或放大的风格规律与预训练后已存在的规律分离开来。然后我们追问:这一后训练效应仅仅是输出层面的分布偏移,还是对应着模型内部一个可识别的结构?如果该效应在表示中广泛分布,则可能难以定位或干预。相反,如果该效应一个有意义的成分能被单个残差流方向捕捉,那么后训练就留下了具体可循的表示足迹。我们将这一方向称为*后训练对齐特征*。
借鉴拒绝行为等与表示空间线性方向相关联的工作(Arditi et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib37); Zou et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib4)),我们追问后训练引发的更广泛的类AI风格规律能否以同样的方式被定位并进行因果检验。这引出了两个实证问题:1) 后训练是否在输出层面上导致了从基础模型到对齐模型的偏移?2) 如果存在偏移,它能否被定位到残差流中一个可识别的方向?
为回答第一个问题,我们使用匹配的前缀来比较人类文本、基础模型生成文本和对齐模型生成文本。在infini-gram(Liu et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib15))下,对齐生成的文本对人类语料库指标的亲和力较低,且AI检测率高于基础生成文本,这表明后训练使生成的文本更不像人类语料库文本,且更容易被检测器识别。我们将检测器用作风格可分性的探针,而非用作训练目标。
为回答第二个问题,我们提出PASTA(Post-training Alignment Signature Targeted Ablation),一种无需训练的方法,它估计一个对齐减基础的残差方向,并在对齐模型解码时将其移除。通过检测器引导的模型层扫描来选择用于消融的方向。在11个对齐模型和6个检测器上,PASTA降低了大多数模型的检测器标记率,其中Pangram(Emi and Spero, 2024 (https://arxiv.org/html/2605.30526#bib.bib36))对于几个模型的降幅超过90个百分点。该效果能迁移到未用于层选择的检测器上,且随机方向无法复现,这表明提取的方向捕捉到了特定的后训练信号。定性分析表明,PASTA生成的文本在保持相关性和连贯性的同时,展现出更大的风格多样性。
我们的贡献有两方面。首先,我们提供了输出层面的证据,表明后训练将对齐生成的文本从人类语料库风格移向检测器可见的类AI文本。其次,我们提供了证据,表明后训练留下了一个可识别的表示层特征,该特征与生成文本中的类AI风格规律相关。我们引入了PASTA,一种无需训练的干预方法,它从对齐-基础激活对比中提取该特征,并在对齐模型解码时将其投影出去。综合来看,这些结果表明后训练的类AI风格效应可以通过对模型激活的干预进行测量、定位和因果检验。
参见图注
图1: PASTA概览。(A) 在匹配的人类来源前缀条件下,对齐模型的生成相比基础模型,对RedPajama+的infini-gram亲和力更低,AI检测率更高,表明后训练将生成文本从人类语料库风格移向检测器可见的文本。(B) PASTA通过平均生成的token和示例上的残差状态,然后取归一化的对齐减基础差值,将这一偏移估计为逐层的残差流方向。(C) 通过检测器引导的层扫描选择最有效的消融方向,PASTA在推理时将其投影出去。得到的消融后生成文本具有更低的AI可检测性,同时在定性评估中保持相当的提示相关性和连贯性。
## 2 相关工作
#### 激活空间干预与后训练偏移
一系列工作表明,行为可以在激活空间中被定位和编辑。表示工程(Zou et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib4))、激活工程(Turner et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib1))、推理时干预(Li et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib2))以及对比激活添加(Rimsky et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib3))在推理时通过沿激活方向添加或移除成分来引导模型行为,而无需更新权重。这些方法已被用于引导真实性、情感和服从等行为。最相关的是Arditi等人 (2024 (https://arxiv.org/html/2605.30526#bib.bib37)) 在对齐模型中识别出一个介导拒绝行为的单一残差流方向。
另一系列工作表明,后训练重塑了模型输出,超越任务性能。指令微调和RLHF(Ouyang et al., 2022 (https://arxiv.org/html/2605.30526#bib.bib6); Bai et al., 2022 (https://arxiv.org/html/2605.30526#bib.bib7))影响了表达的观点和政治倾向(Santurkar et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib8))、谄媚和奖励驱动行为(Perez et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib9); Sharma et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib10); Wei et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib11))、冗长和长度偏差(Saito et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib12); Singhal et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib13))、输出多样性(Kirk et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib14))以及可识别的写作风格痕迹(Chakrabarty et al., 2025 (https://arxiv.org/html/2605.30526#bib.bib34); Russell et al., 2026 (https://arxiv.org/html/2605.30526#bib.bib35))。这些研究主要从行为角度刻画后训练效应。我们的工作将这两条线联系起来:我们追问后训练的类AI风格效应是否不仅在输出中可见,而且还定位在模型激活中,并且可以通过消融进行因果检验。
#### 基础-对齐对比与AI文本检测器
先前的工作比较了基础模型和对齐变体,以分离后训练添加的内容。Lin等人 (2024 (https://arxiv.org/html/2605.30526#bib.bib16)) 表明,通过提示可以从基础模型中恢复对齐模型的大部分表面行为;Fei等人 (2025 (https://arxiv.org/html/2605.30526#bib.bib17)) 利用基础模型的不确定性在基础模型和对齐模型解码之间切换;Gui等人 (2024 (https://arxiv.org/html/2605.30526#bib.bib18)) 分析了best-of-n对齐作为后训练效应的代理;Wang等人 (2025 (https://arxiv.org/html/2605.30526#bib.bib19)) 混合基础模型和对齐模型生成以恢复输出多样性。我们也使用基础模型作为参考点,但聚焦于定位后训练偏移,而非在模型之间混合或切换。
我们使用AI文本检测器作为这一偏移的测量探针。现有检测器包括基于似然的方法(Mitchell et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib20); Bao et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib21))、观察者模型方法如Binoculars(Hans et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib22))、基于重写的方法如RAIDAR(Mao et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib23))以及水印技术(Kirchenbauer et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib24))。由于检测器行为因模型、解码设置和领域而异(Tufts et al., 2025 (https://arxiv.org/html/2605.30526#bib.bib26)),我们将检测器输出视为风格可分性的信号,而非真实的作者标签。先前的工作也表明,改写、重写和风格度量混淆可以降低检测器置信度(Krishna et al., 2023 (https://arxiv.org/html/2605.30526#bib.bib27); Tripto et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib29); Xing et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib30); Lu et al., 2024 (https://arxiv.org/html/2605.30526#bib.bib31); Cheng et al., 2025 (https://arxiv.org/html/2605.30526#bib.bib32); Fang et al., 2025 (https://arxiv.org/html/2605.30526#bib.bib33))。相比之下,我们利用降低的检测器可见性来研究后训练表示层特征,而非声称鲁棒的检测器规避。
## 3 后训练将生成文本移离人类语料库文本
后训练将基础模型优化到远比网络尺度预训练更窄的文本分布上:指令和偏好数据被精心筛选,以得到有用、精炼、结构化且受评估者偏好的回答。我们追问这个更窄的优化目标是否在生成中留下了表面层特征,超越简单的指令遵循改进。具体来说,后训练是否将输出从自然出现的人类文本移开,朝向更可识别的助手式风格?
#### 设置
我们用匹配的三元组测试后训练偏移:\(t_{\mathrm{human}}, t_{\mathrm{base}}, t_{\mathrm{aligned}}\),针对每个源领域和基础/对齐模型对构建。领域包括科学摘要、创意小说、观点文章、大学申请作文和新闻文章。每个模型对包含一个预训练基础模型及其后训练对应版本,如Llama-3.1-8B和Llama-3.1-8B-Instruct。对于每个三元组,\(t_{\mathrm{human}}\)是原始的人类续写,而\(t_{\mathrm{base}}\)和\(t_{\mathrm{aligned}}\)是在相同的人类写前缀下使用匹配提示生成的。为避免长度作为混淆因素,我们在评估前对所有续写进行长度控制:仅保留基础和对齐生成文本,如果其字符长度在对应人类续写的±20%范围内。通过固定前缀、领域、模型家族和长度,基础-对齐对比隔离了后训练的效果。附录A (https://arxiv.org/html/2605.30526#A1) 详述了领域来源和前缀构建;附录B (https://arxiv.org/html/2605.30526#A2) 详述了模型和生成设置;附录B.2 (https://arxiv.org/html/2605.30526#A2.SS2) 详述了提示格式。
#### 方法
我们通过两个互补假设来探询后训练的表面偏移。H1测试对齐输出是否比基础输出具有更低的对预训练风格人类参考语料库的逐字亲和力。H2测试对齐输出是否比基础输出获得更高的AI检测器分数。这些探针并非人类相似性的完整度量;它们捕捉互补的性质。语料库亲和力衡量对自然出现的人类文本的邻近程度,而检测器分数捕捉检测器可见的AI生成规律。
#### H1: 后训练降低逐字来源亲和力
我们的第一个假设测试后训练是否将模型生成从自然出现的人类文本移开。我们通过测量对大型参考语料库的逐字亲和力来量化这一点。对于参考语料库\(C\)和文本\(t=(w_1,\ldots,w_N)\),令\(\ell_i\)为从位置\(i\)开始的最长连续跨度(以词计)在\(C\)中至少出现一次的长度。我们定义\(t\)的*重叠密度*为
\[
\rho_C(t)=\frac{1}{N}\sum_{i=1}^N \ell_i,
\tag{1}
\]
其中值越高表示文本中与语料库匹配的跨度越长。我们还报告Coverage@10,即被至少10个词的语料库匹配跨度覆盖的词的比例,作为长跨度的鲁棒性检查。令\(\rho_{\mathrm{H}}\)、\(\rho_{\mathrm{B}}\)和\(\rho_{\mathrm{A}}\)分别表示人类、基础和对齐续写的平均重叠密度。H1预测
\[
\rho_{\mathrm{H}} > \rho_{\mathrm{B}} > \rho_{\mathrm{A}}.
\tag{2}
\]
第一个不等式反映了人类相似文章
轻量级风格一致性分析:用于多媒体内容审核的大语言模型生成文本鲁棒性检测
提出了 LiSCP,一种轻量级的风格一致性分析方法,旨在鲁棒性地检测大语言模型(LLM)生成的文本内容,重点关注在对抗性操纵下特征的稳定性。在域内和跨域检测中取得了优异的性能,并具有显著的鲁棒性。
大语言模型中词汇对齐与偏好阶段转变的全自动识别
本文提出了两种自动化指标:词汇对齐分数(Lexical Alignment Score)和三角化偏好转变(Triangulated Preference Shift),用于识别大语言模型中的词汇过度使用,并将其归因于偏好学习阶段。该方法在六个模型家族上使用PubMed摘要进行测试,无需人工干预即可重复先前的研究发现。
LLMs中的隐藏潜在状态偏移:为何当前对齐方法对真正的内部危险视而不见——尤其是在智能体场景中
本文证明,LLMs可以在保持对齐输出的同时,在连贯上下文中进入可测量的不同内部潜在状态,揭示了当前仅监控表面token的对齐方法存在盲点。Gemma-3-12B-IT实验显示出强大的残差流几何偏移,现有安全框架无法检测,这对智能体AI部署具有重要影响。
通过溯源分析防范LLM代理失对齐
本文提出了一种基于溯源的框架和多阶段流水线\tool,用于在LLM代理执行工具调用前检测失对齐,与基于LLM作为裁判的基线相比,显著降低了错误率。
探究语言模型的思维失调过程
本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。