转向几何:验证LLM转向空间中的人类价值几何结构

Hugging Face Daily Papers 论文

摘要

本文介绍了一个基准测试,以验证LLMs中激活转向的分布驱动方法能够恢复与Schwartz理论一致的人类价值拓扑结构,这些方法随模型规模提升而改善,但在指令调优后有所下降。

随着大语言模型(LLMs)在对齐敏感场景中的应用日益增多,激活转向已成为一种轻量级、推理时的行为控制方法,作为微调方法(如RLHF、DPO)的替代方案。然而,现有工作通常仅在孤立行为上验证转向,因此不清楚转向向量是编码了连贯的语义结构,还是仅仅利用了行为特定的捷径。我们研究了LLM转向向量的潜在几何结构是否反映了人类价值观和道德中理论指定的结构。我们使用Schwartz的基本人类价值理论作为主要细粒度框架,引入了一个包含26K样本的基准测试,覆盖20种人类价值,并分析了分布驱动方法(如CAA、SphericalSteer、ODESteer)和行为中心方法(如COLD-Steer、BiPO)在不同模型家族和规模上的表现。我们发现分布驱动方法恢复了与理论预测一致的人类价值拓扑结构(Spearman ρ高达0.51,p < 10^{-13})。相比之下,行为中心方法实现了可比的转向性能,但与预期价值几何结构的相关性很小。几何保真度随模型规模提升而改善,但在指令调优后下降。最后,更好的几何对齐也导致了跨价值的更符合人类的一致性转移:正确转向一个价值会提升兼容价值并抑制对立价值。代码和数据可在以下网址获取:https://github.com/DeepRCL/Steering_Geometry。
查看原文
查看缓存全文

缓存时间: 2026/09/09 04:28

论文页面 - 转向几何:验证LLM转向空间中的人类价值几何

来源:https://huggingface.co/papers/2609.06289

摘要

通过分布驱动方法获得的激活转向向量在大型语言模型中编码了与理论对齐的人类价值几何,其几何保真度随模型规模增加而提高,但在指令微调后有所下降。

随着大型语言模型 (LLMs) 在对齐敏感场景中的应用日益增多,激活转向(https://huggingface.co/papers?q=activation%20steering)已成为微调方法(例如 RLHF、DPO)在行为控制方面的一种轻量级、推理时替代方案。然而,现有工作通常仅在孤立行为上验证转向效果,这使得转向向量(https://huggingface.co/papers?q=steering%20vectors)是编码了连贯的语义结构,还是仅仅利用了行为特定捷径,尚不明确。我们研究了LLM转向向量(https://huggingface.co/papers?q=steering%20voters)的潜在几何(https://huggingface.co/papers?q=latent%20geometry)是否反映了人类价值观与道德中理论指定的结构。我们使用施瓦茨基本人类价值观理论(https://huggingface.co/papers?q=Schwartz%27s%20Theory%20of%20Basic%20Human%20Values)作为主要的细粒度框架,引入了一个涵盖20种人类价值观的26K样本基准,并分析了分布驱动方法(https://huggingface.co/papers?q=distribution-driven%20methods)(例如 CAA(https://huggingface.co/papers?q=CAA)、SphericalSteer(https://huggingface.co/papers?q=SphericalSteer)、ODESteer(https://huggingface.co/papers?q=ODESteer))和行为中心方法(例如 COLD-Steer(https://huggingface.co/papers?q=COLD-Steer)、BiPO(https://huggingface.co/papers?q=BiPO))在不同模型家族和规模上的表现。我们发现,分布驱动方法(https://huggingface.co/papers?q=distribution-driven%20methods)恢复了与理论预测对齐的人类价值拓扑结构(Spearman ρ 最高达 0.51,p < 10^{-13})。相比之下,行为中心方法实现了相当的转向性能,但与预期的价值几何结构关联甚少。几何保真度随模型规模提升而改善,但在指令微调(https://huggingface.co/papers?q=instruction%20tuning)后下降。最后,更好的几何对齐也能带来更符合人类认知的跨价值迁移:正确转向一个价值能够提升兼容的价值观并抑制对立的价值观。代码和数据可在以下地址获取:https://github.com/DeepRCL/Steering_Geometry。

查看 arXiv 页面 (https://arxiv.org/abs/2609.06289) 查看 PDF (https://arxiv.org/pdf/2609.06289) 项目页面 (https://github.com/DeepRCL/Steering_Geometry) GitHub1 (https://github.com/DeepRCL/Steering_Geometry) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06289)

将此论文添加至您的智能体:

hf papers read 2609.06289

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2609.06289 以从本页面链接。

引用此论文的数据集1

DeepRCL/SteeringGeometry 查看器 • 更新于 43 分钟前 • 32k (https://huggingface.co/datasets/DeepRCL/SteeringGeometry)

引用此论文的空间0

无空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2609.06289 以从本页面链接。

包含此论文的合集0

无合集包含此论文

将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接。

相似文章

你的LLM何时可引导?

arXiv cs.CL

本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。