转向几何:验证LLM转向空间中的人类价值几何结构
摘要
本文介绍了一个基准测试,以验证LLMs中激活转向的分布驱动方法能够恢复与Schwartz理论一致的人类价值拓扑结构,这些方法随模型规模提升而改善,但在指令调优后有所下降。
查看缓存全文
缓存时间: 2026/09/09 04:28
论文页面 - 转向几何:验证LLM转向空间中的人类价值几何
来源:https://huggingface.co/papers/2609.06289
摘要
通过分布驱动方法获得的激活转向向量在大型语言模型中编码了与理论对齐的人类价值几何,其几何保真度随模型规模增加而提高,但在指令微调后有所下降。
随着大型语言模型 (LLMs) 在对齐敏感场景中的应用日益增多,激活转向(https://huggingface.co/papers?q=activation%20steering)已成为微调方法(例如 RLHF、DPO)在行为控制方面的一种轻量级、推理时替代方案。然而,现有工作通常仅在孤立行为上验证转向效果,这使得转向向量(https://huggingface.co/papers?q=steering%20vectors)是编码了连贯的语义结构,还是仅仅利用了行为特定捷径,尚不明确。我们研究了LLM转向向量(https://huggingface.co/papers?q=steering%20voters)的潜在几何(https://huggingface.co/papers?q=latent%20geometry)是否反映了人类价值观与道德中理论指定的结构。我们使用施瓦茨基本人类价值观理论(https://huggingface.co/papers?q=Schwartz%27s%20Theory%20of%20Basic%20Human%20Values)作为主要的细粒度框架,引入了一个涵盖20种人类价值观的26K样本基准,并分析了分布驱动方法(https://huggingface.co/papers?q=distribution-driven%20methods)(例如 CAA(https://huggingface.co/papers?q=CAA)、SphericalSteer(https://huggingface.co/papers?q=SphericalSteer)、ODESteer(https://huggingface.co/papers?q=ODESteer))和行为中心方法(例如 COLD-Steer(https://huggingface.co/papers?q=COLD-Steer)、BiPO(https://huggingface.co/papers?q=BiPO))在不同模型家族和规模上的表现。我们发现,分布驱动方法(https://huggingface.co/papers?q=distribution-driven%20methods)恢复了与理论预测对齐的人类价值拓扑结构(Spearman ρ 最高达 0.51,p < 10^{-13})。相比之下,行为中心方法实现了相当的转向性能,但与预期的价值几何结构关联甚少。几何保真度随模型规模提升而改善,但在指令微调(https://huggingface.co/papers?q=instruction%20tuning)后下降。最后,更好的几何对齐也能带来更符合人类认知的跨价值迁移:正确转向一个价值能够提升兼容的价值观并抑制对立的价值观。代码和数据可在以下地址获取:https://github.com/DeepRCL/Steering_Geometry。
查看 arXiv 页面 (https://arxiv.org/abs/2609.06289) 查看 PDF (https://arxiv.org/pdf/2609.06289) 项目页面 (https://github.com/DeepRCL/Steering_Geometry) GitHub1 (https://github.com/DeepRCL/Steering_Geometry) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.06289)
将此论文添加至您的智能体:
hf papers read 2609.06289
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2609.06289 以从本页面链接。
引用此论文的数据集1
DeepRCL/SteeringGeometry 查看器 • 更新于 43 分钟前 • 32k (https://huggingface.co/datasets/DeepRCL/SteeringGeometry)
引用此论文的空间0
无空间链接此论文
在空间的 README.md 中引用 arxiv.org/abs/2609.06289 以从本页面链接。
包含此论文的合集0
无合集包含此论文
将此论文添加到合集 (https://huggingface.co/new-collection) 以从本页面链接。
相似文章
人格的几何结构:基于荣格认知功能的激活导向
本文提出了一个利用荣格认知功能进行大语言模型激活导向的框架,展示了对八种功能的有效单调控制,并揭示了激活空间中结构化的几何关系。
用于多元LLM对齐的溢出感知多值引导
本文提出了一种溢出感知的多值激活引导方法,以实现LLMs的多元对齐,无需微调或奖励模型即可改进对多个价值维度的控制。
你的LLM何时可引导?
本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。
通过潜在激活引导的大语言模型文化价值对齐
一个利用基于场景的行为探测和激活引导来评估和引导大语言模型中文化价值的框架,揭示了价值维度之间的潜在纠缠。
何时Rank-1引导是廉价的?几何、粒度和预算搜索
本文研究了秩1激活引导在何时有效且具成本效益,提出了几何引导搜索和粒度的概念来解释变异性,并引入了GRACE框架用于高效的大语言模型控制。