UniSteer:文本引导的激活空间流匹配实现多功能大语言模型操控

Hugging Face Daily Papers 论文

摘要

UniSteer 提出了一种文本引导的激活流匹配方法,在激活空间中学习通用条件速度场,无需特定任务干预模块即可实现多功能的 LLM 行为控制与分类任务。

基于激活的控制通过干预大语言模型(LLM)在推理过程中的内部表示来操控模型,已成为控制个性和风格等行为的有效范式。然而,现有方法通常依赖固定的操控方向或特定任务的干预模块,难以适应细粒度概念和组合约束。我们提出 UniSteer,一种文本引导的激活流匹配模型,该模型从自然语言条件中学习残差流激活的条件分布。UniSteer 并非为每个目标行为拟合单独的干预,而是在激活空间中学习一个通用的条件速度场。在推理时,UniSteer 通过将源激活部分传输到潜在状态,然后在目标文本条件下重新生成,再将其注入冻结的 LLM,从而实现流反转。同一条件模型通过选择重建能量最低的文本标签支持激活空间分类。在三个目标 LLM 上的实验表明,UniSteer 为行为控制、真实性操控、细粒度概念操控、多约束指令遵循以及激活空间分类提供了统一接口。
查看原文
查看缓存全文

缓存时间: 2026/05/29 11:01

论文页面 - UniSteer:文本引导的激活空间流匹配,实现多功能LLM控制

来源:https://huggingface.co/papers/2605.30076

摘要

UniSteer 利用文本引导的激活流匹配,在激活空间中学习一个通用的条件速度场,用于控制 LLM 的行为以及分类任务。

基于激活的控制通过对大语言模型(LLM)推理时的内部表征进行干预,已成为控制个性、风格等行为的有效范式。然而,现有方法通常依赖固定的控制方向或任务特定的干预模块,难以适应细粒度概念和组合约束。我们提出 UniSteer,一个文本引导的激活流匹配模型,该模型从自然语言条件中学习残差流激活上的条件分布。UniSteer 并非为每个目标行为拟合独立的干预方案,而是在激活空间中学习一个通用的条件速度场。在推理时,UniSteer 通过将源激活部分传输至潜在状态,并在目标文本条件下重新生成,再将其注入冻结的 LLM 中,从而实现流反转。相同的条件模型还支持激活空间分类——通过选择重构能量最低的文本标签来实现。在三个目标 LLM 上的实验表明,UniSteer 在行为控制、真实性引导、细粒度概念引导、多约束指令遵循以及激活空间分类等任务上提供了统一的接口。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30076)
查看 PDF (https://arxiv.org/pdf/2605.30076)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30076)

在你的智能体中获取这篇论文:

hf papers read 2605\.30076

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

暂无模型链接此论文

请在模型的 README.md 中引用 arxiv.org/abs/2605.30076 以在此页面建立链接。

引用此论文的数据集0

暂无数据集链接此论文

请在数据集的 README.md 中引用 arxiv.org/abs/2605.30076 以在此页面建立链接。

引用此论文的 Space 应用0

暂无 Space 应用链接此论文

请在 Space 应用的 README.md 中引用 arxiv.org/abs/2605.30076 以在此页面建立链接。

包含此论文的收藏集0

暂无包含此论文的收藏集

请将这篇论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面建立链接。

相似文章

超越引导向量:用于推理时干预的基于流的激活引导

arXiv cs.CL

本文介绍了 FLAS,这是一种基于流的激活引导方法,通过学习概念条件化的速度场,在推理时引导语言模型的激活。在 AxBench 基准测试中,FLAS 是首个无需针对特定概念进行微调,即可在未见概念上持续优于上下文提示(in-context prompting)的学习型方法。

你的LLM何时可引导?

arXiv cs.CL

本文通过分析早期解码动态,研究了激活引导在LLM上何时成功或失败。作者引入了ASTEER,这是一个包含大量引导生成结果的大型测试平台,并训练了一个GBDT分类器,通过早期隐藏状态预测引导结果,从而实现高效的引导强度搜索。

你的LLM何时可引导?

Hugging Face Daily Papers

本文介绍了一种方法,利用梯度提升决策树(GBDT)分类器,从早期解码状态预测语言模型中激活引导的有效性,从而无需完整生成即可高效优化引导强度。

视觉-语言-动作模型中的闭环神经激活控制

arXiv cs.AI

提出CTRL-STEER,一种闭环框架,通过时变控制信号对视觉-语言-动作模型进行自适应引导,在无需重新训练的情况下,实现了概念调节与任务成功率之间的更好权衡。