activation-steering

标签

Cards List
#activation-steering

MetaSteer:通过注意力投影适配实现基于上下文条件的非线性引导

arXiv cs.CL ↗ · 16小时前 缓存

论文提出了MetaSteer方法,该方法学习应用于大语言模型(LLM)注意力投影矩阵的非线性、依赖上下文的干预,在合并的偏好数据上一次性训练后,可零样本迁移至未见过的概念和智能体场景,其效果达到或超越针对特定任务的引导基线。

0 人收藏 0 人点赞
#activation-steering

纠正何时才算修复?工具使用型大语言模型内部干预的机制化审计

arXiv cs.CL ↗ · 昨天 缓存

本文提出了SAKIKO——一个机制化审计框架,揭示了工具使用型大语言模型中的激活引导干预可能只是将概率质量重新分配,而非真正修复问题;研究发现,其中一个净增益为+55的干预,会破坏其所触及的基准正确决策中超过一半的案例。

0 人收藏 0 人点赞
#activation-steering

Persona 剂量化:基于校准激活引导的分级特质控制

arXiv cs.AI ↗ · 昨天 缓存

本文提出了一种名为 PersonaDose 的校准激活引导方法,通过特质描述和请求的平均强度来控制语言模型的人格表达,并在 Llama-3.1-8B、Qwen3-8B 和 Gemma-3-4B 上进行了评估。

0 人收藏 0 人点赞
#activation-steering

大语言模型中基于因果激活引导的自适应多值控制

arXiv cs.LG ↗ · 2天前 缓存

本文介绍了AIMES,一个用于大语言模型中自适应多值激活引导的框架,它使用在线观察者反馈进行状态感知适应,无需额外训练,显示出相比固定方法提高了可控性。

0 人收藏 0 人点赞
#activation-steering

防护性梯度引导激活调控:在Qwen3.5-0.8B模型中对关机响应的最小步长策略

arXiv cs.LG ↗ · 2天前 缓存

本文提出了一种防护性梯度引导激活调控方法,用于检测和纠正Qwen3.5-0.8B模型中避免关机的响应。该方法采用分类器结合最小步长策略,实现有限选择性效果。

0 人收藏 0 人点赞
#activation-steering

LocUS:基于注意力头选择与子空间投影的定向激活引导

arXiv cs.CL ↗ · 3天前 缓存

LocUS 是一种新型的大语言模型定向激活引导方法,通过将干预限制在特定的注意力头和反嵌入矩阵的子空间中,在保持通用能力的同时提升性能。

0 人收藏 0 人点赞
#activation-steering

‘作为语言模型...’:聊天模板切换LLM自指性语音,激活导向再现此现象

arXiv cs.LG ↗ · 2026-09-23 缓存

该研究揭示,聊天模板控制语言模型是否采用免责声明语音(例如,“我只是个AI”)或体验性语音(例如,“我感觉”),并识别出可引导此行为的激活方向,对AI安全研究产生影响。

0 人收藏 0 人点赞
#activation-steering

读取最佳层并非操控最佳层:全模态大语言模型中的探测-操控层分离现象

arXiv cs.CL ↗ · 2026-09-22 缓存

本文揭示,在全模态大语言模型中,用于线性探测读取概念的最佳层与用于激活操控的最佳层并不相同,这挑战了表征工程领域的普遍经验法则。

0 人收藏 0 人点赞
#activation-steering

潜在推理中引导失效:从潜在到语言的转换鸿沟

arXiv cs.CL ↗ · 2026-09-21 缓存

这项研究发现,在潜在思维链推理中,激活引导的效果不如显式CoT,突显了一个转换鸿沟,即潜在空间中的干预未能转移到语言生成。

0 人收藏 0 人点赞
#activation-steering

基于挪威MFQ-30引导大型语言模型响应朝向道德基础

arXiv cs.CL ↗ · 2026-09-21 缓存

本研究探讨使用挪威MFQ-30问卷引导大型语言模型朝向人类道德基础,评估提示级别的人格引导和激活级别干预。

0 人收藏 0 人点赞
#activation-steering

细粒度有害信号在大型语言模型安全中的作用

arXiv cs.CL ↗ · 2026-09-18 缓存

本文探讨了细粒度类别特定有害性表示在大型语言模型安全中的作用。研究发现,正交于一般有害性的类别残差在编码有害性方面存在差异,并能引发拒绝反应,这对理解大型语言模型的安全机制具有启示意义。

0 人收藏 0 人点赞
#activation-steering

两个小型LLM中无可利用的线性'屈服方向':激活引导声明的验证协议,以及抗压下谄媚行为的跨家族研究

arXiv cs.CL ↗ · 2026-09-17 缓存

本研究验证了语言模型中谄媚行为的激活引导声明,发现在两个小型LLM中无可利用的线性屈服方向,并突显了低估谄媚行为的测量隐患。

0 人收藏 0 人点赞
#activation-steering

GEOSTEER: 用于大型语言模型激活引导的测地线优化方法

arXiv cs.LG ↗ · 2026-09-11 缓存

GeoSteer 是一种基于优化的方法,用于大型语言模型中的保持范数激活引导,通过在表示流形上使用测地线更新来增强对模型行为的控制,同时保持激活范数。

0 人收藏 0 人点赞
#activation-steering

用于多元LLM对齐的溢出感知多值引导

arXiv cs.AI ↗ · 2026-09-10 缓存

本文提出了一种溢出感知的多值激活引导方法,以实现LLMs的多元对齐,无需微调或奖励模型即可改进对多个价值维度的控制。

0 人收藏 0 人点赞
#activation-steering

从 J 空间提取控制向量

Hacker News Top ↗ · 2026-09-06 缓存

本文研究探讨利用 Jacobian 空间从概念标记提取控制向量以调控大语言模型行为,基于 Qwen3-1.7B 的实验表明,该方法在简单任务中展现潜力,但在复杂场景中存在局限。

0 人收藏 0 人点赞
#activation-steering

转向几何:验证LLM转向空间中的人类价值几何结构

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

本文介绍了一个基准测试,以验证LLMs中激活转向的分布驱动方法能够恢复与Schwartz理论一致的人类价值拓扑结构,这些方法随模型规模提升而改善,但在指令调优后有所下降。

0 人收藏 0 人点赞
#activation-steering

GAPS:条件激活引导的维度级门控

arXiv cs.CL ↗ · 2026-09-03 缓存

GAPS引入了维度级门控用于语言模型中的条件激活引导,结合静态和动态门控进行选择性干预,改善行为-能力权衡,在毒性缓解和概念移除任务上取得显著提升。

0 人收藏 0 人点赞
#activation-steering

微调是否会撤销激活引导?行为恢复而无权重编辑逆转

arXiv cs.CL ↗ · 2026-08-27 缓存

本文研究微调是否会撤销语言模型中的激活引导,发现尽管在优化压力下,拒绝抑制等行为效应可能退化,但底层的权重修改在机制上保持稳定。

0 人收藏 0 人点赞
#activation-steering

用于减少医疗问答中谄媚和幻觉的门控激活引导

arXiv cs.AI ↗ · 2026-08-26 缓存

本文介绍了一种门控激活引导方法,通过推理时干预来减少医疗问答中大型语言模型的谄媚和幻觉。基于临床数据评估,该方法在用户压力下表现出更强的鲁棒性。

0 人收藏 0 人点赞
#activation-steering

知识图谱门控的去事实化技术:用于代理对话AI中的风格可控与事实保真生成

arXiv cs.CL ↗ · 2026-08-24 缓存

本文提出了Defactualize-Steer-Rehydrate(DSR)框架,该框架将知识图谱与激活引导相结合,以增强代理对话AI中的风格可控与事实保真生成,并在LLaMA模型上进行了评估,显示出在事实恢复方面的显著改进。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈