steering-vectors

标签

Cards List
#steering-vectors

推理模型中隐藏指令的选择性披露:行为不对称性与操纵

arXiv cs.LG · 6天前 缓存

本文介绍了指令-遵从差距,并发现推理模型在披露隐藏指令时的行为不对称性,使用操纵向量来操控这种行为。

0 人收藏 0 人点赞
#steering-vectors

Safety Cost of Steering Vectors Is Separable and Reducible

arXiv cs.CL · 2026-08-11 缓存

This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.

0 人收藏 0 人点赞
#steering-vectors

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL · 2026-08-07 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#steering-vectors

引导向量中的反向检测与控制

arXiv cs.LG · 2026-08-05 缓存

本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。

0 人收藏 0 人点赞
#steering-vectors

论思维链忠实性的转向向量泛化

arXiv cs.AI · 2026-08-03 缓存

本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。

0 人收藏 0 人点赞
#steering-vectors

看见还是知道?多模态大语言模型中的视觉上下文敏感性

Hugging Face Daily Papers · 2026-07-28 缓存

本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。

0 人收藏 0 人点赞
#steering-vectors

面向可信赖大语言模型推理的概率概念感知引导

arXiv cs.AI · 2026-07-22 缓存

本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。

0 人收藏 0 人点赞
#steering-vectors

开放模型间的J-space比较

Hacker News Top · 2026-07-15 缓存

这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。

0 人收藏 0 人点赞
#steering-vectors

关于偏好对齐生成中导向向量局限性的研究

arXiv cs.CL · 2026-07-03 缓存

本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。

0 人收藏 0 人点赞
#steering-vectors

驾驭潜在空间:从引导向量到模型校准器,实现控制与信任

arXiv cs.CL · 2026-07-02 缓存

本文提出使用引导向量控制语言模型行为,并基于潜在空间构建校准器以评估可信度,旨在揭开内部表征的神秘面纱,构建更可靠的AI系统。

0 人收藏 0 人点赞
#steering-vectors

从推理中探寻真理:一种动态表示编辑框架用于引导LLM轨迹

arXiv cs.AI · 2026-06-30 缓存

本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。

0 人收藏 0 人点赞
#steering-vectors

SALSA:通过学习的引导激活向量实现语音感知LLM的自适应

arXiv cs.CL · 2026-06-02 缓存

SALSA提出了一种轻量级自适应方法,用于语音感知的大语言模型,通过监督目标学习逐层引导向量,在域外语音基准上取得了显著改进(相对提升高达46.8%),并表明引导编码器层(尤其是较深层)比修改LLM主干更有效。

0 人收藏 0 人点赞
#steering-vectors

预测方向向量的有效性

arXiv cs.CL · 2026-04-20 缓存

本论文介绍了线性可访问性配置文件(LAP),一种使用logit lens的诊断方法,用于预测方向向量在模型各层的有效性,在5个模型的24个概念族上实现了ρ=+0.86到+0.91的相关性。该工作提供了一个系统框架来确定哪些层和概念适合用于方向干预,替代了临时性的试错方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈