steering-vectors

标签

Cards List
#steering-vectors

面向可信赖大语言模型推理的概率概念感知引导

arXiv cs.AI · 18小时前 缓存

本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。

0 人收藏 0 人点赞
#steering-vectors

开放模型间的J-space比较

Hacker News Top · 2026-07-15 缓存

这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。

0 人收藏 0 人点赞
#steering-vectors

关于偏好对齐生成中导向向量局限性的研究

arXiv cs.CL · 2026-07-03 缓存

本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。

0 人收藏 0 人点赞
#steering-vectors

驾驭潜在空间:从引导向量到模型校准器,实现控制与信任

arXiv cs.CL · 2026-07-02 缓存

本文提出使用引导向量控制语言模型行为,并基于潜在空间构建校准器以评估可信度,旨在揭开内部表征的神秘面纱,构建更可靠的AI系统。

0 人收藏 0 人点赞
#steering-vectors

从推理中探寻真理:一种动态表示编辑框架用于引导LLM轨迹

arXiv cs.AI · 2026-06-30 缓存

本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。

0 人收藏 0 人点赞
#steering-vectors

SALSA:通过学习的引导激活向量实现语音感知LLM的自适应

arXiv cs.CL · 2026-06-02 缓存

SALSA提出了一种轻量级自适应方法,用于语音感知的大语言模型,通过监督目标学习逐层引导向量,在域外语音基准上取得了显著改进(相对提升高达46.8%),并表明引导编码器层(尤其是较深层)比修改LLM主干更有效。

0 人收藏 0 人点赞
#steering-vectors

预测方向向量的有效性

arXiv cs.CL · 2026-04-20 缓存

本论文介绍了线性可访问性配置文件(LAP),一种使用logit lens的诊断方法,用于预测方向向量在模型各层的有效性,在5个模型的24个概念族上实现了ρ=+0.86到+0.91的相关性。该工作提供了一个系统框架来确定哪些层和概念适合用于方向干预,替代了临时性的试错方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈