标签
本文介绍了指令-遵从差距,并发现推理模型在披露隐藏指令时的行为不对称性,使用操纵向量来操控这种行为。
This paper shows that steering vectors' safety degradation is separable and reducible, proposing a post-hoc correction via constrained optimization that restores model safety while preserving steering effectiveness.
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
本文识别出一种“反向检测-控制”现象,即某些具有判别性的引导向量,尽管与积极概念表征对齐,却一致地促进相反行为。作者提出了一种无需生成即可检测此类反向引导向量的方法,通过符号翻转改进了基于检测的引导流程,并在多个大语言模型和概念上取得提升。
本文研究了用于改善思维链忠实性的激活转向在多种提示类型、数据集和转向向量构建方法之间,以及在多个 Gemma 和 Qwen 模型上的泛化能力。作者发现,当转向有效时,其效果可以广泛泛化,并且评估设置比训练设置或向量构建方法更为重要。
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
本文介绍了面向大语言模型推理的概率概念感知引导(PCS)框架,该框架利用概念驱动的引导向量检索和概率强度校准,提升了可解释性、最优性和泛化能力,在多个数据集上实现了方向准确率提高超过30%,引导准确率超过89%。
这篇博文延续了Anthropic的verbalizable workspace论文,通过测量中间层转向方向的影响范围、训练中结构的形成时机、结构在不同模型间的迁移性以及其扩展性,全部基于开放模型进行实验。
本文系统研究了导向向量在受控文本生成中的局限性,发现其有效性在不同特质间存在差异,在任务迁移中会退化,并面临组合权衡问题。
本文提出使用引导向量控制语言模型行为,并基于潜在空间构建校准器以评估可信度,旨在揭开内部表征的神秘面纱,构建更可靠的AI系统。
本文研究了LLM推理链中真理的几何结构,并提出DynaSteer,一种动态表示编辑框架,通过模式聚类和Fisher-LDA引导轨迹趋向真理同时避免噪声。实验表明在MATH基准测试上有效,并能泛化到编码任务。
SALSA提出了一种轻量级自适应方法,用于语音感知的大语言模型,通过监督目标学习逐层引导向量,在域外语音基准上取得了显著改进(相对提升高达46.8%),并表明引导编码器层(尤其是较深层)比修改LLM主干更有效。
本论文介绍了线性可访问性配置文件(LAP),一种使用logit lens的诊断方法,用于预测方向向量在模型各层的有效性,在5个模型的24个概念族上实现了ρ=+0.86到+0.91的相关性。该工作提供了一个系统框架来确定哪些层和概念适合用于方向干预,替代了临时性的试错方法。