标签
本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。
本研究验证了语言模型中谄媚行为的激活引导声明,发现在两个小型LLM中无可利用的线性屈服方向,并突显了低估谄媚行为的测量隐患。
本文识别了AI模型真值探针中的'完美混叠'现象,即在顺从语境下训练的探针无法区分真实情况与预设操作,并展示了混合语境训练能提升检测效果。
本文表明,将语言模型激活投影到训练分布中主成分的一个小子集上,能够实现欺骗检测探测器的有效跨域转移,缩小了基线方法与预言方法之间的性能差距。
本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。
本文提出使用 AstroPT(一个在星系图像上训练的 transformer)作为研究训练中概念涌现的测试平台,发现星系属性以固定的难度顺序涌现,这可以为大型语言模型的机制可解释性方法提供参考。
一项针对小型Transformer的预注册压力测试表明,虽然潜在因果结构可以被定位,但将其释放到行为中却失败:门控检测器在分布外反转,线性释放方向低于充分性界限,从而将定位与行为释放分离开来。
本文提出使用线性探针和RFM概念向量,从LLM内部激活中测量文本的概念内容,并将其应用于ESG分类。最佳线性探针在无需任务特定微调的情况下接近微调分类器的准确率,且优于模型自身输出,表明激活携带了响应之外的概念内容。
本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。
本文扩展了经验发现:线性探针之间的马氏余弦相似度(MCS)线性预测了分布外AUROC,并在高斯假设下从理论上证明了这一关系。
本文研究了大型推理模型(LRMs)中的生成-评估差距,发现尽管它们能近乎完美地生成解决方案,但由于答案确认偏差,它们无法稳健地评估推理过程。
本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。
本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。