linear-probes

标签

Cards List
#linear-probes

可解码性非因果性:通过SAE分解区分探测器输出与行为驱动因素

arXiv cs.AI · 昨天 缓存

本文证明,从语言模型激活中解码概念的线性探测器不一定能识别因果相关特征,并引入了使用稀疏自编码器的特征级诊断方法,以将探测器对齐与行为驱动因素分离。

0 人收藏 0 人点赞
#linear-probes

两个小型LLM中无可利用的线性'屈服方向':激活引导声明的验证协议,以及抗压下谄媚行为的跨家族研究

arXiv cs.CL · 昨天 缓存

本研究验证了语言模型中谄媚行为的激活引导声明,发现在两个小型LLM中无可利用的线性屈服方向,并突显了低估谄媚行为的测量隐患。

0 人收藏 0 人点赞
#linear-probes

真相从未消失:顺从语境真值探针中的完美混叠

arXiv cs.LG · 2026-09-11 缓存

本文识别了AI模型真值探针中的'完美混叠'现象,即在顺从语境下训练的探针无法区分真实情况与预设操作,并展示了混合语境训练能提升检测效果。

0 人收藏 0 人点赞
#linear-probes

探测器泛化作为分布外欺骗检测的子空间选择

arXiv cs.CL · 2026-09-04 缓存

本文表明,将语言模型激活投影到训练分布中主成分的一个小子集上,能够实现欺骗检测探测器的有效跨域转移,缩小了基线方法与预言方法之间的性能差距。

0 人收藏 0 人点赞
#linear-probes

语言模型如何选择立场:指令层级的内部表示

arXiv cs.AI · 2026-09-01 缓存

本文研究指令微调的大语言模型如何仲裁系统指令与用户指令之间的冲突,揭示用户偏好行为与可读的内部仲裁信号共存,并通过机械可解释性技术和引导实验进行演示。

0 人收藏 0 人点赞
#linear-probes

AstroPT 对星系的了解,以及它能教给我们关于 LLMs 的知识

Hugging Face Daily Papers · 2026-08-23 缓存

本文提出使用 AstroPT(一个在星系图像上训练的 transformer)作为研究训练中概念涌现的测试平台,发现星系属性以固定的难度顺序涌现,这可以为大型语言模型的机制可解释性方法提供参考。

0 人收藏 0 人点赞
#linear-probes

可定位但不可释放:静默门控反转与有界线性释放

arXiv cs.CL · 2026-08-13 缓存

一项针对小型Transformer的预注册压力测试表明,虽然潜在因果结构可以被定位,但将其释放到行为中却失败:门控检测器在分布外反转,线性释放方向低于充分性界限,从而将定位与行为释放分离开来。

0 人收藏 0 人点赞
#linear-probes

从LLM激活中测量文本的概念内容:概念向量与线性探针的ESG证据

arXiv cs.CL · 2026-08-10 缓存

本文提出使用线性探针和RFM概念向量,从LLM内部激活中测量文本的概念内容,并将其应用于ESG分类。最佳线性探针在无需任务特定微调的情况下接近微调分类器的准确率,且优于模型自身输出,表明激活携带了响应之外的概念内容。

0 人收藏 0 人点赞
#linear-probes

探究语言模型的思维失调过程

arXiv cs.AI · 2026-06-24 缓存

本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。

0 人收藏 0 人点赞
#linear-probes

比较线性探针与马氏余弦相似度

Hugging Face Daily Papers · 2026-06-17 缓存

本文扩展了经验发现:线性探针之间的马氏余弦相似度(MCS)线性预测了分布外AUROC,并在高斯假设下从理论上证明了这一关系。

0 人收藏 0 人点赞
#linear-probes

人工理性的谜题:探究大型推理模型中的生成-评估差距

Hugging Face Daily Papers · 2026-05-31 缓存

本文研究了大型推理模型(LRMs)中的生成-评估差距,发现尽管它们能近乎完美地生成解决方案,但由于答案确认偏差,它们无法稳健地评估推理过程。

0 人收藏 0 人点赞
#linear-probes

它们在思考什么?大语言模型中概念的界定、探测与追踪

arXiv cs.CL · 2026-05-29 缓存

本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。

0 人收藏 0 人点赞
#linear-probes

大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性

Hugging Face Daily Papers · 2026-05-27 缓存

本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈