linear-probes

标签

Cards List
#linear-probes

从LLM激活中测量文本的概念内容:概念向量与线性探针的ESG证据

arXiv cs.CL · 昨天 缓存

本文提出使用线性探针和RFM概念向量,从LLM内部激活中测量文本的概念内容,并将其应用于ESG分类。最佳线性探针在无需任务特定微调的情况下接近微调分类器的准确率,且优于模型自身输出,表明激活携带了响应之外的概念内容。

0 人收藏 0 人点赞
#linear-probes

探究语言模型的思维失调过程

arXiv cs.AI · 2026-06-24 缓存

本文提出通过将LLM的失调分解为细粒度的认知过程(失调指标),并利用线性探针检测内部激活中的这些指标,从而在分布外对话记录上实现了高AUROC。

0 人收藏 0 人点赞
#linear-probes

比较线性探针与马氏余弦相似度

Hugging Face Daily Papers · 2026-06-17 缓存

本文扩展了经验发现:线性探针之间的马氏余弦相似度(MCS)线性预测了分布外AUROC,并在高斯假设下从理论上证明了这一关系。

0 人收藏 0 人点赞
#linear-probes

人工理性的谜题:探究大型推理模型中的生成-评估差距

Hugging Face Daily Papers · 2026-05-31 缓存

本文研究了大型推理模型(LRMs)中的生成-评估差距,发现尽管它们能近乎完美地生成解决方案,但由于答案确认偏差,它们无法稳健地评估推理过程。

0 人收藏 0 人点赞
#linear-probes

它们在思考什么?大语言模型中概念的界定、探测与追踪

arXiv cs.CL · 2026-05-29 缓存

本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。

0 人收藏 0 人点赞
#linear-probes

大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性

Hugging Face Daily Papers · 2026-05-27 缓存

本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈