标签
Prof-K is a probabilistic one-pass filtering algorithm for fast, scalable top-k selection with correctness guarantees, achieving 1.5x–10x speedups over PyTorch topk and RadiK, especially in large-scale small-k regimes.
本文报告了对Gemma 3 4B IT的激活研究,表明该模型的内部表征能够区分必然性虚假(不可能)与偶然性虚假,其中不可能方向与真实方向正交,并与语义异常方向重叠。
本文介绍了特征非局域性(FNL),一种基于熵的度量指标,用于衡量大型语言模型中SAE特征的语义抽象度,并展示了其在审计越狱缓解特征和通过引导提高MATH-500准确率方面的应用。
本文使用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的内部推理,对比思考(CoT)与非思考模式,发现不同的特征激活模式,并通过因果干预实验加以验证。
本文使用稀疏自编码器分解语言模型如何表征默认助手、角色扮演人格与故事角色,发现人格保留助手的核心特征,同时在层间逐步分化,而故事角色则缺乏该核心。
本文提出通过按列分块的SVD直接从线性权重位点提取机制挂载,为机械可解释性提供了一种替代稀疏自编码器等代理字典的方法。在Gemma-2-2B上评估,该方法通过了全部182项位点-层检查。
CircuitSteer 是一种新颖的框架,利用稀疏自编码器来识别和操控大型语言模型中的多层语义电路,与CAA等单层方法相比,能够实现更鲁棒且保持流畅性的行为引导。
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。
本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。
介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。
本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。
本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。
智能体可解释性正在成为一个研究方向,其中AI智能体自主形成假设、设计实验并完善对模型内部的解释。三个工作——SAGE、Agentic-iModels和HYVE——展示了这一向自主、假设驱动可解释性的转变,改进了特征自动解释、模型设计和电路解释。
本文使用因果干预对稀疏自编码器特征进行审计,发现在退化的SAE中最多77%的相关性恢复特征以及良好训练的SAE中9%的特征是因果惰性的。作者引入了sae-causal-audit工具用于可重现评估。
本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。
Elhage等人的《叠加的玩具模型》解释了可解释性为何困难:模型通过叠加来用少于特征维度的方式表示更多特征,导致多语义神经元作为压缩手段出现。这篇论文催生了稀疏自编码器的研究计划。
本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。
本文提出了一种Procrustes条件的联合端到端Top-K稀疏自编码器,用于从独立训练的BERT模型中提取通用特征,在跨种子特征对齐方面优于事后对齐方法。