sparse-autoencoders

标签

Cards List
#sparse-autoencoders

词性作为SAE潜在空间中的涌现类别

arXiv cs.CL ↗ · 昨天 缓存

该论文研究了词性类别在Sparse AutoEncoder潜在空间中的编码方式,发现它们是分布式的,并不与单个潜在变量一一对应。

0 人收藏 0 人点赞
#sparse-autoencoders

超越高频词:MonoTM用于可解释单语义特征的主题建模

arXiv cs.CL ↗ · 2026-09-10 缓存

MonoTM是一个可解释的主题建模框架,通过稀疏自编码器将混合估计与特征解释解耦,从而提供超越传统基于单词表示的语义有意义的主题。

0 人收藏 0 人点赞
#sparse-autoencoders

通过邻居集成特征选择增强基于SAE的转向

arXiv cs.AI ↗ · 2026-09-01 缓存

本文指出,针对基于SAE的LLM转向的统计top-k特征选择并非最优,并提出了邻居集成特征选择(NIFS)以通过利用表示相似性来提升性能。

0 人收藏 0 人点赞
#sparse-autoencoders

奖励信息稀疏自编码器与解决方案完整性混淆

arXiv cs.CL ↗ · 2026-08-28 缓存

本文介绍了奖励信息稀疏自编码器 (RI-SAEs),利用强化学习奖励来提升可解释性,但发现好坏推理的区分主要由解决方案完整性驱动,而非推理质量。

0 人收藏 0 人点赞
#sparse-autoencoders

利用几何不变稀疏自编码器探索大型语言模型中的跨语言推理不变性

arXiv cs.LG ↗ · 2026-08-26 缓存

本研究探讨多语言大型语言模型是否为跨语言数学推理发展出共享的内部表示,引入了一种新颖的几何不变稀疏自编码器(GI-SAE)方法。研究发现,跨语言特征共享依赖于模型,且几何相似性并不一致意味着功能可互换性。

0 人收藏 0 人点赞
#sparse-autoencoders

Prof-K: Probabilistic One-Pass Filtering for Efficient Top-k Selection

arXiv cs.LG ↗ · 2026-08-14 缓存

Prof-K is a probabilistic one-pass filtering algorithm for fast, scalable top-k selection with correctness guarantees, achieving 1.5x–10x speedups over PyTorch topk and RadiK, especially in large-scale small-k regimes.

0 人收藏 0 人点赞
#sparse-autoencoders

虚假与不可能在AI语言表征中指向不同方向

arXiv cs.CL ↗ · 2026-08-14 缓存

本文报告了对Gemma 3 4B IT的激活研究,表明该模型的内部表征能够区分必然性虚假(不可能)与偶然性虚假,其中不可能方向与真实方向正交,并与语义异常方向重叠。

0 人收藏 0 人点赞
#sparse-autoencoders

通过非局域性度量SAE特征的语义抽象度

arXiv cs.AI ↗ · 2026-08-12 缓存

本文介绍了特征非局域性(FNL),一种基于熵的度量指标,用于衡量大型语言模型中SAE特征的语义抽象度,并展示了其在审计越狱缓解特征和通过引导提高MATH-500准确率方面的应用。

0 人收藏 0 人点赞
#sparse-autoencoders

思考与非思考:通过稀疏自编码器解读大型语言模型的推理机制

arXiv cs.CL ↗ · 2026-08-11 缓存

本文使用Top-K稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的内部推理,对比思考(CoT)与非思考模式,发现不同的特征激活模式,并通过因果干预实验加以验证。

0 人收藏 0 人点赞
#sparse-autoencoders

“我的名字众多”:基于稀疏自编码器解析助手及其人格

arXiv cs.CL ↗ · 2026-08-11 缓存

本文使用稀疏自编码器分解语言模型如何表征默认助手、角色扮演人格与故事角色,发现人格保留助手的核心特征,同时在层间逐步分化,而故事角色则缺乏该核心。

0 人收藏 0 人点赞
#sparse-autoencoders

使用分块SVD寻找可用的权重机制

arXiv cs.AI ↗ · 2026-08-10 缓存

本文提出通过按列分块的SVD直接从线性权重位点提取机制挂载,为机械可解释性提供了一种替代稀疏自编码器等代理字典的方法。在Gemma-2-2B上评估,该方法通过了全部182项位点-层检查。

0 人收藏 0 人点赞
#sparse-autoencoders

用于特征发现与控制的多模态模型对比分析

Hugging Face Daily Papers ↗ · 2026-08-10 缓存

MMDiff利用多模态稀疏自编码器来隔离、检测和控制多模态语言模型中的特征,提升可解释性并针对视觉和安全行为进行定向引导。

0 人收藏 0 人点赞
#sparse-autoencoders

CircuitSteer:通过稀疏自编码器电路实现几何对齐的多层引导

arXiv cs.LG ↗ · 2026-08-07 缓存

CircuitSteer 是一种新颖的框架,利用稀疏自编码器来识别和操控大型语言模型中的多层语义电路,与CAA等单层方法相比,能够实现更鲁棒且保持流畅性的行为引导。

0 人收藏 0 人点赞
#sparse-autoencoders

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL ↗ · 2026-08-07 缓存

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

0 人收藏 0 人点赞
#sparse-autoencoders

ECG-InterpBench:使用匹配尺度稀疏自编码器对ECG基础模型可解释性进行基准测试

arXiv cs.LG ↗ · 2026-07-31 缓存

ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。

0 人收藏 0 人点赞
#sparse-autoencoders

从表征到行为:探索LLMs中的人-情境-行为三元组

arXiv cs.CL ↗ · 2026-07-30 缓存

本文将Funder的人格三元框架适配到大语言模型(LLM),利用稀疏自编码器发现并验证类似特质的内部表征,并通过特征层面的干预展示可控的双向行为偏移。

0 人收藏 0 人点赞
#sparse-autoencoders

面向语言模型机制审计的参考特征图谱

arXiv cs.AI ↗ · 2026-07-28 缓存

提出用于审计语言模型的参考特征图谱,能够高效地在模型间迁移特征库,并揭示模型特定的异常。

0 人收藏 0 人点赞
#sparse-autoencoders

使用奇偶瓶颈层扩展可解释的Transformer

arXiv cs.LG ↗ · 2026-07-24 缓存

介绍了ParityTransformer,这是一种GPT-2规模的架构,具有深度奇偶瓶颈层,使中间表示在设计上即可解释,在无需传统宽瓶颈内存成本的情况下高效强制稀疏性,并在稀疏探测任务上展示了具有竞争力的性能。

0 人收藏 0 人点赞
#sparse-autoencoders

单令牌稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

arXiv cs.LG ↗ · 2026-07-24 缓存

本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。

0 人收藏 0 人点赞
#sparse-autoencoders

超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响

arXiv cs.AI ↗ · 2026-07-24 缓存

本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈