sparse-autoencoders

标签

Cards List
#sparse-autoencoders

单令牌稀疏自编码器特征是否具有因果必要性?层深度与SAE家族效应

arXiv cs.LG ↗ · 2026-07-24 缓存

本文研究了单令牌稀疏自编码器特征对于模型输出是否具有因果必要性,发现因果角色因SAE家族而异,并且对训练方法(而非激活函数或规模)敏感。

0 人收藏 0 人点赞
#sparse-autoencoders

超越 Liars' Bench:谎言类型、深度和稀疏性对LLM欺骗检测的影响

arXiv cs.AI ↗ · 2026-07-24 缓存

本文系统研究了谎言类型、表示深度、探针表达能力和稀疏特征如何影响LLM中的欺骗检测,发现检测性能高度依赖于训练数据和表示选择。

0 人收藏 0 人点赞
#sparse-autoencoders

@fnruji316625: 智能体可解释性正在成为一个独立研究方向。与一次性标注不同,AI智能体可以:形成…

X AI KOLs Timeline ↗ · 2026-07-15 缓存

智能体可解释性正在成为一个研究方向,其中AI智能体自主形成假设、设计实验并完善对模型内部的解释。三个工作——SAGE、Agentic-iModels和HYVE——展示了这一向自主、假设驱动可解释性的转变,改进了特征自动解释、模型设计和电路解释。

0 人收藏 0 人点赞
#sparse-autoencoders

从几何恢复到因果验证:稀疏自编码器特征的可重现审计,从叠加几何到因果惰性

arXiv cs.LG ↗ · 2026-07-15 缓存

本文使用因果干预对稀疏自编码器特征进行审计,发现在退化的SAE中最多77%的相关性恢复特征以及良好训练的SAE中9%的特征是因果惰性的。作者引入了sae-causal-audit工具用于可重现评估。

0 人收藏 0 人点赞
#sparse-autoencoders

用于可解释性分布外检测的稀疏自编码器

arXiv cs.LG ↗ · 2026-07-15 缓存

本文介绍了一种新颖的方法,利用稀疏自编码器(SAEs)从网络中间激活中学习可解释特征,用于分布外(OOD)检测,该方法达到了最先进的性能,并提供了关于分布偏移如何影响所学表示的见解。

0 人收藏 0 人点赞
#sparse-autoencoders

@TamazGadaev:第10天/n(面向AI研究人员的基础文本系列——并非特指论文,而是那些能让你掌握实际进行AI研究方法的作品)

X AI KOLs Timeline ↗ · 2026-07-14 缓存

Elhage等人的《叠加的玩具模型》解释了可解释性为何困难:模型通过叠加来用少于特征维度的方式表示更多特征,导致多语义神经元作为压缩手段出现。这篇论文催生了稀疏自编码器的研究计划。

0 人收藏 0 人点赞
#sparse-autoencoders

稀疏特征干预何时真正局部化?基于SAE的安全控制匹配评估

arXiv cs.AI ↗ · 2026-07-14 缓存

本文介绍了一种针对语言模型中稀疏特征干预的匹配评估协议,表明在与公平密集基线进行恰当对比时,基于SAE的安全控制所声称的效率优势会消失或逆转。

0 人收藏 0 人点赞
#sparse-autoencoders

使用Procrustes条件的联合端到端Top-K稀疏自编码器的跨种子可解释性

arXiv cs.CL ↗ · 2026-07-10 缓存

本文提出了一种Procrustes条件的联合端到端Top-K稀疏自编码器,用于从独立训练的BERT模型中提取通用特征,在跨种子特征对齐方面优于事后对齐方法。

0 人收藏 0 人点赞
#sparse-autoencoders

每个Token抛硬币:大型语言模型的伯努利稀疏引导

arXiv cs.LG ↗ · 2026-07-08 缓存

介绍了针对LLM激活引导的随机Token引导(STS)和随机块引导(SBS),它们以概率方式按token或按序列控制引导信号。实验表明,仅引导50%的token即可恢复大部分密集引导效果,同时保持流畅性,并且行为结果受累积信号剂量的速率限制。

0 人收藏 0 人点赞
#sparse-autoencoders

错误驾驶:利用可解释性于端到端自动驾驶模型

arXiv cs.AI ↗ · 2026-07-08 缓存

本文介绍了一种基于概念的可解释性框架,用于端到端自动驾驶模型。该框架通过稀疏自编码器进行无监督字典学习,将驾驶行为分解为人类可解释的概念。该框架能够分析和针对性修正模型决策,从而提升整体驾驶性能。

0 人收藏 0 人点赞
#sparse-autoencoders

通过稀疏自编码器将句子嵌入对齐到人类概念

arXiv cs.AI ↗ · 2026-07-02 缓存

提出使用Top-k稀疏自编码器将稠密句子嵌入解耦为可解释的人类概念,从而无需重新训练即可引导检索结果。

0 人收藏 0 人点赞
#sparse-autoencoders

解决AI中叠加问题以实现可解释性与患者神经元图像的跨模态对齐

arXiv cs.LG ↗ · 2026-07-01 缓存

本文引入稀疏自编码器来解决神经网络中的叠加问题,提高潜在空间的可解释性和几何保真度,并提出GW-map实现图像表示与单细胞RNA测序数据之间的跨模态对齐。

0 人收藏 0 人点赞
#sparse-autoencoders

LLMs的机制人格分析:通过潜在特征干预调控人格

arXiv cs.AI ↗ · 2026-06-30 缓存

本文介绍了一种机制可解释性方法,通过使用稀疏自编码器识别并干预潜在特征来调控LLM人格特质,在保持语言性能的同时实现了可控的人格调制。

0 人收藏 0 人点赞
#sparse-autoencoders

用于特征发现与长上下文归因的回合平均SAEs

arXiv cs.CL ↗ · 2026-06-30 缓存

本文介绍了基于回合平均的稀疏自编码器(SAEs),该编码器基于对话回合的平均激活值运行,能够实现长上下文的高效特征发现与归因图。此外,本文还提出了一种嵌套架构,用于与每个词元的特征联合训练。

0 人收藏 0 人点赞
#sparse-autoencoders

VASAE:使用词汇对齐锚定命名SAE字典方向

arXiv cs.CL ↗ · 2026-06-29 缓存

本文介绍了词汇对齐稀疏自编码器(VASAE),该方法在词汇对齐锚定下训练SAE特征,基于最近令牌嵌入为每个特征分配内在令牌名称,在早期层实现高对齐而不降低重建质量。

0 人收藏 0 人点赞
#sparse-autoencoders

PairSAE: 从蛋白质共折叠中的配对表示实现机制可解释性

arXiv cs.LG ↗ · 2026-06-29 缓存

介绍了一种名为PairSAE的方法,该方法将稀疏自编码器适配用于解释蛋白质共折叠模型中的配对表示,从而能够发现与生物学注释一致并可预测结合亲和力的可解释特征。

0 人收藏 0 人点赞
#sparse-autoencoders

从权重到特征:SAE引导的激活正则化用于LLM持续学习

arXiv cs.LG ↗ · 2026-06-26 缓存

本文提出了一种用于大语言模型的持续学习方法,该方法使用预训练的稀疏自编码器(SAEs)在激活空间而非权重空间中进行正则化,从而在无需存储先前数据的同时避免灾难性遗忘,并实现了更好的内存效率和更强的基准性能。

0 人收藏 0 人点赞
#sparse-autoencoders

使用稀疏自编码器发现数百万个可解释特征

arXiv cs.LG ↗ · 2026-06-26 缓存

本文介绍了Qwen3-Instruct SAE,这是一套基于Qwen3指令微调模型训练的稀疏自编码器,能够发现数百万个可解释特征,并展示了拒绝引导能力。

0 人收藏 0 人点赞
#sparse-autoencoders

将RL诱导的工具使用定位到单个Crosscoder特征

arXiv cs.LG ↗ · 2026-06-26 缓存

本文使用 Dedicated Feature Crosscoders 将Qwen2.5-3B中RL诱导的工具使用能力定位到单个可操控特征,通过特征操控实现了+65pp的工具正确性,并展示了能力溢出到冻结的基础模型。

0 人收藏 0 人点赞
#sparse-autoencoders

理解边缘:稀疏自编码器追踪Transformer泛化的界限

arXiv cs.LG ↗ · 2026-06-26 缓存

本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈