标签
本文对指令调优下LLM中的知识冲突回路进行了机制性比较,发现调优是门控而非重新布线这些回路,跨越多个模型家族,对可解释性具有影响。
论文介绍了Matryoshka Attribution(MAttr),一种用于将语言模型输出归因到内部组件的掩码学习方法,在Mechanistic Interpretability Benchmark上取得了顶尖性能,并展示了通过调整权重来修改大语言模型行为的实际应用。
本文对 Hierarchical Reasoning Models (HRM) 进行机制分析,以理解其在潜在空间中的内部推理过程,采用因果干预和稀疏自编码器等技术,在数独和 ARC-AGI-2 等任务上展开研究。
该论文介绍了MechaTerp-TRACE,一种用于语言模型组件消融分析的方法,发现实体知识主要来源于通用生成机制,而非局部组件。
本文揭示,在全模态大语言模型中,用于线性探测读取概念的最佳层与用于激活操控的最佳层并不相同,这挑战了表征工程领域的普遍经验法则。
文章探讨了如果人工智能行业遵循其自身关于灾难性风险的研究,它可能会暂停开发的情况,重点介绍了Anthropic在AI欺骗和机制可解释性方面的发现。
本文提出了一种四阶段的机制分解,描述大型语言模型如何解答数学应用题,并通过特定的注意力头将脆弱性从无关子句定位到操作规划阶段。
该论文发现,在语言模型中,事实回忆期间,关系类型信息比实体特定信息更早地成为控制生成的因素,表明存在一种时间不对称性,且在多种模型和提示系列中均表现稳健。
这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。
诱骗方向优化 (DDO) 是一种快速、后置的防御方法,通过向网络注入诱骗信号,保护开放权重的LLM免受拒绝特征消融攻击,在比训练防御更低的成本下实现高鲁棒性。
本文证明,用户输入中的普通拼写错误可以显著降低旨在检测LLMs中提示注入的激活探测器的有效性,但提出了一种KV-cache分叉方法,可以恢复大部分性能损失。
该论文在大型语言模型中识别出有害性传播动态,并介绍了 Herald,一个轻量级的输入调节器,它利用跨层激活模式高效检测有害提示。
本文提出了一种数学框架,用于逆向工程 Transformer 模型,以增强机制可解释性并解决 AI 系统中的安全问题。
本论文提出通过内部表示来校准智能体系统的置信度,在多轮基准测试中展示了其相对于基线方法的性能提升。
Capsule Lens 是一个用于机制可解释性的框架,它使用几何胶囊来定位和追踪概念如何在神经网络表征中编码,从而支持对模型静态和动态内部状态的分析。
本文介绍了一种对比投影技术,通过差分配对提示的逻辑透镜来读取Transformer内部状态,从而能够识别不同架构(如Phi-2)中计算特有的差异。
本文介绍了 SAEScientist-Bench,一个用于评估 AI 智能体自主使用稀疏自编码器进行机制可解释性研究能力的基准,揭示了进展但与专家基准相比仍有显著差距。
ObserverBench是一个基准框架,旨在通过报告估计准确性和下游行动性能来评估AI模型中的内部估计器是否适合指导干预、控制或安全任务。
本文通过Gemma-3-27B-PT的机制可解释性方法,提取抑郁症症状向量并与临床医生判断进行对齐,证明了可解释临床评估工具的应用前景。
本文介绍了一种机理方法,通过描述一个用于拒绝行为的电路并使用电路引导的权重缩放来提升LLM安全性,在攻击下将安全率提升了26.5%,同时仅导致最小的准确率损失。