标签
This paper investigates exact deletion from language-model memory, showing that subtractive methods work when record influence is addressable, while replay/rebuild is needed when influence is woven into recurrent state. Experiments on Gemma and Kimi hybrid models demonstrate trade-offs in utility and exactness.
本文提出一个框架,通过加权合并从多个大语言模型中提取的有向无环图(DAGs)来集成其推理结构,从而在多个基准测试中实现更准确、更具可解释性的共识推理。
FADEx 提出了一种新颖的局部逐实例特征归因方法,用于解释降维技术,利用泰勒展开和奇异值分解提供模型无关的解释和失真分析。
ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。
一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。
circuit-tracer 是一个 Python 库,帮助可解释性研究人员通过计算 transcoder 特征与输出 logits 之间的直接效应来映射模型计算,然后将它们可视化为交互式归因图。
本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。
本文主张应将大型语言模型中的概念视为一个设计轴心,沿着流水线阶段和基础维度映射设计空间,并提出从事后恢复概念转向设计明确的概念表示。
本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。
本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。
CADENCE 使用稀疏自编码器将心电图基础模型表示分解为可解释的生理概念,显著改善了与临床表型和波形形态的一致性。
本文证明,微调后的激活预言者会发展出概念特异性盲点,选择性地无法恢复在其自身训练期间持续存在的隐藏概念,这引发了对可学习可解释性接口的可靠性担忧。
本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。
介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。
提出了 Verbalized Particle Posterior (VPP),将言语化学习视为贝叶斯推断,通过维护一组自然语言假设作为粒子,使用 Metropolis-Hastings 或 Sequential Monte Carlo 更新,并在基准测试上优于单假设 VML。
本文系统评估了后训练量化如何影响使用Grad-CAM和LIME的CNN模型的可解释性,揭示分类准确性并非可解释性稳定性的可靠指标,并且架构选择对于可信部署至关重要。
作者认为,要求LLM生成自我评估的置信度分数在科学上是无效且具有误导性的,它只是一种心理安全把戏,而不是衡量正确性的可靠方法。
本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。
Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。