interpretability

标签

Cards List
#interpretability

Subtract or Replay? Exact Deletion from Language-Model Memory

arXiv cs.LG · 2026-07-31 缓存

This paper investigates exact deletion from language-model memory, showing that subtractive methods work when record influence is addressable, while replay/rebuild is needed when influence is woven into recurrent state. Experiments on Gemma and Kimi hybrid models demonstrate trade-offs in utility and exactness.

0 人收藏 0 人点赞
#interpretability

推理共识:基于加权DAG聚合的LLM推理结构集成

arXiv cs.CL · 2026-07-31 缓存

本文提出一个框架,通过加权合并从多个大语言模型中提取的有向无环图(DAGs)来集成其推理结构,从而在多个基准测试中实现更准确、更具可解释性的共识推理。

0 人收藏 0 人点赞
#interpretability

FADEx:基于特征归因与失真的降维解释

arXiv cs.LG · 2026-07-31 缓存

FADEx 提出了一种新颖的局部逐实例特征归因方法,用于解释降维技术,利用泰勒展开和奇异值分解提供模型无关的解释和失真分析。

0 人收藏 0 人点赞
#interpretability

ECG-InterpBench:使用匹配尺度稀疏自编码器对ECG基础模型可解释性进行基准测试

arXiv cs.LG · 2026-07-31 缓存

ECG-InterpBench 是一个新基准,利用匹配尺度稀疏自编码器系统评估 ECG 基础模型表示的可解释性,涵盖重建保真度、临床概念可访问性以及跨 450 个单元的可重复性。

0 人收藏 0 人点赞
#interpretability

面向日常用户的机制可解释性简化工具😎 🧠

Reddit r/LocalLLaMA · 2026-07-30

一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。

0 人收藏 0 人点赞
#interpretability

@DanKornas: 将模型输出转换为可检查的归因图,而不是猜测哪些内部特征做出了贡献。circ…

X AI KOLs Timeline · 2026-07-30 缓存

circuit-tracer 是一个 Python 库,帮助可解释性研究人员通过计算 transcoder 特征与输出 logits 之间的直接效应来映射模型计算,然后将它们可视化为交互式归因图。

0 人收藏 0 人点赞
#interpretability

相同证据,不同目标:从语言模型状态解码诊断证据如何关联因果问题

arXiv cs.CL · 2026-07-30 缓存

本文研究语言模型是否能正确判断诊断证据如何支持或挑战不同的因果主张,并引入了仅改变因果目标的配对提示。在Qwen2.5-7B-Instruct等模型的倒数第二个Transformer隐藏状态上进行的线性读出显示,平衡准确率适中(0.654-0.659),并在49对中恢复了18-21对,表明因果相关性具有一定程度的线性可解码性。

0 人收藏 0 人点赞
#interpretability

从发现到设计:概念作为大型语言模型的设计轴心

arXiv cs.CL · 2026-07-30 缓存

本文主张应将大型语言模型中的概念视为一个设计轴心,沿着流水线阶段和基础维度映射设计空间,并提出从事后恢复概念转向设计明确的概念表示。

0 人收藏 0 人点赞
#interpretability

不对齐有个性:基于大五人格的涌现不对齐解释

arXiv cs.CL · 2026-07-30 缓存

本文介绍了从语言模型中提取的大五人格特质的人格向量,为涌现不对齐提供了可解释的解释。研究表明,不对齐的微调会导致模型人格沿着特定特征变化(低宜人性和尽责性,高外向性和神经质),为安全现象提供了人类可读的诊断特征。

0 人收藏 0 人点赞
#interpretability

超越几何互补性:稀疏混合专家路由中的一致性重叠

Hugging Face Daily Papers · 2026-07-30 缓存

本文引入专家子空间分离指数(ESSI),以解耦稀疏混合专家语言模型中的路由连贯性、候选质量以及候选与上下文之间的交互,揭示了一种一致性重叠模式:路由从共享的几何邻域中选择与 token 相关的专家,而多专家计算仍然有用。

0 人收藏 0 人点赞
#interpretability

CADENCE:一种用于从心电图基础模型中可解释性神经概念提取的心脏原子词典

arXiv cs.AI · 2026-07-29 缓存

CADENCE 使用稀疏自编码器将心电图基础模型表示分解为可解释的生理概念,显著改善了与临床表型和波形形态的一致性。

0 人收藏 0 人点赞
#interpretability

当激活预言者学会不读取:微调预言者中的概念特异性盲点

arXiv cs.CL · 2026-07-28 缓存

本文证明,微调后的激活预言者会发展出概念特异性盲点,选择性地无法恢复在其自身训练期间持续存在的隐藏概念,这引发了对可学习可解释性接口的可靠性担忧。

0 人收藏 0 人点赞
#interpretability

解释GAND:性别模糊自然数据与对比归因资源

arXiv cs.CL · 2026-07-28 缓存

本文介绍了GAND,这是一个用于分析机器翻译中性别偏见的性别模糊自然英语句子的基准测试资源,并利用对比翻译进行可解释性分析,以揭示影响性别分配的源词。

0 人收藏 0 人点赞
#interpretability

Tokengeist: 智能体对话中的多轮归因追踪

arXiv cs.AI · 2026-07-28 缓存

介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。

0 人收藏 0 人点赞
#interpretability

面向语言模型机制审计的参考特征图谱

arXiv cs.AI · 2026-07-28 缓存

提出用于审计语言模型的参考特征图谱,能够高效地在模型间迁移特征库,并揭示模型特定的异常。

0 人收藏 0 人点赞
#interpretability

Verbalized Particle Posterior: 自然语言假设上的贝叶斯推断

arXiv cs.LG · 2026-07-28 缓存

提出了 Verbalized Particle Posterior (VPP),将言语化学习视为贝叶斯推断,通过维护一组自然语言假设作为粒子,使用 Metropolis-Hastings 或 Sequential Monte Carlo 更新,并在基准测试上优于单假设 VML。

0 人收藏 0 人点赞
#interpretability

相同的预测,不同的原因:量化对模型解释的影响

arXiv cs.LG · 2026-07-28 缓存

本文系统评估了后训练量化如何影响使用Grad-CAM和LIME的CNN模型的可解释性,揭示分类准确性并非可解释性稳定性的可靠指标,并且架构选择对于可信部署至关重要。

0 人收藏 0 人点赞
#interpretability

不要向LLM询问置信度分数

Hacker News Top · 2026-07-28 缓存

作者认为,要求LLM生成自我评估的置信度分数在科学上是无效且具有误导性的,它只是一种心理安全把戏,而不是衡量正确性的可靠方法。

0 人收藏 0 人点赞
#interpretability

看见还是知道?多模态大语言模型中的视觉上下文敏感性

Hugging Face Daily Papers · 2026-07-28 缓存

本文探讨了当视觉证据与语言先验冲突时,多模态大语言模型为何在视觉中心任务上失败,引入了WhatIfVis基准,并表明模型通常能编码视觉证据,但无法可靠地控制对其的依赖。

0 人收藏 0 人点赞
#interpretability

@SwissCognitive: Claude的J-space揭示了内部处理过程的线索,但它并非推理的可读转录,这是一个重要的限制…

X AI KOLs Timeline · 2026-07-27 缓存

Anthropic对Claude内部'J空间'的研究揭示了模型处理推理过程的线索,但它并非完整的可读转录,凸显了AI可解释性的关键局限性。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈