@DanKornas: 将模型输出转换为可检查的归因图,而不是猜测哪些内部特征做出了贡献。circ…
摘要
circuit-tracer 是一个 Python 库,帮助可解释性研究人员通过计算 transcoder 特征与输出 logits 之间的直接效应来映射模型计算,然后将它们可视化为交互式归因图。
查看缓存全文
缓存时间: 2026/07/31 00:45
将模型输出转化为可检查的归因图,而不是猜测哪些内部特征起了作用。
circuit-tracer 是一个面向可解释性研究人员和机器学习构建者的 Python 库,用于检查基于预训练跨编码器构建的电路。
它通过计算跨编码器特征、误差节点、输入 token 和输出 logits 之间的直接效应,并将这些结果转化为归因图,帮助你映射模型的计算过程。
主要特性: • 电路归因 – 计算特征到特征以及特征到 logits 的直接效应。 • 交互式可视化 – 在本地提供图形服务,支持浏览、固定、分组和标注。 • 特征干预 – 将跨编码器特征设置为选定值,以便观察输出变化。 • 多种工作流程 – 支持通过 Neuronpedia、Python 或 Jupyter 以及命令行界面运行。 • 实用演示 – 包含针对 Gemma 2、Llama 3.2、归因目标和干预操作的教程。
该项目采用开源许可证(MIT)。
回复中的链接
相似文章
转码器追踪视觉语言模型中的视觉定位与幻觉现象
本文提出了一种以功能为中心的框架,利用转码器追踪视觉语言模型中的计算路径,展示了更强的视觉定位归因能力,并通过基于图的特征预测幻觉现象。
剪枝、解释与评估:一种基于特征归因的跨层转码器原生高效电路发现框架
研究人员推出了 PIE,这是一种面向跨层转码器(CLT)的原生框架,通过基于特征归因的剪枝技术实现高效的电路发现。该方法在特征选择上实现了约 40 倍的压缩,同时成功保持了 IOI 和 Doc-String 任务的行为保真度。
Tokengeist: 智能体对话中的多轮归因追踪
介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。
LLMs 可以标注归因图
本文提出了一种简单的流水线,利用 LLM 自动将特征分组为归因图中的超节点,达到了与人类标注者相当的可解释性,并在一个两跳任务中恢复了中间跳的超节点。
@yoheinakajima:这就是 activegraph 上编码智能体的样子——基本上你总能自动获得追踪和图形
Yohei Nakajima 分享了一个 activegraph 上编码智能体的演示,该智能体自动生成追踪和图形。