@DanKornas: 将模型输出转换为可检查的归因图,而不是猜测哪些内部特征做出了贡献。circ…

X AI KOLs Timeline 工具

摘要

circuit-tracer 是一个 Python 库,帮助可解释性研究人员通过计算 transcoder 特征与输出 logits 之间的直接效应来映射模型计算,然后将它们可视化为交互式归因图。

将模型输出转换为可检查的归因图,而不是猜测哪些内部特征做出了贡献。 circuit-tracer 是一个 Python 库,适用于希望检查由预训练 transcoder 构建的电路的可解释性研究人员和 ML 构建者。 它通过计算 transcoder 特征、错误节点、输入 token 以及输出 logits 之间的直接效应来帮助您映射模型计算,然后将这些结果转换为归因图。 关键功能: • 电路归因 – 计算特征到特征以及特征到 logits 的直接效应。 • 交互式可视化 – 在本地提供图形,支持浏览、固定、分组和注释。 • 特征干预 – 将 transcoder 特征设置为选定值,以便观察输出变化。 • 多种工作流 – 通过 Neuronpedia、Python 或 Jupyter 以及命令行界面运行。 • 实用演示 – 包含 Gemma 2、Llama 3.2、归因目标和干预的教程。 它是开源的(MIT 许可证)。 回复中的链接
查看原文
查看缓存全文

缓存时间: 2026/07/31 00:45

将模型输出转化为可检查的归因图,而不是猜测哪些内部特征起了作用。

circuit-tracer 是一个面向可解释性研究人员和机器学习构建者的 Python 库,用于检查基于预训练跨编码器构建的电路。

它通过计算跨编码器特征、误差节点、输入 token 和输出 logits 之间的直接效应,并将这些结果转化为归因图,帮助你映射模型的计算过程。

主要特性: • 电路归因 – 计算特征到特征以及特征到 logits 的直接效应。 • 交互式可视化 – 在本地提供图形服务,支持浏览、固定、分组和标注。 • 特征干预 – 将跨编码器特征设置为选定值,以便观察输出变化。 • 多种工作流程 – 支持通过 Neuronpedia、Python 或 Jupyter 以及命令行界面运行。 • 实用演示 – 包含针对 Gemma 2、Llama 3.2、归因目标和干预操作的教程。

该项目采用开源许可证(MIT)。

回复中的链接

相似文章

Tokengeist: 智能体对话中的多轮归因追踪

arXiv cs.AI

介绍了Tokengeist,一种在智能体对话中跨多轮追踪归因的方法,揭示了平面归因方法的失败以及递归依赖图的必要性,在包含3,845个目标片段的基准测试(MTCABench)上达到了90%的源召回率。

LLMs 可以标注归因图

arXiv cs.LG

本文提出了一种简单的流水线,利用 LLM 自动将特征分组为归因图中的超节点,达到了与人类标注者相当的可解释性,并在一个两跳任务中恢复了中间跳的超节点。