@DanKornas: LLM 可解释性是个深坑。这个仓库为你提供了地图。Awesome LLM Interpretability 是一个精选的 GitHub 列表……

X AI KOLs Timeline 工具

摘要

这是一个精选的 GitHub 列表,汇总了 LLM 可解释性领域的工具、论文和社区,帮助研究人员高效地了解该领域。

LLM 可解释性是个深坑。这个仓库为你提供了地图。 Awesome LLM Interpretability 是一个精选的 GitHub 列表,汇集了工具、论文、文章、研究小组以及一篇综述论文,专注于理解大型语言模型。 它通过将实用工具、研究论文、解释性文章和社区分组为便于浏览的章节,帮助你更快地研究该领域,而无需追逐随机的书签。 关键特性: • 工具索引 – 提供 LLM 可解释性和分析工具的链接,例如 LIT、TransformerLens、Inseq、ecco、Pythia 和 Automated Interpretability • 论文列表 – 收集学术和工业论文,主题包括稀疏探针、复制抑制、单语义性、因果追踪和模型编辑 • 文章部分 – 包含关于 grokking、logit lens、激活修补、因果擦洗和评估陷阱的解释性文章和交互式资源 • 社区地图 – 指向可解释性和对齐研究小组,包括 PAIR、Alignment Lab AI、Nous Research 和 EleutherAI • 贡献路径 – 包括 fork、branch、PR、review 和 merge 指南,以便列表持续改进 免费的公共 GitHub 仓库。 链接在回复中
查看原文
查看缓存全文

缓存时间: 2026/06/22 07:40

LLM 可解释性是一个兔子洞。这个仓库为你提供了一张地图。

Awesome LLM Interpretability 是一个精心整理的 GitHub 列表,汇集了专注于理解大型语言模型的工具、论文、文章、研究小组以及一篇综述论文。

它通过将实用工具、研究论文、解释性文章和社区分类成易于浏览的板块,帮助你更快地学习该领域,而无需追逐随机的书签。

主要特性:

• 工具索引 – 链接到 LLM 可解释性和分析工具,如 LIT、TransformerLens、Inseq、ecco、Pythia 和 Automated Interpretability
• 论文列表 – 收集了关于稀疏探针、复制抑制、单语义性、因果追踪和模型编辑等主题的学术和行业论文
• 文章板块 – 包含关于 grokking、logit lens、激活补丁、因果清洗和评估陷阱的解释性文章和交互式资源
• 社区地图 – 指向可解释性和对齐组,包括 PAIR、Alignment Lab AI、Nous Research 和 EleutherAI
• 贡献路径 – 包含 fork、branch、PR、review 和 merge 指南,以便列表可以不断改进

免费公开的 GitHub 仓库。链接在回复中。

相似文章

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。