@DanKornas: LLM 可解释性是个深坑。这个仓库为你提供了地图。Awesome LLM Interpretability 是一个精选的 GitHub 列表……
摘要
这是一个精选的 GitHub 列表,汇总了 LLM 可解释性领域的工具、论文和社区,帮助研究人员高效地了解该领域。
查看缓存全文
缓存时间: 2026/06/22 07:40
LLM 可解释性是一个兔子洞。这个仓库为你提供了一张地图。
Awesome LLM Interpretability 是一个精心整理的 GitHub 列表,汇集了专注于理解大型语言模型的工具、论文、文章、研究小组以及一篇综述论文。
它通过将实用工具、研究论文、解释性文章和社区分类成易于浏览的板块,帮助你更快地学习该领域,而无需追逐随机的书签。
主要特性:
• 工具索引 – 链接到 LLM 可解释性和分析工具,如 LIT、TransformerLens、Inseq、ecco、Pythia 和 Automated Interpretability
• 论文列表 – 收集了关于稀疏探针、复制抑制、单语义性、因果追踪和模型编辑等主题的学术和行业论文
• 文章板块 – 包含关于 grokking、logit lens、激活补丁、因果清洗和评估陷阱的解释性文章和交互式资源
• 社区地图 – 指向可解释性和对齐组,包括 PAIR、Alignment Lab AI、Nous Research 和 EleutherAI
• 贡献路径 – 包含 fork、branch、PR、review 和 merge 指南,以便列表可以不断改进
免费公开的 GitHub 仓库。链接在回复中。
相似文章
@DanKornas: 阅读LLM研究时,每换个主题就要重新搜索,效率很低。Awesome-LLM-Survey 是一个按主题组织的集合…
Awesome-LLM-Survey 是一个按主题组织的 GitHub 仓库,汇集了 LLM 综述论文和项目链接,帮助研究人员快速找到涵盖训练、提示、模态和应用等方面的概览。
@DanKornas: 跟踪LLM系统研究变得混乱,当论文、报告、框架和课程链接散落在各处…
LLMSys-PaperList 是一个在GitHub上精心策划的阅读列表,它将LLM系统研究论文和资源组织成实用的类别,如训练系统、服务系统和多模态覆盖,帮助AI/ML工程师和研究人员保持更新。
LLMs 并非你所认为的黑箱
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。
@DanKornas:LLM评估是大多数AI演示开始成为真正系统的地方。LLM-Evaluation是一个公共GitHub资源,包含研讨会幻灯片…
一条推文宣布了LLM-Evaluation,这是一个公共GitHub仓库,包含用于评估LLM、生成式AI和RAG系统的研讨会幻灯片、示例笔记本、提示词和参考链接,旨在提供评估工作流的实用地图。
我在构建过程中记录下了每个让我困惑的LLM术语,整理后将其开源。
作者整理了一份包含困惑LLM术语的词汇表,并附有面向生产的解释,然后进行清理,以可浏览的UI形式在GitHub上开源。