面向日常用户的机制可解释性简化工具😎 🧠
摘要
一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。
背景:我想为社区提供一个开放研究(嗯,在 Apache 2.0 条款下开放)工具,让像我们这样的日常用户能够更深入地审视我们一直在使用的本地模型。将机制可解释性简化成更直观的工作流程。初学者易读,专家可深入。最初围绕 GPT2 和 Llama 架构设计,它至少支持大多数本地 LLM 的第一层生成观察(我只是一个人,所以如果你的模型不受支持,请别 @ 我😆。我会继续逐步添加支持的,哈哈)🧠 这个工具叫做 "CORTEX // MODEL OBSERVATORY",我想澄清一下,它的创建过程中有人工智能辅助,否则我可能需要一个完整的研究部门😭😂 如果你对 AI 的工作原理着迷,欢迎随意折腾这个应用,添加你自己的补充/支持或集成。我想帮助社区一起学习更多。一如既往,欢迎尽你所能去破坏这个东西,这样我才能让它对每个人(包括 AI 研究者)都更好、更可靠。现在它已经在 GitHub 上供大家使用了😀 https://github.com/TurboDash99/Cortex
相似文章
@rewind02: 一位斯坦福教授刚刚做了一场公开讲座,详细讲解了GPT、Claude和LLaMA在底层是如何构建的,无需内部权限…
一位斯坦福教授举办了一场公开讲座,全面剖析了GPT、Claude和LLaMA等现代LLM的底层构建方式,让大众也能了解先进的架构。
@GitHub_Daily: 大语言模型内部是如何工作的,为什么会产生幻觉,为什么有时答非所问,想深入了解这些。 可以看下 Awesome LLM Interpretability 这份资源合集,提供一整套拆解 AI 黑盒的系统路径。 涵盖从注意力可视化、神经元分析到…
介绍了一个名为 Awesome LLM Interpretability 的资源合集,汇集了多种可解释性工具、论文和社区资源,帮助理解大语言模型的内部工作机制。
MechELK:一种用于从大型语言模型中引出潜在知识的机制可解释性框架
MechELK 是一个三阶段框架,结合机制可解释性工具(SAE、激活修补、因果探测)与表示工程,从大型语言模型中引出潜在知识,实现了84.7%的准确率,优于CCS和线性探测等现有方法。
@DanKornas: LLM 可解释性是个深坑。这个仓库为你提供了地图。Awesome LLM Interpretability 是一个精选的 GitHub 列表……
这是一个精选的 GitHub 列表,汇总了 LLM 可解释性领域的工具、论文和社区,帮助研究人员高效地了解该领域。
LLMs 并非你所认为的黑箱
一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。