面向日常用户的机制可解释性简化工具😎 🧠

Reddit r/LocalLLaMA 工具

摘要

一款名为 CORTEX // MODEL OBSERVATORY 的新开源工具简化了本地 LLM 的机制可解释性,让日常用户也能轻松使用,支持 GPT2 和 Llama 架构。

背景:我想为社区提供一个开放研究(嗯,在 Apache 2.0 条款下开放)工具,让像我们这样的日常用户能够更深入地审视我们一直在使用的本地模型。将机制可解释性简化成更直观的工作流程。初学者易读,专家可深入。最初围绕 GPT2 和 Llama 架构设计,它至少支持大多数本地 LLM 的第一层生成观察(我只是一个人,所以如果你的模型不受支持,请别 @ 我😆。我会继续逐步添加支持的,哈哈)🫪🧠 这个工具叫做 "CORTEX // MODEL OBSERVATORY",我想澄清一下,它的创建过程中有人工智能辅助,否则我可能需要一个完整的研究部门😭😂 如果你对 AI 的工作原理着迷,欢迎随意折腾这个应用,添加你自己的补充/支持或集成。我想帮助社区一起学习更多。一如既往,欢迎尽你所能去破坏这个东西,这样我才能让它对每个人(包括 AI 研究者)都更好、更可靠。现在它已经在 GitHub 上供大家使用了😀 https://github.com/TurboDash99/Cortex
查看原文

相似文章

@GitHub_Daily: 大语言模型内部是如何工作的,为什么会产生幻觉,为什么有时答非所问,想深入了解这些。 可以看下 Awesome LLM Interpretability 这份资源合集,提供一整套拆解 AI 黑盒的系统路径。 涵盖从注意力可视化、神经元分析到…

X AI KOLs Timeline

介绍了一个名为 Awesome LLM Interpretability 的资源合集,汇集了多种可解释性工具、论文和社区资源,帮助理解大语言模型的内部工作机制。

LLMs 并非你所认为的黑箱

Hacker News Top

一篇总结 Anthropic 2025 年关于机制可解释性论文的文章,表明 LLM 并非黑箱,电路追踪可以揭示多步推理和人类可识别的概念。