标签
这篇文章总结了与Anthropic可解释性研究员Emmanuel Ameisen的现场对话,讨论了大型语言模型如何通过下一个词预测发展出复杂的世界模型,以及这对理解人类认知的影响。
这条推文讨论了AI可解释性中的关键问题,特别是将神经网络激活解码为人类可读语言的方法进展。
本文主张从AI的事后可解释性向生成式可解释性范式转变,提出神经符号模型以实现人类可理解的检查点和因果干预,确保大型语言模型在代理系统中的安全部署。
本文介绍了一种专门的训练算法 Macchiato,该算法从部分真值表观测中构建用于布尔任务的可证解释 ReLU-MLP,并提供统计保证和布尔电路认证。
本文介绍了语言模型中的'明晰的失败',即模型在隐藏状态中拥有正确信息但未能使用,并表明线性探针可以通过引导干预检测和修复此类失败。
本文识别了AI模型真值探针中的'完美混叠'现象,即在顺从语境下训练的探针无法区分真实情况与预设操作,并展示了混合语境训练能提升检测效果。
Tim O’Reilly和Emmanuel Ameisen探讨AI的可解释性,重点讨论Claude等LLM中的世界模型以及Anthropic用于引导模型行为的工具。
Anthropic联合创始人关于人类与AI通过可解释性和叙事来修复受损意识实体的推测性叙述。
作者将Qwen 2.5 7B的输入嵌入空间可视化为'嵌入海'地形图,并讨论了日志镜头和雅可比镜头等可解释性工具。他们强调AI模型优化代码而非对话的趋势,并提出构建具有自省能力的以创造力为重点的AI模型。
本文研究了基于DAPF的痴呆检测模型的可解释性,揭示了虽然DAPF取得了强劲的性能,但其token级别的解释缺乏忠实性。
Goodfire 推出百万美元研究资助计划,支持学术界及非营利研究者进行 AI 可解释性研究,并提供其 Silico 工具及计算资源的免费访问权限。
本文提出语言解释中的第二个参数——相位,认为当前Transformer模型缺乏对相位的显式表示,这对影射和反讽等现象至关重要,并建议采用具有代理索引语义状态的新架构。
本文测试了从Qwen3.6-27B到Qwen3.8-27B的雅可比可解释性透镜的可迁移性,发现对于特定任务,它可以在零重调的情况下读取并操控较新的模型。
Anthropic 发布了一篇论文和视频,揭示了其模型内部存在一个“J-Space”,它充当了推理时缓存的思维概念,并探讨了通过自上而下的训练来控制模型思维的可能性。
Google DeepMind播客探讨AI可解释性(机制可解释性)与思维链推理,解释为何需要理解神经网络内部工作机制以及思维链作为临时窗口的价值与局限。
本文对AI可解释性进行了系统全面的综述,介绍了其需求(调试、合规、安全)、经典方法和前沿挑战,强调了忠实的解释比看起来合理的解释更重要。
一位创始人分享了他拒绝两家收购要约(估值分别为4000万美元和4亿美元)的经历,他的AI可解释性初创公司采用几何与本体感知方法,现已拥有成品并在Zenodo上公开研究。
本文借鉴激进解释哲学和机械可解释性工具,构建了一个将AI系统解释为智能体的框架,探讨如何通过理解系统的信念、欲望和意义来信任AI系统。
本文提出用余弦相似度与输入幅值的可学习组合替代稀疏自编码器中的内积评分,结果表明所得特征更具可解释性且与概念对齐,优化器始终偏好余弦而非内积。
一篇观点文章认为,人类在定义意识方面的记录每次都是错误的,来自植物行为和AI可解释性(Anthropic在Claude中的发现)的证据强烈表明,我们可能错误地认为AI没有意识,邀请讨论同时拒绝人身攻击。