可解释性

Anthropic Research 新闻

摘要

Anthropic 的可解释性团队致力于从内部理解大型语言模型,以增强 AI 安全性并促进积极成果,采用多学科交叉的研究方法。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:12

# 可解释性研究 来源:https://www.anthropic.com/research/team/interpretability 返回概览(https://www.anthropic.com/research) 可解释性团队的使命是发现并理解大型语言模型内部的运作机制,为 AI 安全与积极成果奠定基础。 ### 通过理解实现安全 在不理解神经网络的情况下,很难对其安全性进行推理。可解释性团队的目标是能够详细解释大型语言模型的行为,并利用这一点解决从偏见到滥用再到自主有害行为等各类问题。 ### 多学科方法 部分可解释性研究人员拥有深厚的机器学习背景——团队中有成员常被视为开创了机制可解释性,另一位则参与了著名的 scaling laws 论文。其他成员则来自天文学、物理学、数学、生物学、数据可视化等领域。 - 2026年5月7日 可解释性 自然语言自编码器:将 Claude 的思维转化为文本(https://www.anthropic.com/research/natural-language-autoencoders) - 2026年4月2日 可解释性 大型语言模型中的情绪概念及其功能(https://www.anthropic.com/research/emotion-concepts-function) - 2026年3月13日 可解释性 AI 的"diff"工具:发现新模型中的行为差异(https://www.anthropic.com/research/diff-tool) - 2026年1月19日 可解释性 助手轴:定位与稳定大型语言模型的角色特征(https://www.anthropic.com/research/assistant-axis) - 2025年10月29日 可解释性 大型语言模型中的内省迹象(https://www.anthropic.com/research/introspection) - 2025年8月1日 可解释性 人格向量:监控与控制语言模型中的角色特质(https://www.anthropic.com/research/persona-vectors) - 2025年5月29日 可解释性 开源电路追踪工具(https://www.anthropic.com/research/open-source-circuit-tracing) - 2025年3月27日 可解释性 追踪大型语言模型的思维(https://www.anthropic.com/research/tracing-thoughts-language-model) - 2025年3月13日 对齐 审计语言模型中的隐藏目标(https://www.anthropic.com/research/auditing-hidden-objectives) - 2025年2月20日 可解释性 跨编码器模型差异分析洞见(https://www.anthropic.com/research/crosscoder-model-diffing) 查看更多(https://www.anthropic.com/research/team/interpretability#)

相似文章

激进AI可解释性

arXiv cs.AI

本文借鉴激进解释哲学和机械可解释性工具,构建了一个将AI系统解释为智能体的框架,探讨如何通过理解系统的信念、欲望和意义来信任AI系统。

AIMO Interpretability Challenge

arXiv cs.AI

AIMO Interpretability Challenge 是一项旨在利用可解释性方法区分前沿数学语言模型中的稳健推理与虚假推理的竞赛,提供新问题、模型访问权限和计算基础设施。

可解释性应具备可操作性

arXiv cs.LG

本文主张,可解释性研究应基于“可操作性”进行评估,即研究成果在多大程度上能够促成具体的决策与干预措施。作者提出了一套与实际应用结果相一致的评估标准框架,以解决当前可解释性工作缺乏现实影响力的问题。