扩展固有可解释语言模型
摘要
本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。
查看缓存全文
缓存时间: 2026/08/11 06:19
论文页面 - 扩展本质上可解释的语言模型
摘要
可解释性常常被视为一种对能力的损耗:语言模型作为不透明系统进行训练,随后在事后加以解释,而所用方法的可靠性难以确定。在这项工作中,我们挑战了这一前提。我们不是对模型进行逆向工程,而是将可解释性作为训练流程中的一个约束条件,与语言建模目标一同优化。在跨越三个数量级的计算规模上,无论是自回归语言模型还是扩散语言模型,可解释性都随能力提升而增强,而非与之相悖。令人惊讶的是,随着规模扩大,模型表征变得更加解耦,并且与人类可理解的概念更加对齐。我们用 Steerling-8B 实例化了这一训练时方案,它是一个带有因果注意力掩码的扩散语言模型。对于任意一组生成的 token,Steerling-8B 都将输出归因于相关的输入 token、人类可理解的概念以及训练数据。这实现了闭环干预:通过概念或特征归因诊断输出,检索相似训练数据,并在无需重新训练的情况下通过概念引导纠正行为。Steerling-8B 仍然与使用大量(2-16 倍)更多算力训练的开源同类模型具有竞争力,这表明了一种不同的扩展范式:可解释性可以被设计进入训练,并随规模扩大而改进。
查看 arXiv 页面 (https://arxiv.org/abs/2608.07594)查看 PDF (https://arxiv.org/pdf/2608.07594)项目页面 (https://www.guidelabs.ai/papers/scaling-inherently-interpretable-language-models/)GitHub238 (https://github.com/guidelabs/steerling)添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2608.07594)
引用此论文的模型0
暂无模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。
引用此论文的数据集0
暂无数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。
引用此论文的 Spaces0
暂无 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。
包含此论文的合集0
暂无合集包含此论文
将此论文添加到集合 (https://huggingface.co/new-collection)中,即可从本页面链接到它。
相似文章
论大语言模型的固有可解释性:设计原则和架构调查
一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。
语言模型中的跨架构引导迁移:一项系统性实证研究
一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。
不破坏的引导:基于机制的离散扩散语言模型干预
本文介绍了一种新颖的自适应调度器,用于利用稀疏自编码器引导离散扩散语言模型,结果表明,基于特定属性提交时机进行针对性干预,比均匀方法能提升控制质量和强度。
应用于大语言模型的可解释性研究:对比分析
一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。
我们能理解大语言模型是如何推理的吗?
本文探讨了理解大语言模型推理方式的现有努力和挑战,重点关注可解释性研究。