扩展固有可解释语言模型

Hugging Face Daily Papers 论文

摘要

本文介绍了Steerling-8B,一种以可解释性为约束训练的扩散语言模型,展示了可解释性随规模提升,并支持无需重新训练的概念引导。

可解释性常被视为能力上的代价:语言模型被训练为不透明系统,然后事后用可靠性难以确立的方法加以解释。在本文中,我们挑战这一前提。我们不是对模型进行逆向工程,而是将可解释性作为训练流程的一个约束,与语言建模目标一起优化。在跨越三个数量级的计算量下,无论是自回归还是扩散语言模型,可解释性都随能力提升而提升,而非与之相悖。令人惊讶的是,随着规模增大,模型表示变得更加解缠,并与人类可理解的概念更加对齐。 我们用Steerling-8B实例化了这种训练时配方,这是一种带有因果注意力掩码的扩散语言模型。对于任意一组生成的词元,Steerling-8B均将输出归因于相关的输入词元、人类可理解的概念以及训练数据。这实现了闭环干预:通过其概念或特征归因来诊断输出,检索类似的训练数据,并通过概念引导来纠正行为,而无需重新训练。Steerling-8B仍然与用多2-16倍计算量训练的开源同类模型竞争,这表明了一种不同的扩展范式:可解释性可以设计到训练中,并随着规模提升而改善。
查看原文
查看缓存全文

缓存时间: 2026/08/11 06:19

论文页面 - 扩展本质上可解释的语言模型

摘要

可解释性常常被视为一种对能力的损耗:语言模型作为不透明系统进行训练,随后在事后加以解释,而所用方法的可靠性难以确定。在这项工作中,我们挑战了这一前提。我们不是对模型进行逆向工程,而是将可解释性作为训练流程中的一个约束条件,与语言建模目标一同优化。在跨越三个数量级的计算规模上,无论是自回归语言模型还是扩散语言模型,可解释性都随能力提升而增强,而非与之相悖。令人惊讶的是,随着规模扩大,模型表征变得更加解耦,并且与人类可理解的概念更加对齐。我们用 Steerling-8B 实例化了这一训练时方案,它是一个带有因果注意力掩码的扩散语言模型。对于任意一组生成的 token,Steerling-8B 都将输出归因于相关的输入 token、人类可理解的概念以及训练数据。这实现了闭环干预:通过概念或特征归因诊断输出,检索相似训练数据,并在无需重新训练的情况下通过概念引导纠正行为。Steerling-8B 仍然与使用大量(2-16 倍)更多算力训练的开源同类模型具有竞争力,这表明了一种不同的扩展范式:可解释性可以被设计进入训练,并随规模扩大而改进。

查看 arXiv 页面 (https://arxiv.org/abs/2608.07594)查看 PDF (https://arxiv.org/pdf/2608.07594)项目页面 (https://www.guidelabs.ai/papers/scaling-inherently-interpretable-language-models/)GitHub238 (https://github.com/guidelabs/steerling)添加到集合 (https://huggingface.co/login?next=%2Fpapers%2F2608.07594)

引用此论文的模型0

暂无模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。

引用此论文的数据集0

暂无数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。

引用此论文的 Spaces0

暂无 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2608.07594,即可从本页面链接到它。

包含此论文的合集0

暂无合集包含此论文

将此论文添加到集合 (https://huggingface.co/new-collection)中,即可从本页面链接到它。

相似文章

论大语言模型的固有可解释性:设计原则和架构调查

arXiv cs.CL

一份综合调查,回顾了大语言模型(LLM)固有可解释性的最新进展,将方法分为五个设计范式:功能透明性、概念对齐、表示可分解性、显式模块化和潜在稀疏性诱导。论文解决了在模型架构中直接构建透明性,而不是依赖事后解释方法的挑战。

语言模型中的跨架构引导迁移:一项系统性实证研究

arXiv cs.CL

一项系统性实证研究显示,当规模足够(≥1.7B参数)时,从一种语言模型中提取的概念方向可以引导其他独立训练的模型,为柏拉图式表征假说提供了功能上的证据,并突显了跨模型可解释性工具的规模阈值。

应用于大语言模型的可解释性研究:对比分析

arXiv cs.CL

一项对比研究,评估了三种可解释性技术(Integrated Gradients、Attention Rollout、SHAP)在微调 DistilBERT 模型上的表现,用于情感分类任务,重点突出了基于梯度、基于注意力和模型无关方法在大语言模型可解释性中的权衡。