在开源权重语言模型中读取和引导材料科学机制的表示

Hugging Face Daily Papers 论文

摘要

本文表明,在开源权重的Gemma模型中,可以通过隐藏状态分析、因果干预和反事实基准来识别和控制材料科学机制,揭示了物理关系在状态变换中比在绝对状态中更为明显。

大型语言模型能够回答科学问题,但正确的输出并不能揭示模型是否表示或使用了支配性物理规律。在此,我们展示了开源权重的google/gemma-4-E4B-it模型中的材料科学机制信息具有三种实验可分离的形式:概念可在单个隐藏状态中读取,本构方向通过状态之间的受控变换来承载,以及选定的内部表示因果性地控制工程答案。我们结合了匹配的直接和雅可比词汇读数、无选项状态几何、一个60条定律的反事实基准以及因果干预。在50个保留的材料描述中,三个独立拟合的雅可比透镜重现了概念排名,并且来自两个读数的无目标词集使得对10个机制家族中的9个进行了盲法识别。另一个72条提示的基准产生了机制特定的隐藏状态邻域,但精确的图审计显示,这种表面上的物理组织同样可以通过数值比较来解释。因此,我们比较了其他方面相同但物理输入方向相反的提示,询问结果中的隐藏状态移动是否遵循所提供的本构定律。这些状态变换将直接定律、物理中性定律和反向定律在60个冻结关系上进行了排序,并正确定向了40个方向定律中的39个,而词汇控制接近随机。双向干预在所有12个匹配案例中使答案概率向物理适当结果或偏离该结果的方向移动,而反事实状态修补则在机制和答案格式之间传递了相反的决策信号。因此,物理关系在受控状态变化中比仅在绝对状态中更为明显。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:09

论文页面 - 读取与操控开放权重语言模型中材料科学机制的表示

来源:https://huggingface.co/papers/2607.20058

大型语言模型能够回答科学问题,但正确的输出并不能揭示模型是否真正表示或使用了其中的物理学原理。本文展示了开放权重模型 google/gemma-4-E4B-it 中材料科学机制信息具有三种实验上可分离的形式:概念可被读取于单个隐藏状态中,本构方向由状态之间的受控变换承载,而选定的内部表示对工程类答案具有因果控制作用。

我们结合了匹配的直接读取与雅可比词汇读取、无选项的状态几何、一个包含 60 条定律的反事实基准以及因果干预。在 50 个保留的材料描述文本中,三个独立拟合的雅可比透镜重现了概念排序,而来自两种读取方式的无目标词汇集使得能够在盲法条件下识别出 9 个(共 10 个)机制家族。

一个独立的 72 提示词基准生成了机制特定的隐藏状态邻域,但精确的图审计表明,这种看似物理性的组织方式同样可以通过数值比较来加以解释。因此,我们对比了仅改变物理输入方向的其他相同提示,探究由此产生的隐藏状态移动是否遵循所提供本构定律。这些状态变换对 60 个冻结关系中的直接、物理中性及反比定律进行了排序,并在 40 个方向性定律中正确定向了 39 个,而词汇控制的结果接近随机水平。

在所有 12 个匹配案例中,双向干预使得答案概率朝物理上适宜的结果方向偏移或远离该结果,而反事实状态修补则在机制与答案格式间传递了相反的决策信号。因此,物理关系在受控的状态变化中比在绝对状态本身中更为可见。

相似文章

解构并引导大型语言模型中的功能性元认知

arXiv cs.CL

本研究探讨了大型语言模型中的功能性元认知,证明诸如评估意识和自我评估能力等内部状态可以从残差流激活中线性解码。作者提出了一个机械机制框架来引导这些状态,展示了对推理行为、冗长度及安全响应的因果控制。

通过标题特定激活引导控制工具使用

arXiv cs.AI

本文研究大型语言模型中的工具使用决策是否具有稳定的内部表征,这些表征可以通过激活引导(Activation Steering)提取和操控,并展示了在五个开源模型和三个领域中,标题特定引导向量可以抑制不必要的工具使用。几何分析揭示,工具调用步骤表现出弥散的双峰对齐,而非参数化基础概念所预期的清晰线性结构。