Bielik 知道它不知道什么吗?激活分散性在模型规模上区分实体熟悉度与事实可靠性

arXiv cs.CL 论文

摘要

本文研究了波兰 Bielik 大语言模型中的激活模式是否能在生成前检测到实体熟悉度,使用了无监督的分散度量,在模型规模上实现了已知实体与虚构实体的近乎完美分离,同时表明事实可靠性随规模急剧提升,但更难从激活中预测。

arXiv:2607.07670v1 Announce Type: new 摘要:大型语言模型对从未见过的实体最容易产生幻觉。我们探究模型激活是否能在生成第一个答案令牌之前就暴露实体熟悉度,以及该信号是否能预测答案的事实可靠性。在四个波兰 Bielik 模型(1.5B-11B 参数)上,我们探查了四个实体领域(运动员、城市、作家、音乐家),每个领域包含 42 个知名实体、42 个鲜为人知但真实的实体和 42 个虚构实体,每个实体通过一个单句问题呈现(每个模型 504 个提示)。两种无监督、单次前向传播的分散度量——逆参与率和谱熵——作用于 SwiGLU MLP 激活之后,在所有领域和规模上以 AUROC 0.95-1.00 分离已知与虚构实体;有监督线性探测器的 AUROC 达到 0.99-1.00。两者均具有明显的选择感知排列下限约 0.70-0.74(经验 p≤1e-3),在保留层选择下依然有效(0.93-0.99),并在真实名称上持续有效(已知 vs. 鲜为人知但真实:0.96-1.00)。该信号跨实体类型迁移(平均非对角线 AUROC 0.92-0.99);匹配模板的反事实实验表明,唯一的大幅下降是由模板引起的,而非实体类型效应,且信号在各头之间弥散。这种表示信号在 1.5B 规模时已趋近上限,而行为层面的事实可靠性则急剧提升:在严格评判下,1.5B、4.5B、7B 和 11B 模型分别正确回答了 42 个已知运动员中的 0、2、10 和 19 个。在已知实体内,区分正确与幻觉答案要困难得多(探测器 0.93;分散性不比首令牌熵基线更好)。一个五样本语义熵基线在 5 倍推理成本下仅达到 0.71-0.83。尽管存在这种内部意识,模型几乎从不弃权:对 2,520 个答案的审计发现 2 次拒绝和 1 次含糊其辞。实体熟悉度与事实可靠性是不同标度曲线上的不同现象。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:50

# 别利克知道它所不知道的吗?激活分散度揭示了跨模型规模的实体熟悉度与事实可靠性

预印本。代码和数据可在项目仓库获取:https://github.com/agentGreg/bielik-hallucination-detection。来源:https://arxiv.org/html/2607.07670(2026年7月)

###### 摘要

大型语言模型(LLMs)最容易对它们从未见过的实体产生幻觉。我们探究一个问题:在模型生成第一个答案标记之前,其激活状态是否会泄露实体熟悉度——以及这一信号是否能说明答案的事实可靠性。在四个波兰语Bielik模型(1.5B–11B参数)上,我们探查了四个实体领域——运动员、城市、作家和音乐家——每个领域包含42个知名实体、42个真实但冷门的实体和42个虚构实体,每个实体由一个单句提问(每个模型504个提示)。两个无监督、单次前向传播的分散度指标,基于后SwiGLU MLP激活层计算——逆参与比和谱熵——在全部四个领域和所有模型规模上,都能以AUROC 0.95–1.00的精度区分已知实体和虚构实体;有监督的线性探针达到0.99–1.00。两者均显著高于考虑了层选择偏差的排列基线(约0.70–0.74,为每次排列重新选择最佳层的零假设的第95百分位;经验p≤10^{-3}),在留出法层选择条件下依然稳健(0.93–0.99),并且对真实名称同样有效:已知与真实但冷门实体的区分度达到0.96–1.00,因此虚构字符串伪影并非驱动因素。该信号可跨实体类型迁移:在一个领域上训练的探针在另一个领域上评估时,平均非对角线AUROC保持在0.92–0.99,唯一显著下降出现在提示模板同时发生变化的情况下(城市使用不同的问句主干)。一个匹配模板的反事实实验——将所有城市和作家统一提取到一个共享的中性问句主干下——显示这些下降是由模板引起的:在每种规模下,向城市迁移的性能恢复至0.999–1.000,只留下城市作为源领域时的残余不对称性(0.82–0.98)。逐头注意力熵分析表明该信号是弥散的,而非由少量固定的注意力头携带。对于这种对照任务,取两个指标中较优者,在1.5B规模时已达上限——熟悉度本身是否随规模提升而改善在此上限下无法分辨。相反,行为事实可靠性随规模急剧提升:在严格评判标准下,42个已知运动员中,1.5B、4.5B、7B和11B模型分别正确回答了0、2、10和19个(在宽松的关键事实规则下分别为6、16、24、33个)。在已知实体内部,区分正确答案和幻觉要困难得多:线性探针达到0.93,而分散度指标并不优于首个标记熵基线。一个五样本语义熵基线在已知vs虚构对照任务上以五倍推理成本达到AUROC 0.71–0.83,但在分散度失效的正确性对照任务上胜出(最高0.87)。尽管存在这种表征层面的感知,模型几乎从不拒绝回答:对所有2,520个采样得到的运动员答案进行LLM审计,发现2次拒绝和1次含糊回答(99.88%为直接断言),两次拒绝均来自最大模型。实体熟悉度与事实可靠性是不同的现象,遵循不同的标度律曲线。(行为标签、语义熵和拒绝审计仅针对运动员领域报告;其他三个领域携带基于条件的检测标签。)

## 1 引言

当LLM被问及它不知道的事情时,其内部状态与处理熟悉问题时的状态是否会有所不同?一个基于物理直觉的想法是肯定的:知识检索应类似于一种*局域化的*激发:紧凑、选择性的激活模式(记忆检索),而捏造则应表现为*离域化的*,激活在网络中广泛弥散。仅作为一种启发式类比,这种二分法让人联想到无序介质中的局域化与扩展本征态(Anderson, 1958 (https://arxiv.org/html/2607.07670#bib.bib4)),并暗示了廉价、无监督的集中度统计量:逆参与比(IPR)和激活分布的熵,通过单次前向传播计算,无需标签、无需采样、也无需辅助模型。

文献警告说,这种直觉的朴素版本几乎肯定是错误的。首先,大型语言模型始终具有强*上下文稀疏性*:对于任何给定的标记,大多数注意力头和大多数多层感知器(MLP)参数都可以被静默而几乎不影响输出,无论模型是否知道答案(Liu et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib21); Li et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib19))。"整个网络均匀点亮"并非实际存在的运行状态;如果存在信号,它必须是活动的*集中程度*在量化和几何上的差异,而非质的差异。其次,机制层面的工作将知识感知定位于*低维方向*而非全局激活体积:针对已知与未知实体触发的稀疏自编码器特征能够因果地调控拒绝和幻觉行为(Ferrando et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib13)),电路追踪分析发现"已知答案"特征的错误触发会产生幻觉(Lindsey et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib20))。全局的分散度度量很容易将这种方向性信号平均为噪声。

这留下了一个具体的(即使比以往更窄的)经验空白。用于幻觉检测的无监督单次前向传播分散度统计最近已经出现:D2HScore计算标记表示在层内的分散度加上层间漂移(Ding et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib9)),EigenTrack追踪生成过程中隐藏状态的协方差谱统计量,包括谱熵(Ettori et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib11)),MIND则利用伪标签生成构建无监督内部状态检测器(Su et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib34))。然而,所有这些方法都使用标记跨度或协方差级别的量对*生成的答案*进行评分。据我们所知,尚未被检验的是:将*闭合形式的、逐神经元的单个激活向量的分散度*(IPR和逐神经元谱熵——物理风格局域化统计量),在*提示点、任何答案标记生成之前*读取,作为*知识存在性*(而非答案层面的幻觉)的检测器——同时与监督上限(线性探针)、考虑了层选择偏差的排列基线、基于标记计数的词法基线以及标准多样本基线(语义熵)进行跨模型规模的系统对比。此外,尚无任何关于波兰语模型家族的内部状态幻觉研究:多语言共享任务Mu-SHROOM涵盖14种语言但不包括波兰语(Vázquez et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib36)),现有的多语言内部状态探针覆盖法语、孟加拉语和阿姆哈拉语(Alvi et al., 2026 (https://arxiv.org/html/2607.07670#bib.bib3))——而对波兰语命名实体的分词和波兰语领域的知识恰好是像Bielik(Ociepa et al., 2025a (https://arxiv.org/html/2607.07670#bib.bib28), b (https://arxiv.org/html/2607.07670#bib.bib29))这样的波兰语优先模型部署时所面对的准确条件。

我们在四个Bielik v3.0指令微调模型(1.5B、4.5B、一个11B,以及一个通过剪枝和蒸馏获得的7B Minitron变体)上,使用涵盖四个实体领域的三条件数据集进行测试:波兰运动员、城市、作家和音乐家。每个条件包含著名(已知)、真实但冷门(未知-真实)以及虚构但形态上合理的(虚构)实体,虚构名称的长度与著名名称大致匹配(残余不匹配被测量并作为每个领域的显式词法基线报告)。这四个领域让我们能够测试熟悉度信号是单一实体类型的属性还是跨领域泛化(参照Ferrando et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib13))。除了检测之外,我们(在运动员领域)测量了模型在相同实体上的*行为*可靠性:对于它可能知道的实体,它实际正确回答的频率,这使我们能够将表征信号和行为表型放在同一标度轴上。

#### 贡献

1. **对提示点的闭合形式逐神经元激活分散度作为无监督知识存在性检测器的系统测试,并带有完整的不确定性量化。** 对后SwiGLU MLP激活的IPR和谱熵,在每次模型规模扫描中,区分已知运动员和虚构运动员的AUROC达到0.94–0.98;有监督线性探针达到0.99–1.00。所有值均显著高于考虑了层选择偏差的排列基线(约0.70–0.74,经验p≤10^{-3}),并在留出法层选择下保持稳健(0.93–0.99)(第4.1 (https://arxiv.org/html/2607.07670#S4.SS1)节)。在无虚构字符串控制的对照任务(已知vs未知-真实)中,分散度达到0.97–1.00(第4.2 (https://arxiv.org/html/2607.07670#S4.SS2)节)。

2. **跨四种实体类型的泛化能力。** 相同的单次前向传播检测器在运动员、城市、作家和音乐家领域均能区分已知与虚构(最佳分散度0.95–1.00,探针0.99–1.00),并且探针跨领域迁移的平均非对角线AUROC为0.987/0.959/0.919/0.931(1.5B/4.5B/7B/11B)。唯一显著下降涉及城市,这是提示模板不同的唯一领域;一个匹配模板的反事实实验表明目标侧的下降是由模板引起的。在共享的中性问句主干下,向城市迁移的性能在每种规模下均恢复至0.999–1.000,只留下城市作为源领域时的残余不对称性(0.82–0.98),这与更紧凑的地点流形一致。逐头分析显示注意力熵信号是弥散的,全部四个领域的前20个注意力头中仅有1-2个共享(第4.8 (https://arxiv.org/html/2607.07670#S4.SS8)节)。

3. **在同一数据集上测量的两条分离的标度律曲线。** 表征层面的熟悉度信号(取指标对中较优者)在此对照任务上于1.5B规模已达上限,而行为事实可靠性随规模急剧提升:在严格评判标准下,42个已知运动员中,正确回答数从0→2→10→19;在宽松的关键事实规则下为6→16→24→33(第4.3 (https://arxiv.org/html/2607.07670#S4.SS3)节)。这种排序与基于频率的事实回忆解释(Mallen et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib22); Kandpal et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib15))所预测的一致;其贡献在于在同一数据集、相同实体上,跨规模干净地测量了两个轴线。

4. **在行为轴线上一个诚实的、偏向负面的结果。** 在已知运动员内部,正确vs幻觉的区分远难于已知vs虚构,且完整的模型×阈值网格不一致:分散度有时优于探针,探针有一次低于其自身的排列基线,而最强单元格(11B探针0.929)是提示性的而非确定性的。我们测试的没有任何指标能够像分散度读取熟悉度那样读取事实可靠性(第4.6 (https://arxiv.org/html/2607.07670#S4.SS6)节)。

5. **与语义熵的互补性分析。** 五样本离散语义熵在已知vs虚构对照任务上达到AUROC 0.71–0.83——低于单次前向传播分散度信号且置信区间不重叠——但在分散度失败的正确性对照任务上胜出(最高0.87);两者消耗不同的信息(提示侧的熟悉度 vs 生成侧的一致性)(第4.7 (https://arxiv.org/html/2607.07670#S4.SS7)节)。

6. **一个近乎为零的拒绝率,通过答案级别的LLM审计量化。** 在2,520个采样得到的运动员答案中(42个实体×3个条件×5个样本×4个模型),模型拒绝两次,含糊一次(99.88%为直接断言)。只有最大的模型曾经拒绝回答——尽管在每种规模下都携带几乎完美可解码的内部熟悉度信号。这是波兰语LLM部署中一个具体、可度量的对齐差距(第5 (https://arxiv.org/html/2607.07670#S5)节)。

## 2 相关工作

#### 基于内部状态的白盒检测器

Azaria and Mitchell (2023 (https://arxiv.org/html/2607.07670#bib.bib5)) 首次证明,基于隐藏激活的分类器可以预测陈述的真实性,建立了有监督探针范式;Orgad et al. (2025 (https://arxiv.org/html/2607.07670#bib.bib30)) 进一步指出真实信息集中在确切答案标记处,并特别指出探针无法跨数据集泛化。无监督和分散度风格的检测器是一个活跃的研究方向。INSIDE (Chen et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib7)) 对多个采样响应的隐藏状态协方差进行特征分析(EigenScore);LLM-Check (Sriramanan et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib33)) 使协方差计算变为单次前向传播——其Hidden Score是基于响应标记的隐藏状态Gram矩阵的行列式对数,同时还有logit熵和注意力核分数;D2HScore (Ding et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib9)) 通过无训练的层内标记表示分散度加上层间漂移来评分幻觉;EigenTrack (Ettori et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib11)) 追踪生成过程中的协方差谱统计量,包括谱熵;MIND (Su et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib34)) 通过伪标签生成训练内部状态检测器,无需人工标注;HaloScope (Du et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib10)) 从无标签生成中在激活空间发现一个真实子空间。语义熵探针 (Kossen et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib17)) 将多样本语义熵信号蒸馏为一个廉价的、基于隐藏状态的线性探针;Lookback Lens (Chuang et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib8)) 仅通过注意力分配比率检测上下文幻觉;Binkowski et al. (2025 (https://arxiv.org/html/2607.07670#bib.bib6)) 使用注意力图的谱特征(拉普拉斯特征值);TSV (Park et al., 2025 (https://arxiv.org/html/2607.07670#bib.bib31)) 使用学习到的真实方向来操控潜在表示。上述所有无监督检测器都从标记跨度或协方差级别的统计量对*生成的答案*进行评分。我们的贡献则有意地最小化且目标不同:两个闭合形式的*逐神经元*分散度统计量,作用于*单个*激活向量,在*prompt点、生成之前*读取,作为*knowledge presence*(知识存在性)的检测器 —— 无需训练,单次前向传播 —— 并对照表征激活内容上限的探针进行评估。

#### 黑盒基线

语义熵 (Kuhn et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib18); Farquhar et al., 2024 (https://arxiv.org/html/2607.07670#bib.bib12)) 通过双向蕴涵对多个采样答案进行聚类,并测量意义类上的熵;SelfCheckGPT (Manakul et al., 2023 (https://arxiv.org/html/2607.07670#bib.bib23)) 检查采样答案之间的一致性。这些方法与模型无关

相似文章

"你撒谎了吗?" 跨模型规模与信念验证模型实体的谎言检测评估

arXiv cs.AI

本文评估了四种针对语言模型的谎言检测方法,覆盖了提示谎言和训练好的模型实体,发现基于激活和logprob的检测器在训练好的模型实体上性能急剧下降,而思维链评判器仍然表现强劲。本文引入了新的测试平台以及“你撒谎了吗?”(DYL)后续探针方法,并发布了数据集和模型实体。

追踪大语言模型中的关系知识回忆

arXiv cs.CL

研究者通过探测每个注意力头的贡献,追踪大语言模型如何回忆关系事实,发现这些贡献是强线性特征,其保真度与关系特异性及实体连接度相关。

Polar Probe线性解码LLM中的语义结构

arXiv cs.CL

本文提出了一种Polar Probe,通过在学习的子空间中用距离和方向表示实体关系,从LLM激活中线性恢复语义结构。在算术、视觉场景、家谱、地铁地图和社交互动等多个领域的测试表明,该编码出现在中间层,能泛化到新实体,并对模型预测产生因果影响。