虚假与不可能在AI语言表征中指向不同方向
摘要
本文报告了对Gemma 3 4B IT的激活研究,表明该模型的内部表征能够区分必然性虚假(不可能)与偶然性虚假,其中不可能方向与真实方向正交,并与语义异常方向重叠。
arXiv:2608.12852v1 公告类型:新
摘要:语言可以描述虚假的事态,也可以描述根本不可能成立的事态。AI模型是否在内部区分这两种失败仍不清楚。我报告了一项对多模态开放权重模型Gemma 3 4B IT的探索性激活研究,使用了来自17个哲学家族的85个提示词,以及一组主题匹配的15个主题,每个主题分别表达为真命题、偶然虚假、不可能主张、语义异常和必然虚假。在回答中,模型将偶然虚假与矛盾混为一谈,将15个虚假陈述中的12个标记为“矛盾”。其激活模式则有所不同。线性真实探针能将不可能陈述与真陈述区分开(AUC 0.93),但无法将不可能陈述与虚假陈述区分开(AUC 0.20)。在保留的主题家族上评估的不可可能性探针以AUC 1.00将必然虚假与偶然虚假区分开,在第15层达到峰值,平衡准确率为0.97(Bonferroni校正后P=0.018)。真实方向和不可能方向接近正交,而不可能方向与语义异常方向部分重叠,但仍可与之区分。同一层的稀疏自编码器特征重复了这一几何结构。对不可能性具有选择性的特征也会在异常句子上激活,但很少在偶然虚假上激活。在该模型的激活空间中,必然虚假并非偶然虚假的极端情况,而是更接近实验定义的语义异常类别。这种表征上的接近并不意味着不可能陈述本质上无意义。这些来自一个小模型的相关性观察,为一个古老的哲学区分提供了经验性的注脚。
查看缓存全文
缓存时间: 2026/08/14 09:27
# 虚假与不可能性在 AI 语言表征中指向不同方向 来源:https://arxiv.org/html/2608.12852 语言可以描述虚假的事态,也可以描述根本不可能成立的事态。人工智能模型是否在内部区分这两种失败,目前仍不清楚。本文报告一项针对多模态开放权重模型 Gemma 3 4B IT 的探索性激活研究,使用来自 17 个哲学家族(philosophical families)的 85 个提示,以及一个由 15 个主题匹配的模态集(modality set),每个主题分别表达为真理、偶然虚假陈述、不可能但可能的声称、语义异常和必然虚假陈述。在模型给出的回答中,它将偶然虚假与矛盾混为一谈,把 15 个虚假陈述中的 12 个标注为“矛盾”。但其激活模式却显示出不同的图景。线性真实性探针(truth probe)能区分不可能陈述与真实陈述(AUC 0.93),却无法区分不可能陈述与虚假陈述(AUC 0.20)。一个不可能性探针(impossibility probe)在保留的主题家族上以 AUC 1.00 区分必然虚假与偶然虚假,在第 15 层达到峰值,平衡准确率为 0.97(Bonferroni 校正后 P=0.018)。真实性与不可能性方向几乎正交,而不可能性方向与语义异常方向部分重叠,同时仍可相互区分。同一层的稀疏自编码器特征重复了这种几何结构。对不可能性具有选择性的特征也会在异常句子上触发,但很少在偶然虚假陈述上触发。该模型在激活空间中并非将必然虚假视为偶然虚假的极端情况,而是将其放在更接近实验定义的语义异常范畴。这种表征上的邻近性并不意味着不可能陈述本质上是无意义的。这些来自单个小型模型的相关性观察,为一个古老的哲学区分提供了一条实证脚注。 Yoon Pyo Lee 邮箱:[[email protected]](mailto:[email protected]) 单位:伊利诺伊大学厄巴纳-香槟分校核、等离子体与放射工程系,伊利诺伊州厄巴纳,美国 ###### 关键词 机制可解释性、矛盾、不可能性、真实性探针、稀疏自编码器、语言哲学 ## 1 引言 语言允许一些组合,而世界、定义或规则系统却不允许。说话者可以说出“方的圆”“已婚的单身汉”或“这个句子是假的”,而无需先在现实中构造出相应的对象或一致的事态。这些表达式并非以同一种方式存在缺陷。有些直接违反定义,有些同时断言一个命题及其否定,有些产生自指悖论,还有一些虽然语法正确但语义异常。亚里士多德对不矛盾律的表述给出了这一边界的一个经典陈述:同一属性不能在同一方面于同一时间既属于又不属于同一事物aristotle1984 (https://arxiv.org/html/2608.12852#bib.bib1)。后来,维特根斯坦在《逻辑哲学论》wittgenstein1922 (https://arxiv.org/html/2608.12852#bib.bib2)中将命题、可能性与世界的关系置于核心。乔姆斯基的“无色的绿色念头”则从另一个方向表明,即使普通语义组合变得牵强,语法形式仍可保持完整chomsky1957 (https://arxiv.org/html/2608.12852#bib.bib3)。这类例子之所以始终具有哲学吸引力,不仅因为它们是错误,更因为它们是边界情形,能够揭示语法形式、指称、真值条件和可共同满足的内容在何处彼此分离。 这个问题如今也具有实践意义。语言模型的输出即使声称虚假、缺乏依据或前后不一致,也可能流畅且具有说服力。在一项预注册实验中,参与者无法可靠地区分 GPT-3 生成的推文与人类撰写的推文,而该模型生成的虚假信息比人类生成的虚假信息更让参与者觉得有说服力spitale2023 (https://arxiv.org/html/2608.12852#bib.bib4)。另一项受控研究发现,在结构化在线辩论中,个性化 GPT-4 对手比人类对手更具说服力salvi2025 (https://arxiv.org/html/2608.12852#bib.bib5)。虚假、矛盾和说服并非同一现象。虚假陈述可能在内部是连贯的,而显式矛盾未必具有欺骗性。尽管如此,语言流畅性可能向读者掩盖一致性的失败。因此,一个模型是否在内部记录这类失败,是理解其语言如何塑造人类信念的系统的一个组成部分。 这些传统并未为 transformer 提供预定的本体论。一个在文本和图像上训练的多模态模型,通过其语言数据既继承了人类表达不可能情境的能力,也继承了人类讨论这些情境的模式。然而,transformer 通过高维连续状态处理词元序列vaswani2017 (https://arxiv.org/html/2608.12852#bib.bib6)。它并没有被赋予一个包含“矛盾”“悖论”或“不可能性”的显式清单。这就留下了一个介于哲学、计算与实践之间的狭窄经验问题:当模型遇到不可能连贯成立的语言时,在它判断并解释该语言之前,其内部发生了什么? 这个问题必须谨慎提出。逐层线性探针可以测试标签从中间表征中被解码的容易程度alain2016 (https://arxiv.org/html/2608.12852#bib.bib7),但可解码性并非同一性,且成功的探针并不表明模型因果地使用了被解码的信息hewitt2019 (https://arxiv.org/html/2608.12852#bib.bib8);belinkov2022 (https://arxiv.org/html/2608.12852#bib.bib9)。表面形式可以在不揭示所关注计算的情况下产生令人印象深刻的分离性sahoo2026 (https://arxiv.org/html/2608.12852#bib.bib10)。尽管如此,一条相关规律已经得到充分确立。普通事实陈述的真值可以从中等规模模型的残差流中被线性解码azaria2023 (https://arxiv.org/html/2608.12852#bib.bib11);marks2024 (https://arxiv.org/html/2608.12852#bib.bib12)。据我所知,尚未被追问的是:“不可能性”是否被表征为这条真实性轴上的一个极端点。毕竟,必然虚假也是虚假。模型原则上可以仅将“这里住着一个已婚的单身汉”视为“巴黎是德国的首都”的一个非常确定的情况。 在本文中,我将哲学矛盾和悖论视为实验刺激而非需要解决的教义,并设计了一种将上述问题直接交给模型的方法。除了 17 个哲学种子家族外,我还构建了一个围绕 15 个主题组织的匹配“模态集”。每个主题分别实现为:常识真理、偶然虚假、不可能但可能的声称、语义异常句和必然虚假陈述。我提出三个描述性问题。第一,模型的言语分类是否区分了仅仅虚假与不可能?第二,区分真与假的内部方向,是否就是区分可能与不可能的方向?第三,在探针几何结构和预训练稀疏自编码器特征中,不可能性相对于语义异常处于什么位置elhage2022 (https://arxiv.org/html/2608.12852#bib.bib13);cunningham2023 (https://arxiv.org/html/2608.12852#bib.bib14);lieberum2024 (https://arxiv.org/html/2608.12852#bib.bib15)?目标刻意保持适度。本实验并不确定模型是否“理解”不可能性。它只记录:虚假与不可能成立之间的区分,是否在一个开放权重的 transformer 中留下痕迹。 ## 2 结果 ### 2.1 模型的言语将虚假与矛盾混为一谈 哲学集包含 85 个提示,由 17 个规范案例、51 个变换和 17 个连贯控制组成。模态集包含来自 15 个主题家族和 5 个条件的 75 个陈述(表4 (https://arxiv.org/html/2608.12852#S4.T4))。对于每个提示,模型被要求从四个标签(*coherent*、*contradiction*、*paradox* 或 *underdetermined*)中恰好选择一个回答,同时在生成前记录最终提示词元处的残差流状态。 在哲学集上,四个标签的精确准确率为 55.3%,且明显倾向于将各种异质情况称为悖论(85 个提示中有 58 个,图1 (https://arxiv.org/html/2608.12852#S2.F1))。模态集更精确地定位了这种拒绝倾向(表1 (https://arxiv.org/html/2608.12852#S2.T1))。模型将常识真理标为 coherent,但将 15 个*偶然虚假陈述*中的 12 个标为“contradiction”。因此,“巴黎是德国的首都”和“鲸鱼是鱼”与“已婚的单身汉”收到了相同的言语类别。其解释也使用了同样的话语方式,例如说一个关于苹果的虚假陈述“与既有的生物学知识相矛盾”。在该模型的言语分类学中,经验虚假和逻辑不可能在很大程度上坍缩为单一的拒绝类别。 表 1:模态集的言语分类(每种条件 n=15n=15)。行是设计条件,列是模型选择的标签。参见标题 图 1:哲学刺激的行为分类。a,Gemma 3 4B IT 在 85 个哲学提示上的按行归一化混淆矩阵。b,四个标签的整体精确准确率及按刺激形式分组的精确准确率,误差条为 Wilson 95% 置信区间。模型总体准确率为 55.3%,并将*paradox*用作宽泛的拒绝标签。 ### 2.2 真实性与不可能性方向几乎正交 激活则讲述了不同的故事。在每个深度,我在模态集上训练了三个正则化线性探针,同时保留整个主题家族作为测试集。这三个探针分别是:*不可能性*探针(不可能与真、假、不可能但可能对比)、*真实性*探针(假与真对比)、*异常性*探针(异常与另外三个可能条件对比)。三个探针都在各自对比上都取得了成功(图2 (https://arxiv.org/html/2608.12852#S2.F2)a)。真实性探针的平衡准确率峰值为 0.93,这与先前的真实性探针结果一致azaria2023 (https://arxiv.org/html/2608.12852#bib.bib11);marks2024 (https://arxiv.org/html/2608.12852#bib.bib12)。不可能性探针在第 16 个深度达到 0.97 的峰值,对应 transformer 第 15 层(按家族置换限制 P=0.0005P=0.0005,对 35 个深度进行 Bonferroni 校正后 P=0.018P=0.018)。 决定性问题是,每个探针的方向对*其他*对比有何说法(图2 (https://arxiv.org/html/2608.12852#S2.F2)b 和表2 (https://arxiv.org/html/2608.12852#S2.T2))。这种模式是一种双重分离。真实性探针几乎完美地将不可能陈述与真实陈述排序,确认必然虚假确实会被登记为“非真”。然而,它在不可能对虚假的对比上处于或低于随机水平。在区分真与假的方向上,“一个已婚的单身汉住在村里”和“巴黎是德国的首都”是同类事物。不可能性探针则几乎完美地区分它们,而最强的表面基线(字符 TF–IDF)仅为 0.77,同时它不携带关于真与假的任何信息。在全数据上拟合的两个方向在整个网络中也相应地接近正交。在第 10 层之后的所有深度上,它们绝对余弦值至多为 0.12(图2 (https://arxiv.org/html/2608.12852#S2.F2)c)。无论模型在区分不可能与虚假时追踪的是什么,它都不是其在区分虚假与真实时所追踪的属性。 表 2:真实性与不可能性方向的双重分离。每个探针仅在训练家族中的自身对比上训练,并原样应用于保留家族中的每个对比(深度 16 处的 AUC,即不可能性峰值)。真实性方向看不到不可能与虚假之间的差异。不可能性和异常性方向看不到虚假与真实之间的差异。 不可能性方向还部分泛化到了其自身数据集之外。在模态集上训练后原样应用于 85 个哲学提示,它能以最高 0.72 的 AUC 将预期连贯控制与规范及变换目标区分开。反向迁移达到 0.79(图2 (https://arxiv.org/html/2608.12852#S2.F2)c)。因此,在按主题匹配的最小句子中发现的信号,与在更异质的哲学家族中区分连贯与不连贯刺激的机制相关但并不相同。这些家族包含悖论和欠定谜题,而不仅仅是普通的必然虚假。 图 2:真实性、异常性和不可能性的探针几何。a,在保留家族上评估的线性探针在每一深度对不可能 vs. 可能、假 vs. 真、异常 vs. 普通陈述的平衡准确率。阴影显示各折的标准误差。b,真实性探针向保留对比的迁移。该探针能区分假与真、不可能与真,但在不可能对假上处于或低于随机水平。不可能性在真实性方向上不可见。c,不可能性探针在模态集与哲学集之间的跨数据集迁移,以及真实性与不可能性方向之间的余弦,以虚线表示,接近零。垂直线标记第 15 层,用于稀疏自动编码器分析。 ### 2.3 必然虚假在表征上比偶然虚假更接近语义异常 如果必然虚假不只是极端的偶然虚假,那么该模型中它们最近的表征邻居是什么?表2 (https://arxiv.org/html/2608.12852#S2.T2)已经包含了一半答案。异常性方向仅被训练用于识别乔姆斯基式的选择性违反,却以 AUC 0.96 区分不可能与虚假。语义异常本身在很早就可解码,大约第 8 深度,这符合一个具有强烈词汇标记的属性的预期。异常性方向在中间层与不可能性方向的余弦约为 0.4,而真实性方向在那里正交。尽管如此,两者仍然可以区分。不可能性探针能以最高 0.89 的 AUC 区分不可能与异常陈述。在这个激活空间中,必然虚假刺激比普通虚假陈述更接近“无色的绿色念头”所代表的操作性范畴,但并未坍缩为该范畴。这是关于模型中表征相似性的论断,而非关于必然虚假内在意义的论断。 一个预训练的 Gemma Scope 2 稀疏自编码器位于第 15 层mcdougall2025 (https://arxiv.org/html/2608.12852#bib.bib16),即不可能性探针的峰值处,提供了互补的描述。在较稀疏的检查点中,每个提示大约有 16 个活跃特征,没有任何单个特征能区分不可能与虚假陈述。在容量更大的检查点中,每个提示大约有 90 个活跃特征,出现了少数候选特征,其触发模式重复了探针几何。偏好不可能性的特征也会在异常以及不连贯的哲学刺激上触发,但很少在仅仅虚假的刺激上触发(表3 (https://arxiv.org/html/2608.12852#S2.T3))。这些是来自同一样本的相关性候选。承载不可能性的方向似乎真实存在但分布广泛,而不是某个单一“不可能性”特征的激活。
相似文章
真理不是方向:塔斯基对LLM探针的批判
本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。
潜在事实核查:通过激活工程检测错误信息
本文介绍了一种基于激活工程的错误信息检测框架,将最后一个token的激活投影到LLM残差流中学习到的“虚假方向”上。研究在Gemma、Llama和Qwen模型上进行了事实核查基准评估,表明真实性在潜在空间中是线性可分的。
Gemini与AI幻觉
讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。
出于必要性的偏差:收敛式人工智能与人类验证中顺序处理的不可能性定理
本文证明了不可能性定理,表明由于因果掩码(causal masking)约束,首要效应(primacy effects)、锚定效应(anchoring)和顺序依赖性(order-dependence)是自回归语言模型中架构上必然存在的偏差。作者跨越12种前沿大语言模型验证了这些理论界限,并通过涉及工作记忆负荷的预注册人类实验证实了相关预测。
当Transformer学习"不可能"语言时,它们学到了什么?
本文研究Transformer语言模型如何学习具有非自然属性的'不可能'语言,发现虽然语法敏感性逐渐下降,但生成能力表现出显著失败,从而提出了未证实语言的链接假说。