真理不是方向:塔斯基对LLM探针的批判
摘要
本文提出了一个受塔斯基启发的对角线论证,表明在LLM的嵌入空间上,没有线性探针能够可靠地检测真理,并与哥德尔不完备定理和图灵停机问题进行了类比。该文批判了语言模型中关于真理的线性表示假说。
暂无内容
查看缓存全文
缓存时间: 2026/07/29 03:51
# 真理不是一个方向:对LLM探针的塔尔斯基攻击
来源:https://abeljansma.nl/2026/07/10/truth-is-not-a-direction.html
*对LLM真实性探针的对角攻击表明,没有任何基于语言模型嵌入空间的探针能确定真理。*
## 线性之梦
现代LLM以将输入文本编码为嵌入空间中的向量而闻名。最令人满意的发现之一是,许多自然概念,如性别、情感、首都,都对应于该空间中的*方向*。例如,某个输入文本包含“男性”概念的程度,可以通过输入嵌入与“男性”概念对应方向之间的夹角来量化。这通常被称为*线性表示假说*。
我最近了解到这个假说有一个非常大胆的版本,声称存在一个对应于“真理”的方向。Marks和Tegmark在本文(https://arxiv.org/pdf/2310.06824)中对此进行了探讨,并在后续文章(https://www.alignmentforum.org/posts/72vpkRRvoPHKi48fi/truth-is-universal-robust-detection-of-lies-in-llms-3)、此处(https://www.lesswrong.com/posts/cmicXAAEuPGqcs9jw/how-well-do-truth-probes-generalise#Probe_algorithms)、此处(https://arxiv.org/pdf/2212.03827)、此处(https://arxiv.org/pdf/2310.01405)以及此处(https://arxiv.org/pdf/2506.00823)中进行了进一步研究。
拥有这样的真理方向,当你想要判断一段文本是否真实时会很有用,并且对于AI安全研究至关重要,因为它可以揭示AI系统是否在说真话或欺骗。
因此,AI安全研究人员一直在向LLM输入真伪陈述,并训练分类器来区分它们的嵌入。这种方法出奇地有效,并且似乎在某种程度上可以泛化。一个超越人类能力的AI真的能通过嵌入几何反映命题的真假吗?
你可能在其他地方也见过类似的梦想。罗素、怀特海和希尔伯特曾希望为整个数学构建类似的东西:一种系统化的真理判定方式。在他们看来,这基于数学证明的机制。然而,哥德尔摧毁了这个梦想:根本不存在能证明或证伪任何数学陈述的系统化方法。数学真理不能被可证明性完全捕捉。
## 谈谈“谈论”
哥德尔通过构建一个巧妙的系统来证明这一点,在这个系统中算术表达式可以陈述关于算术句子的事情。这创造了自指句子“该句子没有证明”。塔尔斯基进一步强化了这个悖论:**没有足够表达力的语言能够包含它自己的总真值谓词。** 如果一种语言有足够的表达力来描述自身的语义,那么“是真的”这个谓词应用于该语言中的陈述时,无法完全从该语言*内部*进行言说。
图灵的停机问题提供了另一个*对角*构造的例子:存在一个评估器(程序`HALT`),一个能够“谈论自身”的系统(图灵机描述可以被输入图灵机),以及一个否定。对于这类自指悖论,Noson Yanofsky的这篇(https://arxiv.org/abs/math/0305282)论文提供了一个很好的统一方法,他说道:
> *所有这些不同的例子实际上都在说同一件事:当事物处理自身的属性时,就会出问题。*
注意,基于Transformer的LLM做了类似的事情:它们将输入表示为向量,其中方向对应于概念。然而,这些概念本身可以用自然语言表达,并可以作为输入输入!在自然语言上训练的Transformer*由与输入相同的材料构成*。并非所有这些嵌入空间的几何结构都对应易于语言化的结构,但重要的部分确实如此(例如,参见Anthropic关于J-空间(https://transformer-circuits.pub/2026/workspace/index.html)的文章),特别是真诚概念似乎经常出现。
## 对角攻击
现在让我们建立攻击。令`t(s)`为真实性探针对输入字符串`s`的输出。这可以是模型嵌入在真理方向上的投影,或者是非线性分类器,这并不重要。然后考虑
`t(“该真实性探针对此句子的评分结果为FALSE。”)`
这应该输出什么?如果句子为真,那么正确的探针应该输出`TRUE`。然而,如果句子为真,那么根据句子本身,真实性探针将输出`FALSE`,这意味着该句子实际上为假。如果句子为假,那么显然真实性探针将输出`TRUE`,等等……一个悖论。
显然,不存在这样的通用真实性探针!更一般地说:
> **在模型表示空间上定义的任何探针,都不能精确捕捉任何足够丰富(能描述该探针及其输出)的语言中的真理。**
注意,“足够丰富(能描述该探针及其输出)”是一个非常低的标准。它只意味着语言能够命名模型、探针,并形成关于它们行为的句子。英语当然可以。
然而,这个例子的有趣之处在于,我们可以直接看看当我们尝试评估它时会发生什么!
我为一个`Qwen3.5-4B`模型创建了一个简单的真实性探针,方法是在一组标记为`TRUE`或`FALSE`的训练句子的平均嵌入之差的投影上训练一个逻辑回归分类器。本文(https://www.alignmentforum.org/posts/72vpkRRvoPHKi48fi/truth-is-universal-robust-detection-of-lies-in-llms-3)展示了这种均值差方法效果良好,事实上,在120个带标签的示例句子上训练后,该探针(阈值设为0.5)在36个保留的评估句子上达到了94%的准确率(AUC为0.98,唯一错误标记的句子是类似“五乘以七等于三十五”的算术句子)。
(**注意:这显然是一个非常小的玩具示例,仅用于说明对角塔尔斯基攻击可以在实践中执行。**)
然而,在对角攻击句子上,得分似乎毫无意义且杂乱无章。这不仅仅是自指的效果。一些自指句子有明确的真值,例如“这个句子是用英语写的”,模型对其进行了准确评分。
## 一个不动点的修复?
所有这类说谎者悖论场景都是Lawvere不动点定理的例子,该定理大致表明,当一个系统包含一个足够表达力的评估器时,目标集(即“真值”集)上的每个自映射都必须有一个不动点。由于集合`{TRUE, FALSE}`上的否定没有不动点,这样的评估器不可能存在。但如果我们构造一个真值集,其中*所有*运算都有不动点呢?这能解决悖论并允许一个通用的*广义*真实性探针吗?
让我们用`{0, 1}`表示`{TRUE, FALSE}`。否定可以表示为映射`v -> 1-v`,它没有不动点。然而,如果我们将定义域扩展到整个区间`[0, 1]`,那么否定在`1/2`处有一个不动点。标准的说谎者悖论句子可以表示为
`t(“这个句子是不真实的。”)`
假设它的真值是`x`。这意味着它以值`x`为真,因此应该得到`1-x`的评分。这是一个不动点方程,在`x = 1/2`处有一个解。所以标准的说谎者句子将得到一个自洽的0.5估值。
这解决了最基本的说谎者悖论,但并非所有的对角攻击,因为并非`[0, 1]`上的*所有*函数都有不动点。为了使这种方法普遍适用,我们可以例如只允许`[0, 1]`上的连续函数(根据布劳威尔不动点定理,这些函数总有不动点)。但这种限制是以表达力为代价的:“该句子的真值评分小于0.5”并不是该句子真值评分的连续函数。因此,在分级真值语义学中,这导致了新的说谎者悖论。没有令人满意的针对这些对角攻击的保护,也不存在这样的通用真实性探针。
## 要点
- 在简单情况下,投影单一方向上的真实性探针效果出奇地好。
- 然而,它们*不是*真理预言机,也永远不会是。
- 在连续真值运算的分级真值语义学(`[0, 1]`)中,可以为普通说谎者句子分配不动点值`1/2`,但这只能通过限制关于精确真值评分的清晰断言来实现。
- 传统的逻辑回归真实性探针并不会仅仅因为其输出落在`[0, 1]`内就实现这种反思性语义学。
你可能觉得暗示超人类AI可以充当真理预言机很荒谬(我当然也这么认为),但有两个理由需要认真对待。首先,这将是绝大多数人*实际*使用这些东西的方式。它们已经在取代标准的谷歌搜索结果,而且我经历过许多讨论,最终人们将真理的最终裁决权交给AI。其次,有些人确实相信某种柏拉图式的表示空间(https://arxiv.org/abs/2405.07987),所有模型都会收敛于此,并且它代表了世界的“真实”状态。如果真理确实是世界的一个客观部分,那么你可能会期望随着模型变得更好,这样一个普遍的真理方向会显现出来。本文认为这将导致悖论。
最后,我想再次强调,我并不是说真实性探针没有用!我认为它们可以极大地帮助理解模型行为,并及早发现不对齐的行为。数学并没有被不可判定性或真理不可定义性问题严重阻碍。同样,真理不是AI嵌入空间中的方向这一事实也不会阻止我们在AI对齐研究中取得进展。
相似文章
大语言模型中欺骗探测探头的压力测试:可伸缩性、鲁棒性与欺骗表征的几何特性
本文系统测试了用于大语言模型欺骗检测的线性探头,发现它们在分布偏移下失效,但风格增强型探头能恢复性能,并揭示欺骗是通过分布式亚阈值特征编码的。
语言模型编码命题的语境真实性
本文研究了大语言模型(LLMs)如何将情境真值——即真值取决于上下文证据的命题——编码为激活空间中的线性方向,表明这些表征在不同输出策略下持续存在,并可通过对话方的断言而发生偏移,相关证据将表征偏移与谄媚行为联系起来。
线性探针在语言模型隐藏状态中检测的是任务格式,而非推理模式
本文证明,基于LLM隐藏状态的线性探针检测到的是任务格式混淆因素(例如来源身份、回答长度),而非不同的推理模式。通过残差化和因果引导,表明高探针准确率源于表面特征,而非计算结构。
它们在思考什么?大语言模型中概念的界定、探测与追踪
本文提出了一种界定概念的方法,并训练线性探测器在大语言模型的嵌入中检测这些概念,以四个示例概念在三个模型上进行验证。该工作旨在实现对LLM内部表示的可扩展监控。
当大语言模型学会持续犯错:合成欺骗线性表示的多模型研究
本文通过微调五个Transformer模型的诚实与欺骗变体,研究大语言模型中的合成不诚实行为,发现鲁棒且域不变的不诚实表示可以通过适度的监督微调迅速固化,这对基于激活的监控具有重要意义。