我在Qwen3-4B上跨越7个数据集映射了Anthropic的J-Space幻觉信号,以找出其有效和失效的地方
摘要
本文在Qwen3-4B上跨越7个数据集评估了Anthropic的J-Space幻觉检测方法,发现该方法在捕捉事实检索中的高置信度错误方面有效,但对内化的虚构内容视而不见,并且在阈值无法迁移的数学任务上失效。
Anthropic 近期发表了关于语言模型内部“全局工作空间”(J-Space)的论文,表明通过观察内部的“工作空间噪声”(熵)比仅观察输出 logprobs 能更好地捕捉幻觉。`solarkyle` 随后提供了一个优秀的开源实现,展示了该方法能够路由 TriviaQA 上的高置信度错误。我想看看这是否真的可以作为可部署的工具,因此我进行了压力测试:从 Qwen3-4B 的后期层(L30-L34)中提取 J-Space 熵,跨越约 11,400 个样本和 7 个完全不同的数据集分布。以下是发现:它是极端事实检索的优秀路由器。输出 logprobs 擅长捕捉明显的不确定性(低置信度)。但 J-Space 噪声在危险的“高置信度但错误”区间中表现突出。例如,在 PopQA(罕见长尾事实)上,如果设置 5% 的人工审查路由预算,使用置信度的路由精度比随机更差(87.5% vs 90% 的基准错误率)。而基于工作空间噪声的路由以 100% 的精度捕捉到了错误。它对内化的虚构内容完全视而不见。我还在 TruthfulQA(对抗性的人类虚构内容)上运行了流程。该指标的预测能力完全崩溃。即使模型处于“最安全”区间(高输出置信度 + 干净/低噪声工作空间),其错误率仍达 84.9%。机制上的启示:工作空间噪声检测的是认知上的猜测(模型疯狂拼凑虚假答案时)。它无法检测本体上的虚假(模型毫不费力地检索出预训练数据中固化的虚假事实)。数学任务破坏了静态阈值。我尝试将 TriviaQA 上校准的“噪声”阈值直接应用于 GSM8K(数学推导)。结果完全失效。GSM8K 正确答案的平均噪声分数上升至 1.636——高于用于标记事实数据上错误的阈值(1.583)。机制上的启示:通过“逐步思考”进行数学推理是一种结构上的高熵活动。你不能将 J-Space 阈值从记忆检索任务迁移到计算任务。目前,这只是 n=1 模型评估。我的下一步是进行参数规模扫描(Qwen3 7B, 14B, 32B),以确定模型表面 logprobs 的校准程度与其内部工作空间清晰度相当时的“交叉点”。所有原始数据、`.csv` 指标、混淆矩阵以及完全可复现的 Google Colab 笔记本均在仓库中。GitHub: https://github.com/dasjoms/jspace-hallucination-eval
相似文章
评估J-space熵在Qwen3-4B上的7个数据集中作为错误预测器的效果 [R]
本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。
PARALLAX: 区分真实幻觉检测与基准构建伪影
本文揭示了LLM幻觉检测领域报道的许多进展实际上源于基准构建伪影,其中真实答案被嵌入到提示中,使得简单的文本相似度基线方法能够获得近乎完美的分数。通过大规模受控评估,作者证明,在适当控制下,大多数方法的表现接近随机水平,除了对上层隐藏状态的监督探针(如SAPLMA)以及他们提出的DRIFT。
超越文档基础:代码、工具输出和文档上的跨度级幻觉检测
本文介绍了一个统一的基准,用于RAG系统中的跨度级幻觉检测,该基准超越了自然语言,扩展到代码、工具输出和结构化文档,并展示了一个微调的Qwen3.5-2B检测器,该检测器在这些新领域上优于现有方法,同时在标准NLP基准上保持竞争力。
世界模型中的幻觉是可预测且可预防的
本文证明世界模型中的幻觉是一个数据覆盖问题,并提出基于数据的信号来检测它们,以及利用新的MMBench2数据集采用覆盖感知采样技术来减轻幻觉。
我在开放模型上测试了Anthropic的新Jacobian Lens,然后它变成了一个本地模型幻觉路由器
作者在开放模型上测试了Anthropic的Jacobian Lens,然后它演变成了一个用于检测AI幻觉的本地模型幻觉路由器