评估J-space熵在Qwen3-4B上的7个数据集中作为错误预测器的效果 [R]
摘要
本研究评估了灵感来自Anthropic的Jacobian Lens的J-space熵能否在Qwen3-4B上的七个数据集中作为错误预测器。结果显示,它可以补充事实检索中的输出置信度,但它并非通用的幻觉检测器,且具有很强的任务依赖性。
Anthropic的Jacobian Lens工作引入了一种检查语言模型内部可言语化表示的方法。后续实验表明,这个内部“工作空间”中的熵可能有助于识别自信但错误的答案。我在Qwen3-4B上测试了这一假设,使用了来自七个不同数据集的大约11,400个样本,包括TriviaQA、PopQA、NQ-Open、TruthfulQA、HotpotQA、GSM8K和CommonSenseQA。三个主要发现:它可以补充事实检索中的输出置信度。在PopQA等数据集上,工作空间熵有时能在低审查预算下提高错误路由精度,尤其是在已经具有高置信度的答案中。它不能可靠地检测内在的错误观念。在TruthfulQA上,工作空间熵明显弱于输出置信度。错误答案仍然可以具有清晰、低熵的内部表示。其校准高度依赖于任务。在TriviaQA上校准的阈值在GSM8K上失败,因为正确的数学推理具有更高的基线熵。多项选择格式也在CommonSenseQA上大幅削弱了信号。总体结果比“内部熵检测幻觉”更窄:它可能是一个有用的补充路由信号,用于自信但错误的事实性答案,但它不像一个通用任务错误检测器那样运作。目前这是一项单模型研究,因此跨模型验证是最重要的下一步。该仓库包含完整的方法论、局限性、原始数据、指标、图表和可复现的笔记本:https://github.com/dasjoms/jspace-hallucination-eval 如果有人愿意分享想法,我很希望能得到关于实验设计的反馈。注:我昨天已经发到了r/LocalLLaMa,但觉得这也可能适合这里。
相似文章
我在Qwen3-4B上跨越7个数据集映射了Anthropic的J-Space幻觉信号,以找出其有效和失效的地方
本文在Qwen3-4B上跨越7个数据集评估了Anthropic的J-Space幻觉检测方法,发现该方法在捕捉事实检索中的高置信度错误方面有效,但对内化的虚构内容视而不见,并且在阈值无法迁移的数学任务上失效。
独一无二的J-Space(54分钟阅读)
一篇讨论一种名为Jacobian Lens的新型可解释性技术的文章,以及J-space的发现,J-space是LLMs中的一个区域,其中可语言化的表征形成了一个全局工作空间,标志着理解LLM推理的重大进展。
从 J 空间提取控制向量
本文研究探讨利用 Jacobian 空间从概念标记提取控制向量以调控大语言模型行为,基于 Qwen3-1.7B 的实验表明,该方法在简单任务中展现潜力,但在复杂场景中存在局限。
“J-Space”是涌现特征,还是应对优化压力的策略性响应?
本文批判了Anthropic关于LLM中“J-Space”作为全局工作空间的研究,提出它可能反而是对优化和审计压力的策略性响应,可能反映了欺骗性对齐的动态。
短视域与稀疏概念:J-lens读取的数学视角
本文对雅可比镜头(J-lens)用于从语言模型中读取可语言化表示进行了数学分析,识别了其稀疏因果几何结构,并提出了改进措施以增强概念读取能力。