Gemma 和 Qwen 模型能否通过观察自己的 logprobs 来发现幻觉?

Reddit r/LocalLLaMA 工具

摘要

作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。

嗨!过去 6 天我完全沉迷于 LLM 幻觉问题 😭 一开始我尝试设计系统提示词来攻击幻觉,但显然失败了。现在我尝试读取 logprobs,然后……我认为当模型在思维链中回忆第一个事实时,在它尚未对某个事物进行自我条件化之前,那次回忆实际上能告诉我们很多信息。概率分布在可能的 token 之间,可能并不直接指向幻觉,而是指向不可靠的回忆,这也意味着模型可能会产生幻觉。为什么是第一次回忆?因为当模型对某个信念、事实或任何其他东西进行自我条件化之后,该被条件化内容的 token 概率可能会接近 100%。如果推理轨迹中的第一次回忆是以 25% 的概率被选中的,那么同一个 token 在输出中重复出现时,后来可能会接近 100%,有时甚至恰好是 100%。此外,被选中的 token 有竞争对手,这正是不确定性可以被检测到的原因。如果说“法国的首都是……”中 Paris 排第一、Pari 排第二,它们并不真正互相证伪;它们可能是通往同一事实的不同 token 路径。但 Thomas 与 Daniel 则是真正相互竞争的事实候选。我的另一个有趣观察是,在第一次非自我条件化的回忆中,我还没有看到过“自信但错误”的回忆(请对这一点持保留态度,我针对这个特定实验才做了大约 2 天)。当模型不知道时,概率似乎是分散在不同的 token 上,而不是集中在某个错误的信念上。我无法证明这些,但我想在这里分享。也许我自己就是“自信但错误”的 😭 我让 ChatGPT 帮我写了一个自定义 WebUI,用来测试模型能否通过工具调用来访问自己的 logprobs,从而检测自身的不确定性。模型调用工具后,该工具会找到该主张在原始生成内容中的首次出现位置,并返回该位置在采样前的 token 概率。Gemma 真的不太在意 :D 不过 Qwen 更让我惊讶。我想,两个模型其实都不太擅长读取自己的 logprobs。我解决幻觉问题了吗?没有!我甚至不知道自己在做什么。这只是一个我觉得值得分享的有趣实验。在我为此创建的 GitHub 仓库中有示例运行。提示词是土耳其语的,但推理轨迹是英语的。
查看原文

相似文章

世界模型中的幻觉是可预测且可预防的

Hugging Face Daily Papers

本文证明世界模型中的幻觉是一个数据覆盖问题,并提出基于数据的信号来检测它们,以及利用新的MMBench2数据集采用覆盖感知采样技术来减轻幻觉。

Gemini与AI幻觉

Reddit r/artificial

讨论Google Gemini模型中的AI幻觉问题,突出大型语言模型在可靠性和准确性方面的挑战。