模型何时该改变想法?大语言模型中的情境信念管理

Hugging Face Daily Papers 论文

摘要

本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。

长程交互要求语言模型管理不断累积的信息:何时更新状态,何时保持状态,以及忽略哪些信息。我们将这一挑战定义为情境信念管理(CBM):保持预测的信念状态与形式化证据对齐,同时隔离任务无关的噪声。为了将CBM可量化,我们引入了BeliefTrack,这是一个涵盖规则发现和电路诊断的封闭世界基准,其中有限的信念空间和符号验证器实现了精确的逐轮评估。BeliefTrack诊断三种失败:Failed Stay、Failed Update和Failed Isolation。在多个大语言模型中,基础模型表现出严重的CBM失败,而显式的信念追踪提示带来有限改进。相比之下,使用信念状态奖励的强化学习平均将失败率降低了70.9\%。进一步探针揭示这些失败背后的潜在信念状态动态,而表示层面引导在两个任务上将失败率降低了46.1\%\footnote{代码即将在https://github.com/zjunlp/CBM公开。}
查看原文
查看缓存全文

缓存时间: 2026/05/29 02:59

论文页面 - 模型何时应改变想法?大语言模型中的上下文信念管理

来源:https://huggingface.co/papers/2605.30219

摘要

语言模型在通过上下文信念管理来管理长期信息方面存在困难——这涉及更新、保留和过滤相关信息——而强化学习与表征级引导技术可以对此进行改进。

长程交互要求语言模型管理不断累积的信息:何时更新自身状态、何时保持状态、以及忽略哪些内容。我们将这一挑战研究为“上下文信念管理”(CBM):维护一个与形式证据对齐的预测信念状态,同时隔离与任务无关的噪声。为了使 CBM 可量化,我们引入了 BeliefTrack,这是一个涵盖规则发现与电路诊断的封闭世界基准,其中有限的信念空间和符号验证器使得能够进行精确的逐轮评估。BeliefTrack 诊断出三种失败模式:未更新失败、未保持失败和未隔离失败。在多种大语言模型上,原始模型表现出严重的 CBM 失败,而显式的信念追踪提示带来的提升有限。相比之下,使用信念状态奖励的强化学习平均将失败率降低了 70.9%。进一步探查揭示了这些失败背后的潜在信念状态动态,而表征级引导在两个任务上将失败率降低了 46.1%。注:代码即将在 https://github.com/zjunlp/CBM 发布。

查看 arXiv 页面 (https://arxiv.org/abs/2605.30219)
查看 PDF (https://arxiv.org/pdf/2605.30219)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30219)

引用本论文的模型 0

没有模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。

引用本论文的数据集 0

没有数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。

引用本论文的 Spaces 0

没有 Space 链接本论文

请在 Space README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。

包含本论文的收藏集 0

没有收藏集包含本论文

请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

迈向基于信念的LLM智能体世界模型

arXiv cs.AI

本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。

当正确信念崩溃时:临床压力下LLMs的认知韧性

arXiv cs.AI

本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。