模型何时该改变想法?大语言模型中的情境信念管理
摘要
本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。
查看缓存全文
缓存时间: 2026/05/29 02:59
论文页面 - 模型何时应改变想法?大语言模型中的上下文信念管理
来源:https://huggingface.co/papers/2605.30219
摘要
语言模型在通过上下文信念管理来管理长期信息方面存在困难——这涉及更新、保留和过滤相关信息——而强化学习与表征级引导技术可以对此进行改进。
长程交互要求语言模型管理不断累积的信息:何时更新自身状态、何时保持状态、以及忽略哪些内容。我们将这一挑战研究为“上下文信念管理”(CBM):维护一个与形式证据对齐的预测信念状态,同时隔离与任务无关的噪声。为了使 CBM 可量化,我们引入了 BeliefTrack,这是一个涵盖规则发现与电路诊断的封闭世界基准,其中有限的信念空间和符号验证器使得能够进行精确的逐轮评估。BeliefTrack 诊断出三种失败模式:未更新失败、未保持失败和未隔离失败。在多种大语言模型上,原始模型表现出严重的 CBM 失败,而显式的信念追踪提示带来的提升有限。相比之下,使用信念状态奖励的强化学习平均将失败率降低了 70.9%。进一步探查揭示了这些失败背后的潜在信念状态动态,而表征级引导在两个任务上将失败率降低了 46.1%。注:代码即将在 https://github.com/zjunlp/CBM 发布。
查看 arXiv 页面 (https://arxiv.org/abs/2605.30219)
查看 PDF (https://arxiv.org/pdf/2605.30219)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.30219)
引用本论文的模型 0
没有模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。
引用本论文的数据集 0
没有数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。
引用本论文的 Spaces 0
没有 Space 链接本论文
请在 Space README.md 中引用 arxiv.org/abs/2605.30219 以从此页面链接。
包含本论文的收藏集 0
没有收藏集包含本论文
请将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
@HuggingPapers: 何时LLM应更新、保留或忽略信息?上下文信念管理正是长程推理所需。…
介绍BeliefTrack,一种LLM上下文信念管理方法,将推理错误减少超过70%。
迈向基于信念的LLM智能体世界模型
本文提出基于信念的世界模型(BB-WMs),旨在通过直接访问关于不确定状态的信念,提升LLM智能体在部分可观测环境中的决策性能,并展示任务表现的改善。
OmniToM: 通过显式信念建模对大语言模型的心智理论进行基准测试
OmniToM 引入了一个基准测试,通过要求显式提取和标注信念结构来评估大语言模型的心智理论,揭示了尽管模型在端点问答任务上表现强劲,但在跟踪角色特定信念方面存在瓶颈。
当正确信念崩溃时:临床压力下LLMs的认知韧性
本文研究了大型语言模型在临床环境中面对对抗性压力时如何维持正确信念,提出了R-FT微调方法以在平衡可纠正性的同时提升认知韧性,并在医学基准测试中展示了显著的鲁棒性提升。
信念校准优化:一个明确的智能体优化世界模型
介绍了信念校准优化(BCO),这是一种通过显式跟踪和修正对编辑环境响应的信念来维护持久世界模型以提高LLM智能体性能的方法。