@HuggingPapers: 何时LLM应更新、保留或忽略信息?上下文信念管理正是长程推理所需。…
摘要
介绍BeliefTrack,一种LLM上下文信念管理方法,将推理错误减少超过70%。
何时LLM应更新、保留或忽略信息?
上下文信念管理正是长程推理所缺失的。我们推出BeliefTrack——并展示优化信念状态可将推理错误减少超过70%。https://t.co/7gwuNLNd1t
查看缓存全文
缓存时间: 2026/05/31 04:58
大语言模型应在何时更新、保留或忽略信息?
上下文信念管理正是长程推理所缺失的。我们引入BeliefTrack——并展示优化信念状态可将推理错误减少超过70%。https://t.co/7gwuNLNd1t
相似文章
模型何时该改变想法?大语言模型中的情境信念管理
本文介绍了面向大语言模型的情境信念管理(CBM)以处理长期信息,提出了用于评估的BeliefTrack基准,并展示了强化学习和表示层面引导显著减少了信念管理失败。
并行LLM推理实现抗偏差、稳健的概念抽象
本文提出了一种并行分块处理长文档的框架,利用LLMs减少累积偏差并提高证据可追溯性,显著降低了遗漏错误和无依据主张。
LLMs知道自己何时出错。我对Anthropic的新“全局工作空间”论文进行了一项修复 [R]
作者提出了一种方法,通过使用中间层状态的线性探测器和一个小型训练桥接器将置信度对数进行校准,使LLMs能够表达校准后的置信度,仅需200个标注样本,无需修改权重。这与Anthropic的全局工作空间论文相关,该论文解释了“知道-说出”差距。
信念引擎:多智能体LLM协商中可配置且可检查的立场动态
本文介绍了信念引擎(Belief Engine),这是一种为LLM智能体设计的可审计信念更新层,通过将信念视为具有显式更新规则的证据状态,使得多智能体协商中的立场变化变得可配置且可检查。
大语言模型在CBT引导的情感推理中存在哪些不足?
本文探讨了大语言模型为何在理论上高度准确的情况下仍无法有效应用CBT原则,引入了一个知识引导框架和一种行为指标(协议杠杆力),用于衡量干预措施的转变。实验表明,即使采用多重思维链提示,模型仍偏向于验证与反思。