LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理
摘要
本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。
查看缓存全文
缓存时间: 2026/07/31 05:52
论文页面 - LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger
来源:https://huggingface.co/papers/2607.28374
摘要
用于视觉问答的多模态智能体日益以多步轨迹的方式运行,这些轨迹交织了感知、检索和推理,但评估在很大程度上仍然归结为最终答案的准确率。这种聚合信号无法判断正确答案是通过有依据的证据、语言先验,还是偶然的误差抵消而得出。我们提议将多模态智能体轨迹视为一个受来源约束的状态机:工具输出被规范化到一个结构化证据账本(Structured Evidence Ledger)中,作为轨迹状态;下游的推理和决策声明只能引用账本中处于活动状态的条目;在实体和数值层面检查依据性;修复则以类型化状态转换的形式实现,没有工具产生的来源就不能引入内容。我们将这一设计实例化为 LedgerMind(受来源约束的多模态智能体推理与结构化证据账本),并辅以三层依据性协议(Three-Layer Grounding Protocol)、一个根据问题复杂度匹配推理深度的自适应双路调度器(Adaptive Dual-Path Dispatcher),以及一个带有形式化来源非放大保证的事件触发的验证与修复引擎(Event-Triggered Verification-and-Repair engine)。我们使用 LedgerMind 来针对最终答案准确率往往掩盖的四种反复出现的失败模式:无支持的中间推理、基于引用的实体幻觉(Phantom Grounding)、对简单查询的过度推理,以及修复时的信息放大。在多个多模态推理基准和骨干 MLLM 上的实验表明,LedgerMind 同时提高了答案准确率和轨迹级忠实度。
查看 arXiv 页面 (https://arxiv.org/abs/2607.28374) 查看 PDF (https://arxiv.org/pdf/2607.28374) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28374)
在您的智能体中获取此论文:
hf papers read 2607\.28374
还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。
引用此论文的数据集 0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。
引用此论文的 Space 0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。
包含此论文的收藏 0
没有收藏包含此论文
将此论文添加到收藏 (https://huggingface.co/new-collection),即可在此页面显示链接。
相似文章
Beacon:知道何时以及如何进行智能体视觉推理
本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。
检索、整合与综合:空间-语义接地潜层视觉推理
本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。
多视角证据合成与推理的无监督多模态实体链接
MSR-MEL 提出一种无监督框架,利用大语言模型对多视角证据进行合成与推理,实现多模态实体链接,在标准基准上全面超越既有方法。
RRM:经验驱动的反思性检索记忆用于长时程多模态推理
本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。
LLMs为何在结构化知识上产生幻觉:对线性化表示推理的机制分析
本文对LLMs在推理线性化结构化知识时产生幻觉的原因进行了机制分析,发现幻觉源于系统的内部动态,例如对捷径线索的关注以及前馈层中语义基础的失败,而非随机噪声。