LEDGERMIND:基于结构化证据账本的来源约束多模态智能体推理

Hugging Face Daily Papers 论文

摘要

本文介绍了LedgerMind,一种来源约束的多模态智能体推理框架,它使用结构化证据账本确保视觉问答中推理的立足性和忠实性,解决幻觉和过度推理等失败模式。

用于视觉问答的多模态智能体越来越多地以多步轨迹方式运行,交织感知、检索和推理,但评估仍然主要归结为最终答案的准确性。这种聚合信号无法判断正确答案是通过有据可依的证据、语言先验还是偶然的错误抵消得出的。我们建议将多模态智能体轨迹视为来源约束的状态机:工具输出被规范化为结构化证据账本,作为轨迹状态;下游推理和决策声明只能引用活跃的账本条目;立足性在实体和数值层面进行检查;修复通过类型化状态转换实现,不能在没有工具产生的来源的情况下引入内容。我们将这一设计实例化为LedgerMind(基于结构化证据账本的来源约束多模态智能体推理),并辅以三层立足协议、一个自适应双路径调度器(将推理深度与问题复杂度匹配),以及一个具有形式化来源非放大保证的事件触发验证与修复引擎。我们使用LedgerMind针对四个经常被最终答案准确性掩盖的反复出现的失败模式:无支持的中间推理、基于引用的实体幻觉(幻影立足)、对简单查询的过度推理以及修复时的放大。跨多个多模态推理基准和骨干MLLM的实验表明,LedgerMind同时提高了答案准确性和轨迹级忠实性。
查看原文
查看缓存全文

缓存时间: 2026/07/31 05:52

论文页面 - LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

来源:https://huggingface.co/papers/2607.28374

摘要

用于视觉问答的多模态智能体日益以多步轨迹的方式运行,这些轨迹交织了感知、检索和推理,但评估在很大程度上仍然归结为最终答案的准确率。这种聚合信号无法判断正确答案是通过有依据的证据、语言先验,还是偶然的误差抵消而得出。我们提议将多模态智能体轨迹视为一个受来源约束的状态机:工具输出被规范化到一个结构化证据账本(Structured Evidence Ledger)中,作为轨迹状态;下游的推理和决策声明只能引用账本中处于活动状态的条目;在实体和数值层面检查依据性;修复则以类型化状态转换的形式实现,没有工具产生的来源就不能引入内容。我们将这一设计实例化为 LedgerMind(受来源约束的多模态智能体推理与结构化证据账本),并辅以三层依据性协议(Three-Layer Grounding Protocol)、一个根据问题复杂度匹配推理深度的自适应双路调度器(Adaptive Dual-Path Dispatcher),以及一个带有形式化来源非放大保证的事件触发的验证与修复引擎(Event-Triggered Verification-and-Repair engine)。我们使用 LedgerMind 来针对最终答案准确率往往掩盖的四种反复出现的失败模式:无支持的中间推理、基于引用的实体幻觉(Phantom Grounding)、对简单查询的过度推理,以及修复时的信息放大。在多个多模态推理基准和骨干 MLLM 上的实验表明,LedgerMind 同时提高了答案准确率和轨迹级忠实度。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28374) 查看 PDF (https://arxiv.org/pdf/2607.28374) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28374)

在您的智能体中获取此论文:

hf papers read 2607\.28374

还没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。

引用此论文的数据集 0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。

引用此论文的 Space 0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2607.28374,即可在此页面显示链接。

包含此论文的收藏 0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection),即可在此页面显示链接。

相似文章

Beacon:知道何时以及如何进行智能体视觉推理

Hugging Face Daily Papers

本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。

检索、整合与综合:空间-语义接地潜层视觉推理

arXiv cs.CL

本文介绍了 RIS,这是一个用于多模态大语言模型的空间-语义接地潜层视觉推理框架,旨在克服信息瓶颈。该框架提出将潜在令牌(tokens)锚定于空间和语义证据之上,在 V* 和 HRBench 等基准测试中展现出性能提升。

RRM:经验驱动的反思性检索记忆用于长时程多模态推理

arXiv cs.CL

本文介绍了反思性检索记忆(RRM),一种记忆框架,从历史任务轨迹中提炼程序性检索经验,以改进长时程多模态推理中的证据检索。RRM在M3-Bench-Robot、M3-Bench-Web和Video-MME-Long基准上达到或超过了先前的最先进水平。