Visual Para-Thinker++: 视觉推理的单策略多智能体框架
摘要
Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。
查看缓存全文
缓存时间: 2026/06/12 06:51
论文页 - Visual Para-Thinker++:用于视觉推理的单策略多智能体框架
来源:https://huggingface.co/papers/2606.09290
摘要
一个共享MLLM策略和角色专属训练方法的多智能体框架,通过减少幻觉并实现高效并行处理来提升视觉推理能力。
视觉推理需要整合分布在区域、属性和关系中的证据,这使得单链推理容易陷入早期感知承诺和幻觉问题。我们提出 Visual Para-Thinker++,一个单策略多智能体框架,其中共享的MLLM策略被实例化为带有角色条件的主智能体、工作智能体和总结智能体。主智能体使用固定分配模式分解任务;工作智能体在上下文隔离下并行推理;总结智能体整合所有工作智能体的完整推理轨迹,而非对最终标签进行多数投票。共享策略通过多智能体能力注入和角色解耦多智能体优化进行训练,后者为对应 token 片段分配角色专属奖励和优势,以减少协作角色间的梯度冲突。原生推理引擎通过共享视觉前缀和KV缓存复用实现高效的多智能体 rollout。在 V*、CountBench、RefCOCO 系列和 HallusionBench 上,Visual Para-Thinker++ 一致地优于单轨迹和推理时并行基线,在对幻觉敏感的视觉推理任务上尤其表现出强劲的增长。
查看 arXiv 页面 (https://arxiv.org/abs/2606.09290)查看 PDF (https://arxiv.org/pdf/2606.09290)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2606.09290)
在您的智能体中获取此论文:
hf papers read 2606\.09290
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接到此论文
在模型 README.md 中引用 arxiv.org/abs/2606.09290 以从此页面链接。
引用此论文的数据集0
没有数据集链接到此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.09290 以从此页面链接。
引用此论文的 Spaces0
没有 Space 链接到此论文
在 Space README.md 中引用 arxiv.org/abs/2606.09290 以从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
视觉思考-视觉-语言-行动策略:视觉中间推理实现高效低延迟
视觉思考-视觉-语言-行动策略(VisualThink-VLA)引入了一种用于视觉-语言-行动策略的视觉中间推理框架,该框架保留了空间精度,并相比基于文本的推理显著降低了延迟,在机器人操作基准测试中实现了亚秒级推理和领先的成功率。
用想象力思考:基于世界模拟器的主动式视觉空间推理
本文提出了Astra,一个主动式空间推理框架,将经过强化学习训练的VLM策略与一个世界模拟器结合起来,生成新视角的观察结果,以改进视觉语言模型中的空间推理能力。
VLX-VR:一种智能体感知的视频推理模型
VLX-VR是一种智能体感知的视频推理模型,它使用思考-记忆-观察循环和强化学习来自适应地收集证据,在MINERVA基准测试中达到了最先进的性能。
原生主动感知作为全模态理解的推理方式
介绍OmniAgent,一个全模态代理,使用迭代的观察-思考-行动循环与主动感知,实现卓越的长视频理解,在基准测试上优于更大的模型如Qwen2.5-VL-72B。
Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索
Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。