针对SeePhys Pro的多智能体辩论与视觉信息提取:来自ICML 2026 AI4Math Track 3挑战赛的第一名技术报告

arXiv cs.LG 论文

摘要

本技术报告介绍了ICML 2026 AI4Math Workshop中SeePhys Pro挑战赛的第一名解决方案,该方案采用两阶段框架,结合视觉信息提取和多智能体辩论,从图像中回答大学物理问题。

arXiv:2607.21946v1 公告类型:新 摘要:本技术报告介绍了我们在第三届AI for Math Workshop挑战赛Track~3(SeePhys Pro)中的方法,该任务要求回答大学物理问题,其题干和图形可能部分或全部以图像形式给出。当决定性信息位于图形而非文本中时,视觉物理问题对于大型语言模型来说变得显著更难,并且随着更多问题内容迁移到图像中,这种模态差距进一步扩大。我们采用两阶段框架来解决该任务:第一阶段是视觉信息提取,将图形内容重新表达为求解器可读的文本,以缩小模态差距;第二阶段是推理阶段,通过多智能体辩论协调三个异构求解器。我们的分析得出两个发现:协调带来的增益来自可靠的答案选择而非额外的辩论;图形辅助的价值与问题中锁定在图像中的内容量成正比。最终流程在公开数据上将整体准确率从单智能体基线的0.643提升到0.802,并在公开和私有排行榜上均获得第一名(私有整体0.743)。
查看原文
查看缓存全文

缓存时间: 2026/07/27 07:43

# 多智能体辩论与视觉信息提取助力SeePhys Pro:ICML 2026 AI4Math赛道三挑战第一名技术报告
来源:https://arxiv.org/abs/2607.21946
查看PDF (https://arxiv.org/pdf/2607.21946)

> 摘要:本技术报告介绍了我们在第三届AI for Math研讨会挑战赛道三:SeePhys Pro中采用的方法。该任务要求回答大学级别的物理问题,其题目陈述和图形可能部分或全部以图像形式给出。当关键信息位于图形中而非文本中时,大语言模型在处理视觉物理问题时会遇到更大困难;随着越来越多的题目信息转移到图像中,这种模态差距进一步扩大。我们采用两阶段框架处理该任务:第一阶段是视觉信息提取,将图形内容重新表达为求解器可读的文本,以缩小模态差距;第二阶段是推理阶段,通过多智能体辩论编排三个异构求解器。我们的分析得出两个发现:编排带来的收益主要来自可靠的答案选择,而非额外的辩论;图形辅助的价值取决于有多少题目信息被锁定在图像中。最终,该流水线在公开划分上将单一智能体基线的整体准确率从0.643提升至0.802,并在公开和私有排行榜上均获得第一名(私有整体准确率为0.743)。

## 提交历史

来自:Jiseok Kwak [查看邮件 (https://arxiv.org/show-email/8e9dafd7/2607.21946)] **[v1]** 2026年7月24日,周五,03:44:30 UTC (1,568 KB)

相似文章

智能体可视化项目

Reddit r/AI_Agents

涵盖与AI智能体可视化相关的项目,可能是用于表示智能体行为的工具或库。

@dair_ai: https://x.com/dair_ai/status/2056018543850754283

X AI KOLs Following

一份关于5月11日至17日顶级人工智能论文的综述,涵盖了用于长上下文预训练的Lighthouse Attention、grep与嵌入检索在编码代理中的对比,以及揭示LLMs中几何计算器的机制可解释性工作。