针对SeePhys Pro的多智能体辩论与视觉信息提取:来自ICML 2026 AI4Math Track 3挑战赛的第一名技术报告
摘要
本技术报告介绍了ICML 2026 AI4Math Workshop中SeePhys Pro挑战赛的第一名解决方案,该方案采用两阶段框架,结合视觉信息提取和多智能体辩论,从图像中回答大学物理问题。
arXiv:2607.21946v1 公告类型:新
摘要:本技术报告介绍了我们在第三届AI for Math Workshop挑战赛Track~3(SeePhys Pro)中的方法,该任务要求回答大学物理问题,其题干和图形可能部分或全部以图像形式给出。当决定性信息位于图形而非文本中时,视觉物理问题对于大型语言模型来说变得显著更难,并且随着更多问题内容迁移到图像中,这种模态差距进一步扩大。我们采用两阶段框架来解决该任务:第一阶段是视觉信息提取,将图形内容重新表达为求解器可读的文本,以缩小模态差距;第二阶段是推理阶段,通过多智能体辩论协调三个异构求解器。我们的分析得出两个发现:协调带来的增益来自可靠的答案选择而非额外的辩论;图形辅助的价值与问题中锁定在图像中的内容量成正比。最终流程在公开数据上将整体准确率从单智能体基线的0.643提升到0.802,并在公开和私有排行榜上均获得第一名(私有整体0.743)。
查看缓存全文
缓存时间: 2026/07/27 07:43
# 多智能体辩论与视觉信息提取助力SeePhys Pro:ICML 2026 AI4Math赛道三挑战第一名技术报告 来源:https://arxiv.org/abs/2607.21946 查看PDF (https://arxiv.org/pdf/2607.21946) > 摘要:本技术报告介绍了我们在第三届AI for Math研讨会挑战赛道三:SeePhys Pro中采用的方法。该任务要求回答大学级别的物理问题,其题目陈述和图形可能部分或全部以图像形式给出。当关键信息位于图形中而非文本中时,大语言模型在处理视觉物理问题时会遇到更大困难;随着越来越多的题目信息转移到图像中,这种模态差距进一步扩大。我们采用两阶段框架处理该任务:第一阶段是视觉信息提取,将图形内容重新表达为求解器可读的文本,以缩小模态差距;第二阶段是推理阶段,通过多智能体辩论编排三个异构求解器。我们的分析得出两个发现:编排带来的收益主要来自可靠的答案选择,而非额外的辩论;图形辅助的价值取决于有多少题目信息被锁定在图像中。最终,该流水线在公开划分上将单一智能体基线的整体准确率从0.643提升至0.802,并在公开和私有排行榜上均获得第一名(私有整体准确率为0.743)。 ## 提交历史 来自:Jiseok Kwak [查看邮件 (https://arxiv.org/show-email/8e9dafd7/2607.21946)] **[v1]** 2026年7月24日,周五,03:44:30 UTC (1,568 KB)
相似文章
物理科学中的深度研究:一个多智能体框架与全面基准
本文介绍了PhySciBench——一个包含200个专家精心策划的物理科学问题的基准,以及DelveAgent——一个多智能体框架,与Gemini Deep Research等基线相比,该框架提高了准确性并降低了推理成本。
迈向可验证的多模态深度研究:一种用于交错报告生成的多智能体框架
本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。
用于高中成绩单自动处理的多智能体AI系统:大规模协作式文档分析
本文介绍了一个多智能体AI系统,包含由协调智能体协调的专业智能体(模式识别、语义分析、视觉智能),用于自动处理多样化的高中成绩单。在来自13个州的40份成绩单测试集上,实现了96.7%的准确率和每份45秒的处理速度。
智能体可视化项目
涵盖与AI智能体可视化相关的项目,可能是用于表示智能体行为的工具或库。
@dair_ai: https://x.com/dair_ai/status/2056018543850754283
一份关于5月11日至17日顶级人工智能论文的综述,涵盖了用于长上下文预训练的Lighthouse Attention、grep与嵌入检索在编码代理中的对比,以及揭示LLMs中几何计算器的机制可解释性工作。