代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3?
摘要
本文研究了代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3基准测试,为AGI和推理研究做出贡献。
arXiv:2607.15439v1 公告类型:新
摘要:我们之前的ARC-AGI-3智能体集成了可执行世界建模、计划性简化和精确回放验证,但尚不清楚是哪个思路带来了其性能提升。为了解决这个归因问题,我们设计了四个嵌套的基于Codex的智能体:一个文本基线;一个没有回放验证的灵活接口可执行世界模型;同一个可执行模型加上计划性简化;以及一个保留简化并要求精确复现记录观察的固定接口验证处理。主要研究使用gpt-5.4和gpt-5.5在高和极高推理努力下对公开的ARC-AGI-3游戏对所有四个智能体进行了评估。探索性后续实验使用gpt-5.6-sol在极高和最大推理努力下评估了文本和验证变体。最稳健的结果是,每个智能体变体都随着更强的模型和更高的推理努力而改进。在每个模型-努力设置内,变体之间的差异小于预期,而各个组件的影响因设置而异。要求持久可执行交付并不总是有益的:在gpt-5.5的两种设置中,文本变体都优于灵活接口可执行变体。在四个模型-努力设置中的三个中,简化提高了性能,只有最弱的设置是例外。完整的验证处理在所有四个设置中排名第一,尽管它使用了更多资源。在gpt-5.6-sol的后续实验中,验证变体在两种推理努力下都完全解决了每个公开游戏,达到了约99%的RHAE,并且使用的总动作数不到人类基线的一半。由于模型是在这些游戏之后出现的,并且保留集的表现尚未测试,因此该结果应仅解释为公开集的饱和。
查看缓存全文
缓存时间: 2026/07/20 09:21
# 编码智能体需要可执行世界模型、简化与验证来解决 ARC-AGI-3 吗? 来源: https://arxiv.org/abs/2607.15439 文献管理工具 ## 文献管理与引文工具 文献浏览器 切换 代码、数据与媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐工具与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。 与 arXivLabs 合作的个人和组织已接受并认同我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 致力于这些价值观,仅与遵守这些价值观的合作伙伴合作。 有一个能为 arXiv 社区带来价值的项目想法吗?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html).
相似文章
ARCANA:面向ARC-AGI-2推理的反射式多智能体程序合成框架
ARCANA是一个反射式多智能体框架,将ARC-AGI-2抽象推理任务分解为迭代感知、假设生成、符号执行和反射精炼,在严格约束下提升推理效率。
面向ARC-AGI-1的抽象推理与泛化的经济型智能体框架
本文提出了面向ARC-AGI-1的经济型智能体框架,通过探索者-定义者流水线和反思型协调器,使用DeepSeek V3.2无需微调即可实现强大性能,以低成本达到67.25%的pass@2。
编码代理作为世界模拟器表现良好
本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。
AGI Maze 作为世界建模智能体的基准框架
本文提出了AGI Maze,一个旨在评估AI智能体世界建模能力的基准框架。
验证前沿:编码智能体奖励并无银弹
本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。