代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3?

arXiv cs.AI 论文

摘要

本文研究了代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3基准测试,为AGI和推理研究做出贡献。

arXiv:2607.15439v1 公告类型:新 摘要:我们之前的ARC-AGI-3智能体集成了可执行世界建模、计划性简化和精确回放验证,但尚不清楚是哪个思路带来了其性能提升。为了解决这个归因问题,我们设计了四个嵌套的基于Codex的智能体:一个文本基线;一个没有回放验证的灵活接口可执行世界模型;同一个可执行模型加上计划性简化;以及一个保留简化并要求精确复现记录观察的固定接口验证处理。主要研究使用gpt-5.4和gpt-5.5在高和极高推理努力下对公开的ARC-AGI-3游戏对所有四个智能体进行了评估。探索性后续实验使用gpt-5.6-sol在极高和最大推理努力下评估了文本和验证变体。最稳健的结果是,每个智能体变体都随着更强的模型和更高的推理努力而改进。在每个模型-努力设置内,变体之间的差异小于预期,而各个组件的影响因设置而异。要求持久可执行交付并不总是有益的:在gpt-5.5的两种设置中,文本变体都优于灵活接口可执行变体。在四个模型-努力设置中的三个中,简化提高了性能,只有最弱的设置是例外。完整的验证处理在所有四个设置中排名第一,尽管它使用了更多资源。在gpt-5.6-sol的后续实验中,验证变体在两种推理努力下都完全解决了每个公开游戏,达到了约99%的RHAE,并且使用的总动作数不到人类基线的一半。由于模型是在这些游戏之后出现的,并且保留集的表现尚未测试,因此该结果应仅解释为公开集的饱和。
查看原文
查看缓存全文

缓存时间: 2026/07/20 09:21

# 编码智能体需要可执行世界模型、简化与验证来解决 ARC-AGI-3 吗?
来源: https://arxiv.org/abs/2607.15439
文献管理工具

## 文献管理与引文工具

文献浏览器 切换

代码、数据与媒体

## 本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐工具与搜索工具

关于 arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和分享新的 arXiv 功能。

与 arXivLabs 合作的个人和组织已接受并认同我们的价值观:开放、社区、卓越和用户数据隐私。arXiv 致力于这些价值观,仅与遵守这些价值观的合作伙伴合作。

有一个能为 arXiv 社区带来价值的项目想法吗?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html).

相似文章

编码代理作为世界模拟器表现良好

arXiv cs.AI

本文提出了一种基于代理的框架,利用编码代理从自然语言提示生成物理上可信的世界模拟,在物理准确性和指令保真度方面优于基于视频的模型。

验证前沿:编码智能体奖励并无银弹

Hugging Face Daily Papers

本文探讨了验证AI编码智能体输出的挑战,认为随着模型改进,验证正变得比生成更困难。它分析了四种奖励构建方式,并表明随着模型能力的增长,没有固定奖励函数能保持有效。