AGI Maze 作为世界建模智能体的基准框架
摘要
本文提出了AGI Maze,一个旨在评估AI智能体世界建模能力的基准框架。
查看缓存全文
缓存时间: 2026/07/02 05:40
# AGI Maze 作为世界建模智能体的基准框架 来源:https://arxiv.org/abs/2607.00627 书目工具 ## 书目与引用工具 文献浏览器(可切换) 代码、数据、媒体 ## 与本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作开展实验性项目 arXivLabs 是一个框架,允许合作者直接在 arXiv 网站上开发和分享新的 arXiv 功能。 凡与 arXivLabs 合作的个人和组织均已接受并认同我们关于开放性、社区精神、卓越性以及用户数据隐私的价值观。arXiv 致力于坚守这些价值观,仅与遵循该价值观的合作伙伴合作。 您是否有能为 arXiv 社区增添价值的项目构想?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准
介绍了AutoWorldModel-Bench,这是一个闭环基准测试,用于评估AI编程代理在八个游戏环境中进行自主世界模型研究的能力。该基准测试表明,Codex-5.4和Claude Opus 4.6等前沿代理在大多数会话中进行了非平凡的研究型改进。
历经考验:在陌生环境中重新评估智能体的能力
GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。
代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3?
本文研究了代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3基准测试,为AGI和推理研究做出贡献。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
使用代理群体构建世界模型
作者描述了构建一个世界模型框架,该框架协调研究代理以最大化评估指标,使用地理空间输入在多模态掩码重建任务中实现了25倍的分数提升。