AGI Maze 作为世界建模智能体的基准框架
摘要
本文提出了AGI Maze,一个旨在评估AI智能体世界建模能力的基准框架。
查看缓存全文
缓存时间: 2026/07/02 05:40
# AGI Maze 作为世界建模智能体的基准框架 来源:https://arxiv.org/abs/2607.00627 书目工具 ## 书目与引用工具 文献浏览器(可切换) 代码、数据、媒体 ## 与本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于 arXivLabs ## arXivLabs:与社区合作开展实验性项目 arXivLabs 是一个框架,允许合作者直接在 arXiv 网站上开发和分享新的 arXiv 功能。 凡与 arXivLabs 合作的个人和组织均已接受并认同我们关于开放性、社区精神、卓越性以及用户数据隐私的价值观。arXiv 致力于坚守这些价值观,仅与遵循该价值观的合作伙伴合作。 您是否有能为 arXiv 社区增添价值的项目构想?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。
相似文章
历经考验:在陌生环境中重新评估智能体的能力
GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。
代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3?
本文研究了代码智能体是否需要可执行世界模型、简化和验证来解决ARC-AGI-3基准测试,为AGI和推理研究做出贡献。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。