AGI Maze 作为世界建模智能体的基准框架

arXiv cs.AI 论文

摘要

本文提出了AGI Maze,一个旨在评估AI智能体世界建模能力的基准框架。

arXiv:2607.00627v1 公告类型:新 摘要:大型语言模型(LLMs)是强大的模式补全系统,但其默认操作模式——从静态上下文中预测下一个词元——并不能可靠地产生对外部世界的持久、可操纵的表征。许多看似文本中“推理”的任务在环境变为部分可观测、有状态,并且需要记忆和对隐藏状态的结构化假设时,会变得困难得多。AGI Maze是一个轻量级框架,用于构建此类环境,无需高维感官输入。它提供了一系列基于网格的迷宫任务,具有简洁的API和多种难度级别。目标是创建基准,要求智能体必须学习并使用世界状态表征,而不仅仅是根据现成观察推断局部规则。我们对几个基础LLM在简单迷宫上进行了初步评估,显示它们在LLM推理时无法在内部表征迷宫。我们还引入了一个基线智能体,允许其使用消息历史作为工作记忆,在智能体运行时构建观察描述。尽管这可以提升性能,但仍然不足以让LLM智能体在人类绰绰有余的步数预算内可靠地解决即使是小型迷宫。
查看原文
查看缓存全文

缓存时间: 2026/07/02 05:40

# AGI Maze 作为世界建模智能体的基准框架
来源:https://arxiv.org/abs/2607.00627
书目工具

## 书目与引用工具

文献浏览器(可切换)

代码、数据、媒体

## 与本文相关的代码、数据与媒体

演示

## 演示

相关论文

## 推荐与搜索工具

关于 arXivLabs

## arXivLabs:与社区合作开展实验性项目

arXivLabs 是一个框架,允许合作者直接在 arXiv 网站上开发和分享新的 arXiv 功能。

凡与 arXivLabs 合作的个人和组织均已接受并认同我们关于开放性、社区精神、卓越性以及用户数据隐私的价值观。arXiv 致力于坚守这些价值观,仅与遵循该价值观的合作伙伴合作。

您是否有能为 arXiv 社区增添价值的项目构想?**了解更多关于 arXivLabs 的信息** (https://info.arxiv.org/labs/index.html)。

相似文章

历经考验:在陌生环境中重新评估智能体的能力

Hugging Face Daily Papers

GauntletBench是一个新的基于网页的基准测试,用于评估AI智能体在挑战性场景中的表现,重点关注时间感知、图形理解和3D推理。结果表明,最先进的智能体成功率仅为19.1%,而非专业人士则超过80%,凸显了当前智能体系统的显著局限性。

Agent-World:面向演进式通用智能体的现实世界环境合成扩展

Hugging Face Daily Papers

# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [![](https://cdn-avatars.huggingface.co/v1/production/uploads/61cd4b833dd34ba1985e0753/BfHfrwotoMESpXZOHiIe4.png)](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。