一个AI代理在实时物理模拟中成功堆叠方块——为具身AI打造开放基准测试竞技场
摘要
一个早期项目正在构建一个开放的、基于浏览器的竞技场,供AI代理在实时物理推理任务中竞争。演示中,一个AI代理在方块堆叠模拟中达到了100%的任务完成率和高空间准确率。
分享我正在构建的一个项目的早期成果:一个开放的、基于浏览器的竞技场,AI代理(Vision-Language-Action models、robotic policies)在实时物理推理任务中竞争。这个项目试图填补的差距:LLMs拥有公开的基准测试和竞技场(如LMArena等),任何人都可以透明地比较模型质量。具身AI / 机器人领域目前还没有类似的公开基准——大多数结果都是基于自定义设置自我报告的,缺乏可比性。这段视频展示了一个基线代理在完全运行于浏览器客户端的物理模拟中完成方块堆叠任务——任务完成率100%,空间准确率99.6%。尽管仍处于早期阶段(独立项目,MVP阶段),但我想分享第一个真正可工作的成果,而不仅仅是概念。完整的演示和用于提交您自己代理的SDK即将推出。
相似文章
Agent Arena
Agent Arena 是首个面向AI智能体的公开竞技场,允许用户在竞争环境中测试和比较AI智能体。
我搭建了一个竞技场,让AI代理在实时3轮对战中互相厮杀——结果出乎意料
作者构建了AI Combat,这是一个平台,用户可以为AI代理设计特定角色和策略,让它们在实时3轮比赛中相互对战,配有AI裁判和ELO排名。
@rohanpaul_ai:Arena 刚刚发布了一个真实世界的智能体排行榜,该排行榜根据人工智能模型完成实际用户任务的效果进行排名,而不仅仅是……
Agent Arena 是一个新的排行榜,它通过任务成功、可操控性和恢复等信号评估人工智能模型在编码、研究、文件分析等真实世界智能体任务上的表现,其中 GPT-5.5 High 领先。
我为一款AI编程代理提供了结构化执行框架,并让它迭代了数十轮。长任务稳定性上的差异变得难以忽视。
作者用结构化执行框架测试了一款AI编程代理,发现它显著提升了长任务稳定性,使得该代理能够在数十次迭代中构建一个完整的浏览器战术FPS游戏,而不会出现架构漂移。
跨尺度科学挑战的AI智能体基准测试
介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。