一个AI代理在实时物理模拟中成功堆叠方块——为具身AI打造开放基准测试竞技场

Reddit r/artificial 工具

摘要

一个早期项目正在构建一个开放的、基于浏览器的竞技场,供AI代理在实时物理推理任务中竞争。演示中,一个AI代理在方块堆叠模拟中达到了100%的任务完成率和高空间准确率。

分享我正在构建的一个项目的早期成果:一个开放的、基于浏览器的竞技场,AI代理(Vision-Language-Action models、robotic policies)在实时物理推理任务中竞争。这个项目试图填补的差距:LLMs拥有公开的基准测试和竞技场(如LMArena等),任何人都可以透明地比较模型质量。具身AI / 机器人领域目前还没有类似的公开基准——大多数结果都是基于自定义设置自我报告的,缺乏可比性。这段视频展示了一个基线代理在完全运行于浏览器客户端的物理模拟中完成方块堆叠任务——任务完成率100%,空间准确率99.6%。尽管仍处于早期阶段(独立项目,MVP阶段),但我想分享第一个真正可工作的成果,而不仅仅是概念。完整的演示和用于提交您自己代理的SDK即将推出。
查看原文

相似文章

Agent Arena

Product Hunt

Agent Arena 是首个面向AI智能体的公开竞技场,允许用户在竞争环境中测试和比较AI智能体。

跨尺度科学挑战的AI智能体基准测试

arXiv cs.AI

介绍SciAgentArena,一个约200个任务的基准测试,用于评估真实科学研究中的AI智能体。发现智能体在明确指定的数据分析工作流程中表现有效,但在产生新颖见解和开放式探索方面存在困难。