标签
StateM是一个运行时系统,通过持久状态和可恢复的运行手册增强长期代理执行,在Terminal-Bench 2.1上达到95.3%的准确率,并显著降低API成本。
该文讨论了Agent执行与通用代码执行的区别,并推荐了两种沙箱方案:基于Firecracker的E2B和基于Docker的OpenSandbox,分别适合生产级和私有化部署场景。
本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。