agent-execution

标签

Cards List
#agent-execution

StateM: 通过Harness Scaling在Terminal-Bench 2.1上达到95.3%原始准确率,或仅需15美元的前沿运行

Hugging Face Daily Papers · 2026-08-15 缓存

StateM是一个运行时系统,通过持久状态和可恢复的运行手册增强长期代理执行,在Terminal-Bench 2.1上达到95.3%的准确率,并显著降低API成本。

0 人收藏 0 人点赞
#agent-execution

@seclink: Agent 执行与通用代码执行的最大区别在于:Agent 执行需要极低的冷启动时间(毫秒级响应)、频繁的文件系统状态同步(Agent 需要读写中间代码、产出文件)以及灵活的 API/网络访问控制。 以下是精简后的两个核心推荐方案: 方案一…

X AI KOLs Timeline · 2026-07-08 缓存

该文讨论了Agent执行与通用代码执行的区别,并推荐了两种沙箱方案:基于Firecracker的E2B和基于Docker的OpenSandbox,分别适合生产级和私有化部署场景。

0 人收藏 0 人点赞
#agent-execution

OpenClawBench:真实世界代理执行轨迹中过程侧异常的基准测试

arXiv cs.AI · 2026-05-29 缓存

本文介绍了OpenClawBench,这是一个大规模数据集,用于对真实世界AI代理执行轨迹中的过程侧异常进行基准测试。该数据集揭示了任务成功可能掩盖过程失败,9.33%通过oracle测试的执行仍包含异常,并通过一种新颖的分类法提供了结构化监督。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈