ClawBench: AI代理能否完成日常在线任务?

Reddit r/openclaw 工具

摘要

ClawBench是一个评估AI代理在日常在线任务中表现的基准。此次V2更新带来了改进或新任务。

V2更新
查看原文

相似文章

ResearchClawBench:面向端到端自主科学研究的基准测试

Hugging Face Daily Papers

ResearchClawBench 是一个用于评估端到端自主科学研究的基准测试,涵盖来自10个领域的40个任务,结果显示当前AI智能体和LLM的重新发现准确率较低,其中Claude Code平均得分为21.5,Claude-Opus-4.7平均得分为20.7(在可能的总分中)。