@seclink: 又一个基准测试,收录一下样本和标注。
摘要
PatronusAI 发布了 SpeedrunBench,这是首个评估 AI 代理在多个电子游戏中速通性能的基准测试。
又一个基准测试,收录一下样本和标注。
查看缓存全文
缓存时间: 2026/09/04 04:15
又一个基准测试,记录一下样本与标注。
PatronusAI (@PatronusAI): 今日,我们推出SpeedrunBench:首个衡量AI代理通关电子游戏速度的基准测试。
我们要求前沿模型不仅要完成游戏,更要在《马里奥赛车》《宝可梦》等10款作品中实现速通挑战。
在较简单的游戏中,代理的表现已接近…
相似文章
@svpino: 这是一个很酷的基准测试,通过电子游戏来测试智能体。基本上,他们用速通游戏的方式来测试智能体…
SpeedrunBench 是一个新基准测试,通过让 AI 智能体速通电子游戏来评估其规划、学习和决策能力,并设有公开排行榜用于模型比较。
新基准测试发布
一个新基准测试已发布,可能用于评估AI或软件性能。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
ProgramBench(5分钟阅读)
ProgramBench 是一项全新的基准测试,用于评估 AI 智能体在无法获取源代码或反编译工具的情况下,仅凭编译后的二进制文件和文档重建完整软件项目的能力。
@gneubig: SkillsBench 是一个很棒的基准,我这么说不仅仅是因为 @OpenHandsDev 在上面击败了所有其他人。技能……
SkillsBench 1.1 是一个用于评估 AI 代理使用技能能力的基准,现已完全审计且无错误。