@SoHarshhh: 非常高兴地分享,“ToolFailBench” 已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。大多数基准测试…
摘要
ToolFailBench,一个用于评估工具使用型代理的诊断基准,已被两个 ICML 2026 研讨会(FAGEN 和 AIWILD)接收。
查看缓存全文
缓存时间: 2026/06/01 11:20
非常高兴地分享——“ToolFailBench”已被ICML 2026的两个研讨会FAGEN和AIWILD接收。
大多数基准测试用一个单一的总体成功率来评估工具使用型智能体,但这个数字无法解释模型实际上为何失败。ToolFailBench是一个诊断工具。https://t.co/UCKA2H29Aw
相似文章
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
ToolGate:用于工具依赖型科学基准构建的可执行验收流程
ToolGate是一个用于构建科学基准的可执行流程,它通过可执行脚本、随机无工具筛选和工具使用代理来验证生成的任务,减少人工劳动并提高可审计性。
EvalDetectBench:用于测量前沿语言模型评估意识的基准
本文介绍了EvalDetectBench,这是一个用于测量前沿语言模型评估意识的开放基准和流水线,旨在解决现有方法中的偏差,以提升AI安全评估。
TOBench:面向真实世界工具使用智能体的任务导向全模态基准
TOBench是一个新的基准测试,用于评估AI智能体在真实世界、任务导向的工具使用中的表现,涉及多模态输入和闭环验证。实验表明,像Qwen 3.5 Plus这样的顶级模型仅达到41%的成功率,远低于94%的人类基准,凸显了显著的差距。