@gneubig: 代理评估非常慢且非常昂贵。我们能否通过单轮任务来大致了解LLM在代理任务上的表现……?

X AI KOLs Timeline 论文

摘要

PACE 提出了一种代理方法,通过使用更便宜的单轮任务来估计 LLM 的代理能力,从而降低了全面代理评估的成本和时间。

代理评估非常慢且非常昂贵。 我们能否通过仅运行单轮任务来大致了解LLM在代理任务上的表现? 我们的方法 PACE 提出了一种有效的策略来实现这一点!
查看原文
查看缓存全文

缓存时间: 2026/07/06 22:22

智能体评估又慢又贵。

那我们能否只通过单轮任务来大致评估一个 LLM 在智能体任务上的表现?

我们的方法 PACE 提出了一种有效的策略来实现这一点!

Yueqi Song (@yueqi_song): 🚀很高兴发布 PACE:一种智能体能力评估的代理方法!

在 SWE-Bench 和 GAIA 等基准上评估 LLM 智能体成本高、速度慢、基础设施开销大,每个模型往往需要花费 $$$ 和数小时甚至数天的时间。

❓但我们真的每次都需要运行完整的智能体

相似文章

PACE:一种用于代理能力评估的代理框架

Hugging Face Daily Papers

本文介绍了PACE,一种通过使用一小部分成本较低的非智能体评估实例来预测昂贵的LLM智能体基准得分的框架,以低于1%的成本实现了高精度。