@gneubig: 代理评估非常慢且非常昂贵。我们能否通过单轮任务来大致了解LLM在代理任务上的表现……?
摘要
PACE 提出了一种代理方法,通过使用更便宜的单轮任务来估计 LLM 的代理能力,从而降低了全面代理评估的成本和时间。
代理评估非常慢且非常昂贵。
我们能否通过仅运行单轮任务来大致了解LLM在代理任务上的表现?
我们的方法 PACE 提出了一种有效的策略来实现这一点!
查看缓存全文
缓存时间: 2026/07/06 22:22
智能体评估又慢又贵。
那我们能否只通过单轮任务来大致评估一个 LLM 在智能体任务上的表现?
我们的方法 PACE 提出了一种有效的策略来实现这一点!
Yueqi Song (@yueqi_song): 🚀很高兴发布 PACE:一种智能体能力评估的代理方法!
在 SWE-Bench 和 GAIA 等基准上评估 LLM 智能体成本高、速度慢、基础设施开销大,每个模型往往需要花费 $$$ 和数小时甚至数天的时间。
❓但我们真的每次都需要运行完整的智能体
相似文章
PACE:一种用于代理能力评估的代理框架
本文介绍了PACE,一种通过使用一小部分成本较低的非智能体评估实例来预测昂贵的LLM智能体基准得分的框架,以低于1%的成本实现了高精度。
GAUGE:在面向任务代理的用户模拟评估中不应信任LLM-as-a-Judge的时机
GAUGE是一个可重用的离线协议,用于衡量在评估面向任务代理时使用LLM-as-a-Judge的有效性,揭示了满足-成功差距,并提出了一种校准方法以提高准确性。
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
AgentJudgeBench:一个用于评估LLM法官在代理工具调用中的多难度基准
AgentJudgeBench是一个基准,用于评估LLM法官在代理工具调用场景中的可靠性,揭示了结构性上限等限制以及真实情况对对齐的微妙影响。
大多数大语言模型评估工具是否仍然过于侧重提示词?
作者质疑当前的 LLM 评估工具是否过于关注孤立的提示词,而忽视了完整的工作流程和智能体交互,并指出逐步的准确性可能会掩盖生产环境中整体行为的偏差。