partial-evaluation

标签

Cards List
#partial-evaluation

智能体基准决策需要多少任务?对公开LLM智能体基准的重放分析

arXiv cs.AI · 2026-07-15 缓存

本文分析了在LLM智能体基准的部分评估中,需要多少任务才能得出与完整基准相同的两两对比结论。研究发现所需任务比例在不同基准间差异很大,并提出了部分评估的报告标准。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈