基准测试:万事万物,无处不在,一气呵成
摘要
介绍 Benchmark Agent,一个完全自主的系统,用于创建多样化的基准测试,只需最少的人工干预,支持跨领域的持续模型评估。
查看缓存全文
缓存时间: 2026/06/05 18:10
论文页面 - Benchmark Everything Everywhere All at Once
来源:https://huggingface.co/papers/2606.06462
摘要
自动化基准创建系统能够以最少的人工干预生成多样化的评估数据集,从而在多个领域实现持续的模型评估。
基准测试通过提供标准化且明确的性能度量,对于评估和推进 LLMs (https://huggingface.co/papers?q=LLMs) 与 MLLMs (https://huggingface.co/papers?q=MLLMs) 至关重要。然而,基准的构建过程劳动密集且难以复用,引发了关于可持续性与可扩展性的担忧。此外,现有基准在发布后往往迅速达到性能饱和,导致无法有效区分最先进的模型。为应对这些挑战,我们引入了 Benchmark Agent —— 一个完全自主的代理系统,专门用于基准构建。我们的框架编排了完整的基准构建 (https://huggingface.co/papers?q=benchmark%20construction) 流水线,从用户查询分析和子任务设计,到数据标注与质量控制。为评估 Benchmark Agent,我们将其应用于生成 15 个代表性基准,覆盖多种评估场景,包括文本理解、多模态理解以及领域特定推理 (https://huggingface.co/papers?q=domain-specific%20reasoning)。广泛的实验,包括人工评估 (https://huggingface.co/papers?q=human%20evaluation)、LLM 作为裁判评估 (https://huggingface.co/papers?q=LLM-as-a-judge%20assessment) 以及一致性检查 (https://huggingface.co/papers?q=consistency%20checks),表明 Benchmark Agent 能在极少人工参与下生成高质量基准样本。更重要的是,通过持续评估,我们观察到若干洞见,包括当前模型在某些领域特定推理 (https://huggingface.co/papers?q=domain-specific%20reasoning) 任务上仍存在困难。我们相信,快速演进的基准将对研究社区做出重要贡献。预览和代码将在演示页面和代码仓库中公开提供。
查看 arXiv 页面 (https://arxiv.org/abs/2606.06462) 查看 PDF (https://arxiv.org/pdf/2606.06462) 项目页面 (https://benchmarkagent.github.io/) GitHub1 (https://github.com/Shiyun-x/Benchmark-Agent) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2606.06462)
在您的代理中获取这篇论文:
hf papers read 2606\.06462
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。
引用此论文的数据集 0
没有数据集链接此论文
在数据集 README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。
引用此论文的 Space 0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。
包含此论文的合集 0
没有包含此论文的合集
将此论文添加到合集中 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
AJ-Bench:面向环境感知评估的 Agent-as-a-Judge 评测基准
AJ-Bench 提出一套评测基准,用于衡量 Agent-as-a-Judge 系统通过与环境交互来验证智能体行为的能力,覆盖搜索、数据系统与 GUI 领域的 155 项任务。
Agent-ValueBench:一个评估智能体价值观的综合基准
本文提出了 Agent-ValueBench,这是一个旨在评估自主智能体价值观的综合基准,揭示了智能体的价值观与其底层语言模型存在分歧。
Anchor:缓解智能体基准生成中的工件漂移
Anchor是一个任务生成流水线,通过从单一的约束优化规范中联合生成指令、环境、解决方案和验证器,解决了AI智能体基准中的工件漂移问题,为企业工作流提供一致且可审计的评估任务。论文介绍了ERP-Bench——一个包含生产级ERP系统中300个长时任务的基准,结果显示前沿模型在26.1%的试验中满足显式约束,但仅17.4%的试验达到最优解。
超越函数调用:在工具环境不可靠性下对工具使用代理进行基准测试
介绍ToolBench-X,这是一个基准测试,用于评估各种工具环境可靠性隐患下的大语言模型代理,揭示了与干净环境相比性能上的显著差距。
AgenticDataBench:面向数据代理的综合性基准测试
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。