基准测试:万事万物,无处不在,一气呵成

Hugging Face Daily Papers 论文

摘要

介绍 Benchmark Agent,一个完全自主的系统,用于创建多样化的基准测试,只需最少的人工干预,支持跨领域的持续模型评估。

基准测试对于评估和推进LLMs和MLLMs至关重要,它提供了标准化且明确的性能衡量标准。然而,构建基准测试是劳动密集型的且难以复用,引发了可持续性和可扩展性的担忧。此外,现有基准测试在发布后往往很快达到性能饱和,导致对最先进模型的区分度不足。为应对这些挑战,我们引入了Benchmark Agent,一个完全自主的智能系统,专门用于基准测试构建。我们的框架编排了完整的基准测试构建流程,从用户查询分析和子任务设计到数据标注和质量控制。为了评估Benchmark Agent,我们将其用于生成15个代表性基准测试,涵盖多种评估场景,包括文本理解、多模态理解和领域特定推理。大量实验,包括人工评估、LLM作为评判者的评估以及一致性检查,表明Benchmark Agent能够在最少人工参与的情况下生成高质量的基准测试样本。更重要的是,通过持续评估,我们观察到几个有见地的发现,包括当前模型在某些领域特定推理任务上存在困难。我们相信快速演进的基准测试将极大地惠及研究社区。预览和代码将公开在演示页面和代码仓库中。
查看原文
查看缓存全文

缓存时间: 2026/06/05 18:10

论文页面 - Benchmark Everything Everywhere All at Once

来源:https://huggingface.co/papers/2606.06462

摘要

自动化基准创建系统能够以最少的人工干预生成多样化的评估数据集,从而在多个领域实现持续的模型评估。

基准测试通过提供标准化且明确的性能度量,对于评估和推进 LLMs (https://huggingface.co/papers?q=LLMs) 与 MLLMs (https://huggingface.co/papers?q=MLLMs) 至关重要。然而,基准的构建过程劳动密集且难以复用,引发了关于可持续性与可扩展性的担忧。此外,现有基准在发布后往往迅速达到性能饱和,导致无法有效区分最先进的模型。为应对这些挑战,我们引入了 Benchmark Agent —— 一个完全自主的代理系统,专门用于基准构建。我们的框架编排了完整的基准构建 (https://huggingface.co/papers?q=benchmark%20construction) 流水线,从用户查询分析和子任务设计,到数据标注与质量控制。为评估 Benchmark Agent,我们将其应用于生成 15 个代表性基准,覆盖多种评估场景,包括文本理解、多模态理解以及领域特定推理 (https://huggingface.co/papers?q=domain-specific%20reasoning)。广泛的实验,包括人工评估 (https://huggingface.co/papers?q=human%20evaluation)、LLM 作为裁判评估 (https://huggingface.co/papers?q=LLM-as-a-judge%20assessment) 以及一致性检查 (https://huggingface.co/papers?q=consistency%20checks),表明 Benchmark Agent 能在极少人工参与下生成高质量基准样本。更重要的是,通过持续评估,我们观察到若干洞见,包括当前模型在某些领域特定推理 (https://huggingface.co/papers?q=domain-specific%20reasoning) 任务上仍存在困难。我们相信,快速演进的基准将对研究社区做出重要贡献。预览和代码将在演示页面和代码仓库中公开提供。

查看 arXiv 页面 (https://arxiv.org/abs/2606.06462) 查看 PDF (https://arxiv.org/pdf/2606.06462) 项目页面 (https://benchmarkagent.github.io/) GitHub1 (https://github.com/Shiyun-x/Benchmark-Agent) 添加到合集 (https://huggingface.co/login?next=%2Fpapers%2F2606.06462)

在您的代理中获取这篇论文:

hf papers read 2606\.06462

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。

引用此论文的数据集 0

没有数据集链接此论文

在数据集 README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。

引用此论文的 Space 0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.06462 即可从此页面链接。

包含此论文的合集 0

没有包含此论文的合集

将此论文添加到合集中 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

Anchor:缓解智能体基准生成中的工件漂移

arXiv cs.AI

Anchor是一个任务生成流水线,通过从单一的约束优化规范中联合生成指令、环境、解决方案和验证器,解决了AI智能体基准中的工件漂移问题,为企业工作流提供一致且可审计的评估任务。论文介绍了ERP-Bench——一个包含生产级ERP系统中300个长时任务的基准,结果显示前沿模型在26.1%的试验中满足显式约束,但仅17.4%的试验达到最优解。

AgenticDataBench:面向数据代理的综合性基准测试

Hugging Face Daily Papers

介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。