benchmark-saturation

标签

Cards List
#benchmark-saturation

当AI基准陷入平台期:基准饱和的系统性研究

Hacker News Top ↗ · 2026-08-04 缓存

一项系统性研究,定义并分析了60个语言模型基准中的基准饱和现象,发现近一半的基准已出现饱和,且专家精选的基准更具韧性,为构建持久评估提供了设计选择。

0 人收藏 0 人点赞
#benchmark-saturation

CurveShift: Is Agent Progress Scalar? Separating Level from Shape

arXiv cs.CL ↗ · 2026-08-04 缓存

This paper introduces CurveShift, an analysis method that separates overall ability gains from difficulty-specific improvements in LLM agents. Using METR time-horizon data and LiveCodeBench, it finds that most apparent shifts toward harder tasks are ceiling effects, though a genuine hard-task effect exists for reasoning models in competitive programming.

0 人收藏 0 人点赞
#benchmark-saturation

前沿大型语言模型的响应漂移

arXiv cs.CL ↗ · 2026-07-24 缓存

一项针对10个前沿大语言模型、涵盖62个问题的大规模人类评估发现,所有模型都表现出响应漂移,其中大多数模型收敛到78-81%的偏差上限,而两个模型实现了较低的偏差。漂移程度因领域和问题而异,自动指标几乎无法解释人类判断,这凸显了人类评估的必要性。

0 人收藏 0 人点赞
#benchmark-saturation

Agents Last Exam 最迟明年二月将饱和。

Reddit r/singularity ↗ · 2026-07-20

文章预测AI基准测试‘Agents Last Exam’将在明年二月前达到饱和(模型性能达到极限)。

0 人收藏 0 人点赞
#benchmark-saturation

基准饱和之后:CORE-Bench 案例研究

arXiv cs.AI ↗ · 2026-06-26 缓存

本文反对在基准准确率饱和时直接“废止并替换”的做法,以 CORE-Bench 为例,证明在准确率持平后,从构建效度、效率、可靠性以及人机协作等维度衡量智能体性能,仍能获得有意义的洞见。

0 人收藏 0 人点赞
#benchmark-saturation

离线偏好轨迹评估

arXiv cs.LG ↗ · 2026-06-17 缓存

本文提出了一种针对智能体系统的离线偏好轨迹评估方法,通过时间偏好而非二元成功指标来比较轨迹。研究表明,该方法将平局比例从约75%降低到35%,从而提升了跨多样化基准的区分能力和数据效率。

0 人收藏 0 人点赞
#benchmark-saturation

BenchEvolver: 基于解决方案进化的前沿任务合成

Hugging Face Daily Papers ↗ · 2026-05-31 缓存

BenchEvolver 是一个进化框架,能够自动从现有编程问题中生成更难的题目,创建保持有效性和多样性的挑战性基准,同时支持模型自我改进和提升训练性能。

0 人收藏 0 人点赞
#benchmark-saturation

前沿模型的成长阵痛:当排行榜不再能区分时,接下来该测量什么

arXiv cs.LG ↗ · 2026-05-20

本文引入了种群耦合趋势和h场诊断法,分析前沿AI模型在编码与推理能力之间的关系,发现各能力相互协作,但不同实验室侧重点不同。本文提供了测量指南,并预测了基准测试趋于饱和的趋势。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈