@allen_ai: 大多数模型仅对一部分现有基准进行了评估。ArtifactLinker,我们的新系统,预测哪些…
摘要
Allen AI 推出了 ArtifactLinker,该系统可预测哪些AI模型能在 HuggingFace 的基准测试中取得最先进的结果,并通过运行验证。
查看缓存全文
缓存时间: 2026/05/23 12:03
大多数模型仅在一小部分现有基准测试上接受评估。
ArtifactLinker 是我们新开发的系统,它能够预测哪些模型会在 @HuggingFace 上托管的基准测试中达到新的最先进水平(SOTA),然后运行评估加以验证。
ArtifactLinker 构建于 HuggingFace 数据图谱之上——模型与数据集作为节点,已报告的评估分数构成边。
我们训练了一个图神经网络(GNN)来对模型进行排序,判断哪些模型有可能在哪些基准测试上达到新的 SOTA,其效果优于基于提示的大语言模型(LLM)。
在 ArtifactLinker 中,一个 LLM 编程智能体负责编写并运行评估代码,且各次运行间共享内存。
我们发现,该智能体在 72.6% 的情况下,其结果与官方报告分数的差距在 20% 以内。
借助 ArtifactLinker,我们发现了许多案例:一个强大的模型从未在某个基准测试上接受过评估,而它本可达到甚至接近该基准的 SOTA。
我们还发现,在自然语言推理任务上,像 Gemma 这样的新 LLM 往往不及 DeBERTa 等较老的模型。
我们正在发布一个数据集,其中包含 14K 个 HuggingFace 模型、数据集、论文及代码库,通过 51K 次评估、微调及引用相互关联,同时开源了 ArtifactLinker 的代码。
希望这能帮助更多人发现 SOTA 评估结果。
代码:https://github.com/allenai/artifact-linker…
数据:https://huggingface.co/datasets/lwaekfjlk/artifact-bench…
相似文章
@haofeiyu44:我们能否将 Hugging Face Hub——这个拥有海量工件的平台——转变为一个自我进化的发现机器?我们可以……
介绍 ArtifactLinker,这是一个将 HuggingFace 建模为工件图,并利用 GNN 和 LLM 代理自动发现最先进模型和研究见解的框架。
我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。
Artifact-Bench:评估多模态大语言模型在检测与评估AI生成视频伪影方面的能力
Artifact-Bench是一个综合性基准,用于评估多模态大语言模型在检测和分析AI生成视频伪影方面的表现,揭示了它们的显著局限性以及与人类感知的错位。
@Lyubh22:编程基准测试正在趋于饱和。AI4Research 是下一个前沿领域。很高兴看到我们的 MLS-Bench(https://mls-bench.co…)
正式发布 MLS-Bench,这是首个获得社区广泛采用的 AI4Research 基准测试,它在 12 个领域的 140 个可执行任务上测试 AI 智能体,以提出模块化的机器学习改进方案。该帖子还包含 Claude Opus 4.6 和 GPT-5.4 等模型的排行榜分数。
@svpino: 我不信任基准测试。我们都看过这样的戏码:新模型在基准测试中击败所有人。人们热议它。然后…
这条推文批判了传统的AI基准测试,并介绍了TRACES,这是一个新的基准测试,专注于评估模型如何得出答案的过程,包括工具使用、错误纠正和证据追踪。