@allen_ai: 大多数模型仅对一部分现有基准进行了评估。ArtifactLinker,我们的新系统,预测哪些…

X AI KOLs Following 工具

摘要

Allen AI 推出了 ArtifactLinker,该系统可预测哪些AI模型能在 HuggingFace 的基准测试中取得最先进的结果,并通过运行验证。

大多数模型仅对一部分基准进行了评估。 我们的新系统 ArtifactLinker 可以预测哪些模型能在 @HuggingFace 上托管的基准测试中创造新的最先进水平,然后通过运行评估来验证。🧵 https://t.co/DXk3FbndMF
查看原文
查看缓存全文

缓存时间: 2026/05/23 12:03

大多数模型仅在一小部分现有基准测试上接受评估。

ArtifactLinker 是我们新开发的系统,它能够预测哪些模型会在 @HuggingFace 上托管的基准测试中达到新的最先进水平(SOTA),然后运行评估加以验证。

ArtifactLinker 构建于 HuggingFace 数据图谱之上——模型与数据集作为节点,已报告的评估分数构成边。

我们训练了一个图神经网络(GNN)来对模型进行排序,判断哪些模型有可能在哪些基准测试上达到新的 SOTA,其效果优于基于提示的大语言模型(LLM)。

在 ArtifactLinker 中,一个 LLM 编程智能体负责编写并运行评估代码,且各次运行间共享内存。

我们发现,该智能体在 72.6% 的情况下,其结果与官方报告分数的差距在 20% 以内。

借助 ArtifactLinker,我们发现了许多案例:一个强大的模型从未在某个基准测试上接受过评估,而它本可达到甚至接近该基准的 SOTA。

我们还发现,在自然语言推理任务上,像 Gemma 这样的新 LLM 往往不及 DeBERTa 等较老的模型。

我们正在发布一个数据集,其中包含 14K 个 HuggingFace 模型、数据集、论文及代码库,通过 51K 次评估、微调及引用相互关联,同时开源了 ArtifactLinker 的代码。

希望这能帮助更多人发现 SOTA 评估结果。

代码:https://github.com/allenai/artifact-linker…
数据:https://huggingface.co/datasets/lwaekfjlk/artifact-bench…

相似文章