标签
本文对离线根因分析基准进行了审计,发现聚合排行榜隐藏了子系统特定的获胜者,通过对11个子系统的778个案例进行成对比较。它发布了一个320行的审计模块,用于重新计算每个子系统的稳定性检查。
Papers with Code 是一个专注于人工智能研究论文与代码的平台,在被 Meta 收购后,由 Hugging Face 从头重建,为研究、代码实现以及特定任务的排行榜提供了统一入口。
当多个AI模型以相同价格运行一周时,实际的token使用量揭示了与排行榜排名不同的偏好差异,表明编码和通用聊天各有不同的顶级模型,且长上下文使用集中在两个受信任的模型上。
本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。
Papers Without Code 现在支持用户浏览封闭源模型(如 GPT-5.5 和 Opus 4.8)的评估结果和排行榜,并可在设置中切换。
本文推荐了一个名为 Sophon 的网站,它聚合了 AI 领域的论文、模型、基准测试、排行榜和强化学习环境等信息,提供实时排行榜、对比和订阅功能,被誉为 AI 研究的 Bloomberg 终端。
本文介绍了一项基于对计算机科学研究人员访谈的定性研究,揭示了一个实用怀疑主义的悖论:研究人员不信任LLM排行榜排名,却仍将其作为粗略的决策指南。研究发现,同行网络是模型选择的主要途径,基于竞技场(人工投票)的排行榜更受青睐,而成本透明是最被要求的功能。
来自 Hugging Face 的 Niels 宣布了复兴的 PapersWithCode 平台的新功能,包括多指标排行榜、支持外部论文、论文谱系等。
来自Hugging Face的Niels宣布复兴PapersWithCode,新平台为paperswithcode.co,能够大规模解析高影响力的AI论文,并自动生成排行榜和基准测试,融合了热门论文、领域分类以及外部论文支持等功能。
NielsRogge宣布PapersWithCode复兴,该平台按领域提供SOTA、排行榜和方法,并使用AI智能体大规模解析。