performance-gap

标签

Cards List
#performance-gap

开源权重大语言模型与闭源大语言模型之间的差距

Hacker News Top · 2026-06-26 缓存

使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。

0 人收藏 0 人点赞
#performance-gap

能力前沿:基准测试遗漏了82%的模型性能

arXiv cs.AI · 2026-06-26 缓存

本文提出了能力前沿(Capability Frontier),这是一个针对模型的帕累托前沿,用于纠正单模型和单次运行评估中的偏差,表明标准基准测试遗漏了高达82%的模型性能,并且集体LLM能力被严重低估。

0 人收藏 0 人点赞
#performance-gap

@rohanpaul_ai: 当前前沿智能体在现实自动化方面的准备程度远不及它们在基准测试中的分数所暗示的那样。本文提…

X AI KOLs Following · 2026-06-11 缓存

本文介绍了“智能体最终考试”(Agents' Last Exam),这是一个测试AI智能体在55个数字工作领域中进行真实专家工作能力的基准。目前最强的智能体在大多数任务上失败,在最难的层级中平均通过率仅为2.6%,揭示了基准分数与现实世界自动化准备程度之间的巨大差距。

0 人收藏 0 人点赞
#performance-gap

开源模型落后了多少?(17分钟阅读)

TLDR AI · 2026-05-29 缓存

LessWrong上的一篇分析,探讨了开源与专有AI模型之间的性能差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈