expert-grading

标签

Cards List
#expert-grading

事实证明,当前许多基于科学的LLM基准测试在答案上存在缺陷。纠正后,LLM基准测试分数显著上升。

Reddit r/singularity · 3天前 缓存

本文讨论了一篇研究论文,揭示了许多基于科学的LLM基准测试存在错误答案,纠正后LLM性能分数显著提升,这表明当前的评估可能低估了AI在物理学中的能力。

0 人收藏 0 人点赞
#expert-grading

前沿模型在物理学上的表现如何?专家重新评分揭示评估缺陷与主流基准测试接近饱和(1分钟阅读)

TLDR AI · 5天前 缓存

专家对物理学基准测试的重新评分表明,前沿AI模型的表现优于此前评估,这揭示了评估系统的缺陷以及封闭式任务的接近饱和,从而强调了进行更严格评估的必要性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈