flawed-answers

标签

Cards List
#flawed-answers

事实证明,当前许多基于科学的LLM基准测试在答案上存在缺陷。纠正后,LLM基准测试分数显著上升。

Reddit r/singularity · 4天前 缓存

本文讨论了一篇研究论文,揭示了许多基于科学的LLM基准测试存在错误答案,纠正后LLM性能分数显著提升,这表明当前的评估可能低估了AI在物理学中的能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈