imo-gradingbench

标签

Cards List
#imo-gradingbench

自然语言数学证明的高性价比自动评判

arXiv cs.CL · 18小时前 缓存

本文研究廉价的开放权重大语言模型能否以远低于前沿模型的成本,同样可靠地评判自然语言数学证明。在 IMO-GradingBench 上,三个廉价评判模型在通过/不通过的一致性上与前沿模型相当,作者推荐“三者全部通过”的一致性规则以实现高性价比部署。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈