benchmark-development

标签

Cards List
#benchmark-development

在现实对话环境中评估语言模型

arXiv cs.CL · 5天前 缓存

本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈