语言模型的当前状态与基于人类偏好的排名 [R]

Reddit r/MachineLearning 工具

摘要

马克斯·普朗克智能系统研究所推出了 Comparity AI,一个基于人类偏好进行 LLM 排名的研究平台,提供免费访问前沿模型和个人排行榜的服务。

"Arena ai" 在生成基于人类偏好的排名方面取得了巨大成功,这是对其他更客观基准的补充。然而,这(可能)也在奉承危机中扮演了角色,并导致一些模型普遍倾向于过度格式化,以触发用户的流畅感(认知负荷理论)。马克斯·普朗克智能系统研究所(欧洲领先的人工智能研究中心之一)的研究人员最近发布了与 "comparity ai" 非常相似的东西。你可以在他们的 LinkedIn 帖子中阅读公告。这当然是一个研究平台,我不知道它会获得多久的资助,但你可以免费访问所有前沿 LLM,这有点酷。此外,他们还为你提供个人排行榜,所以当你在平台上体验足够多之后,你就会对哪个模型适合你有相当清晰的了解。我想你们中的一些人可能会对此感兴趣。
查看原文

相似文章