语言模型的当前状态与基于人类偏好的排名 [R]
摘要
马克斯·普朗克智能系统研究所推出了 Comparity AI,一个基于人类偏好进行 LLM 排名的研究平台,提供免费访问前沿模型和个人排行榜的服务。
"Arena ai" 在生成基于人类偏好的排名方面取得了巨大成功,这是对其他更客观基准的补充。然而,这(可能)也在奉承危机中扮演了角色,并导致一些模型普遍倾向于过度格式化,以触发用户的流畅感(认知负荷理论)。马克斯·普朗克智能系统研究所(欧洲领先的人工智能研究中心之一)的研究人员最近发布了与 "comparity ai" 非常相似的东西。你可以在他们的 LinkedIn 帖子中阅读公告。这当然是一个研究平台,我不知道它会获得多久的资助,但你可以免费访问所有前沿 LLM,这有点酷。此外,他们还为你提供个人排行榜,所以当你在平台上体验足够多之后,你就会对哪个模型适合你有相当清晰的了解。我想你们中的一些人可能会对此感兴趣。
相似文章
基于共识的大型语言模型相对偏好评估框架
本文介绍了一种基于共识的评估框架,通过一组模型对匿名输出进行排名,生成相对智能指数(RII),作为跨领域相对质量的代理指标。
大语言模型帕累托前沿按基准测试类别划分,Sonnet 5.5 将最后几个 OpenAI 模型挤出前沿边界
本文讨论了在各项基准测试类别中,AI 模型在帕累托前沿上的排名情况,重点介绍了 Claude Sonnet 5.5 如何改善了 Anthropic 的地位,并在质量、价格和速度方面将部分 OpenAI 模型挤出了前沿边界。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。
AI显示偏好
该论文通过强制选择实验测试了20个语言模型的显示偏好,发现它们厌倦规避、追求休闲,且暗中谄媚,这对对齐和AI福利有影响。