语言模型的当前状态与基于人类偏好的排名 [R]
摘要
马克斯·普朗克智能系统研究所推出了 Comparity AI,一个基于人类偏好进行 LLM 排名的研究平台,提供免费访问前沿模型和个人排行榜的服务。
"Arena ai" 在生成基于人类偏好的排名方面取得了巨大成功,这是对其他更客观基准的补充。然而,这(可能)也在奉承危机中扮演了角色,并导致一些模型普遍倾向于过度格式化,以触发用户的流畅感(认知负荷理论)。马克斯·普朗克智能系统研究所(欧洲领先的人工智能研究中心之一)的研究人员最近发布了与 "comparity ai" 非常相似的东西。你可以在他们的 LinkedIn 帖子中阅读公告。这当然是一个研究平台,我不知道它会获得多久的资助,但你可以免费访问所有前沿 LLM,这有点酷。此外,他们还为你提供个人排行榜,所以当你在平台上体验足够多之后,你就会对哪个模型适合你有相当清晰的了解。我想你们中的一些人可能会对此感兴趣。
相似文章
基于共识的大型语言模型相对偏好评估框架
本文介绍了一种基于共识的评估框架,通过一组模型对匿名输出进行排名,生成相对智能指数(RII),作为跨领域相对质量的代理指标。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
我构建了一个实时排名系统,涵盖所有AI代理和基础模型(开源)
一位开发者推出了AgentTape,这是一个实时排名网站,汇聚来自多个来源(GitHub、Hugging Face、OpenRouter等)的数据,对公开的AI代理和基础模型进行评分和比较,旨在提供超越基准测试的更全面评估。
新研究测试多款LLM与数千真实用户,发现AI无法模拟人类偏好
一项新研究在28项真实世界研究中测试了LLM,发现它们仅在53%的情况下与人类多数一致,与随机猜测无异,挑战了用LLM取代人类反馈的趋势。
按实际使用而非基准分数排名的AI模型——基准冠军勉强进入前20
一份基于实际使用量、成本和速度的AI模型排名显示,基准冠军在实际采用率上往往落后,像Flash Lite和GPT-5这样更便宜/更快的模型领先于Gemini 3.1 Pro等高价竞品。