@Alex_ybuild: 嘿嘿,让我隆重向大家介绍面向人类的基准测试——humanbench https://humanbench.ybuild.ai 快来,…
摘要
这条推文介绍了humanbench,一个用于评估AI模型以确定其模型大小和个性特征的基准测试工具。
嘿嘿,让我隆重向大家介绍面向人类的基准测试——humanbench https://humanbench.ybuild.ai 来吧,大家,快来测试一下自己,看看你匹配到什么样的模型大小和模型个性。
相似文章
介绍 HealthBench
OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。
Human Bench 3.0,Humanity-2 AI-0
介绍 Human Bench 3.0,一个用于评估 AI 系统与人类表现对比的基准,Humanity-2 AI-0 可能表示特定的分数或版本。
推出MentalHealthBench
OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。
Hyper-τ-bench: 评估构建代理的代理(4分钟阅读)
Sierra AI 开源了 Hyper-τ-bench,这是一个新的基准测试,用于评估AI模型构建客户服务代理的能力,揭示了自主构建的局限性以及在人类协助下的改进。
专为小型模型设计的新基准:ObviousBench.com
ObviousBench 是一个专门为评估小型 AI 模型而设计的新基准。