@Alex_ybuild: 嘿嘿,让我隆重向大家介绍面向人类的基准测试——humanbench https://humanbench.ybuild.ai 快来,…

X AI KOLs Timeline 工具

摘要

这条推文介绍了humanbench,一个用于评估AI模型以确定其模型大小和个性特征的基准测试工具。

嘿嘿,让我隆重向大家介绍面向人类的基准测试——humanbench https://humanbench.ybuild.ai 来吧,大家,快来测试一下自己,看看你匹配到什么样的模型大小和模型个性。
查看原文

相似文章

介绍 HealthBench

OpenAI Blog

OpenAI 推出了 HealthBench,这是一个用于评估医疗保健环境中人工智能系统的新基准。该基准由来自 60 个国家的 262 名医生共同创建,包含 5,000 个逼真的健康对话和医生编写的评分标准,用于评估模型在有意义、可信和可改进的指标上的性能。

Human Bench 3.0,Humanity-2 AI-0

Reddit r/singularity

介绍 Human Bench 3.0,一个用于评估 AI 系统与人类表现对比的基准,Humanity-2 AI-0 可能表示特定的分数或版本。

推出MentalHealthBench

OpenAI Blog

OpenAI推出了MentalHealthBench,这是一个开放基准,用于评估心理健康对话中的AI回复,与超过80名心理健康专家共同创建,以衡量安全性、上下文、主动性和指导性。