我们针对475个创意写作提示,对24个大语言模型与人类作家进行了基准对比

Reddit r/LocalLLaMA 新闻

摘要

本次基准发布比较了24个大语言模型与人类作家在475个创意写作提示上的表现,使用自定义奖励模型显示前沿模型优于业余作家,但不及专业作家。

我们刚刚发布了创意写作基准测试的第一个版本,对24个大语言模型与人类作家在475个写作提示上进行了比较。创意写作具有主观性,因此排名并非旨在预测任何个人的偏好。相反,它使用一个专门针对人类创意写作偏好训练的自定义奖励模型,预测一大群读者的偏好。令人惊讶的是,最强的前沿模型已经排名高于有才华的业余作家群体,而专业作家仍然以较大优势领先。您可以在此处浏览完整的基准测试,比较模型输出,并了解基准测试的工作原理:https://vulsar.ai/benchmarks/creative-writing-v1/ 很想听听大家对结果的看法!
查看原文

相似文章

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。