我们针对475个创意写作提示,对24个大语言模型与人类作家进行了基准对比
摘要
本次基准发布比较了24个大语言模型与人类作家在475个创意写作提示上的表现,使用自定义奖励模型显示前沿模型优于业余作家,但不及专业作家。
我们刚刚发布了创意写作基准测试的第一个版本,对24个大语言模型与人类作家在475个写作提示上进行了比较。创意写作具有主观性,因此排名并非旨在预测任何个人的偏好。相反,它使用一个专门针对人类创意写作偏好训练的自定义奖励模型,预测一大群读者的偏好。令人惊讶的是,最强的前沿模型已经排名高于有才华的业余作家群体,而专业作家仍然以较大优势领先。您可以在此处浏览完整的基准测试,比较模型输出,并了解基准测试的工作原理:https://vulsar.ai/benchmarks/creative-writing-v1/ 很想听听大家对结果的看法!
相似文章
LLMs是否变得同样具有创造力?来自三年模型的证据
本文分析了三年来LLM的输出,使用开放式任务和创造力评估,发现多样性在统计上显著下降,这表明创造性内容在不同模型间趋于一致,这可能会削弱人类在协作创意工作中的自主性。
HoWToBench:基于写作树结构的全方位 LLM 人类级写作评估
研究者发布 HoWToBench,一个涵盖 12 种文体、1302 条指令的大规模中文写作基准;同时提出 Tree-of-Writing(ToW)树状评估法,与人工评分的 Pearson 相关系数达 0.93,显著降低 LLM 写作评估中的偏差。
评估前沿LLMs在自动化研究中的创造力
本文提出了一组指标来评估前沿LLMs在自动化研究中的创造力,聚焦于价值和新颖性,并发现变量级新颖性与研究性能最密切相关。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。