我构建了一个基准测试,用于测试LLMs是否能够理解并创作笑话

Reddit r/artificial 工具

摘要

一位开发者构建了一个名为lolbench的基准测试,用于评估LLMs在理解与创作笑话方面的表现,揭示了模型在解释真实笑话时表现强劲,但在解释失败的笑话时表现不佳,并融入了人类投票进行偏好测试。

lolbench - LLMs 进行三项测试: - 解释笑话为何有效(或无效) - 在共享前提下创作笑话 - 预测哪些笑话人类更喜欢 目前为止让我惊讶的发现:每个模型在解释真实笑话时都表现出色(95%以上),但在解释失败笑话为何失败时却大幅下降(81–92%)。我需要人类参与的部分:投票站。两个差劲的笑话,你盲选,然后它会揭示模型信息以及你是否与数千名其他投票者意见一致。每张选票约30秒,外加一次笑声(希望如此) https://lolbench.lol/ 乐意解答关于评估系统的任何问题,并欢迎任何形式的反馈!
查看原文

相似文章

对概率算子进行逻辑推理的LLM能力基准测试

arXiv cs.CL

本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。