我构建了一个基准测试,用于测试LLMs是否能够理解并创作笑话
摘要
一位开发者构建了一个名为lolbench的基准测试,用于评估LLMs在理解与创作笑话方面的表现,揭示了模型在解释真实笑话时表现强劲,但在解释失败的笑话时表现不佳,并融入了人类投票进行偏好测试。
lolbench - LLMs 进行三项测试: - 解释笑话为何有效(或无效) - 在共享前提下创作笑话 - 预测哪些笑话人类更喜欢 目前为止让我惊讶的发现:每个模型在解释真实笑话时都表现出色(95%以上),但在解释失败笑话为何失败时却大幅下降(81–92%)。我需要人类参与的部分:投票站。两个差劲的笑话,你盲选,然后它会揭示模型信息以及你是否与数千名其他投票者意见一致。每张选票约30秒,外加一次笑声(希望如此) https://lolbench.lol/ 乐意解答关于评估系统的任何问题,并欢迎任何形式的反馈!
相似文章
HumorRank:基于锦标赛的排行榜,用于评估大语言模型的幽默生成能力
HumorRank 通过成对比较和 Bradley-Terry 最大似然估计,构建锦标赛式排行榜,对 LLM 的幽默生成进行排名,发现幽默质量取决于喜剧技巧而非模型规模。
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
@dair_ai: // 你的LLM评判与专家意见相左 // 构建LLM评判者可能颇具挑战性。这里展示了一个有趣的案例,说明为何…
本文介绍了UPHELD,这是一个带有大量人工标注的基准,用于评估对话型LLM,以及Mixture-of-Judges框架,可将评估准确性提高30%。
多模态大语言模型的计算幽默:方法、数据集、评估与挑战
关于使用大语言模型进行多模态幽默理解的全面综述,涵盖方法、数据集、评估协议以及在解读迷因、卡通和漫画中幽默的挑战。
对概率算子进行逻辑推理的LLM能力基准测试
本文介绍了一个包含14,320个程序化生成提示词的基准测试,用于评估LLM在涉及“probably”“might”“must”等概率算子的逻辑推理上的表现。作者对29个模型进行了测试,发现了系统性的答案偏差,并表明只有9个模型的表现超过了随机水平。