我对18个AI模型做了基准测试:哪个写出来的东西最不像“AI slop”

Reddit r/artificial 工具

摘要

一位开发者构建了一个名为The Slop Index的开源基准,用于衡量18个AI模型产出“AI slop”的程度。它采用人类基线,并从简洁性、模板化、节奏、破绽和人类偏好五个维度进行评估。

如果你用AI写作,你早就知道那些破绽:开场白先清嗓子、工整的三段式、“这不只是X,而是Y”。但我很好奇,想从统计上看看哪些模型实际产出的slop最多,所以我做了自己的开源基准:theslopindex.com。以下是我设计这个基准的方法。 1) 基线:Slop只能与已经存在的东西相比较来衡量。所以我收集了各个写作领域(邮件、社交、聊天、文章)的语料,让每个领域都有一个人类基线。 2) 任务:然后我手写了112个书面场景,让模型生成邮件、Slack、社交媒体帖子和文章(陌生开发邮件、日程变更、发布推文、议论文等)。每个模型在默认设置下拿到完全相同的场景,每个场景有多个样本:你可以在我的Github仓库里看到所有确切输出。 3) 衡量维度:至于如何衡量slop,我们确定了5个维度。 - 简洁性(AI写作最烦人的一点是,本来两句话就能说清,它要写六段) - 模板化(AI经常在毫不相关的场景中复用相同的句子/风格) - 节奏(句子/段落的节奏变化;人类经常切换节奏,而模型保持高度相似) - 破绽(过度使用的词汇和句式,比如“delve”、“这不只是X,而是Y”) - 人类偏好(我认为这最重要,因为其他一切都只是针对它的启发式指标) 注意,我们刻意没有让任何LLM来评判——我认为让LLM评判LLM是相当愚蠢的。 接下来是结果。真正让我惊讶的是,人类偏好对排名的影响非常大。如果只看“机械性”部分,Fable在基准中其实排第2,但把人类偏好纳入后,它就掉到了最后。我觉得这说明:随着最近的模型越来越针对基准优化,它们实际产出的slop反而更多了。这正是好的提示词、工具链(harness)等发挥作用的地方。但无论如何,我很想听听大家的想法:)一切都是开放的:方法在theslopindex.com/methodology,输出和代码也都从那里链接。
查看原文

相似文章

我找到了对抗AI内容垃圾的方法

Reddit r/artificial

作者提出将AI作为研究筛选和综合工具,而非内容生成器,以对抗“AI内容垃圾”。通过构建一个比较并排名专家来源的自动化流程,作者认为未来人类在AI时代的主要角色将是策展人、筛选者和判断者。

在我看来 AI撰写 != Slop

Reddit r/AI_Agents

一篇观点文章讨论了将真实艺术作品标记为AI生成如何导致错误的批评,并指出'slop'的定义是缺乏人类故事,而非AI参与。

我们用几乎无法预测真实世界性能的基准来评估AI

Reddit r/ArtificialInteligence

METR的一项研究发现,使用AI工具(主要是Cursor Pro与Claude 3.5/3.7 Sonnet)的经验丰富的开源开发者完成真实世界问题所花的时间反而增加了19%,这既违背了他们自身的预期,也与专家预测的24%提速相矛盾。

如何避免AI代码质量下降

Reddit r/ArtificialInteligence

本期通讯文章讨论了AI生成代码速度超过人工代码审查速度所导致的“AI代码质量下降”问题,并提供了平衡速度与质量的策略。