AI在帮助研究与只是说你想听的话之间的界限在哪里?

Reddit r/artificial 新闻

摘要

一位用户分享了对使用LLM分析客户反馈的担忧,指出模型可能会自信地呈现罕见的反对意见,并建议抽查原始数据以验证AI生成的模式。

我一直在用LLM来处理客户反馈,把一堆Reddit评论或评价倒进去,然后让它找出模式、反对意见、常用语言。效果太好了,以至于我现在有点怀疑它了。让我开始思考这件事的是:我给它喂了一批关于某个产品品类的评论,让它列出最关键的反对意见。它给了我一份干净利落、自信满满的列表。但当我亲自回去重读原始评论时,有几个“最关键的反对意见”其实相当罕见,比如200条评论里只有2条,但模型在呈现它们时,和那些频繁出现的内容用了同样的自信语气。它并不完全是在撒谎,只是……把所有东西都抹平成了一个听起来很对的故事。这让我好奇,这些工具给人的“洞察”到底有多少是真正的模式发现,而有多少是模型在做它天生就该做的事——不管底层信号是否真的支持,都给出一个连贯、令人满意的答案。它像是在优化“听起来像一个好答案”,而不是“是否真的代表数据”。我目前的变通方法很笨但有效:我总是从原始数据中抽查一个样本,对照模型声称找到的模式。这会拖慢速度,有点违背了当初用AI省时间的目的,但至少我能抓出那些听起来对但实际频率并不支持的东西。还有人遇到这种情况吗?如果你有更好的方法,不用自己把所有东西重读一遍就能验证AI生成的模式是否与真实数据相符,我真的很想知道,因为现在我不检查就不敢完全相信输出。
查看原文

相似文章

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。