作为一名学生,我发现大型模型在许多方面仍然不太可靠,有用但也很无用

Reddit r/ArtificialInteligence 新闻

摘要

一名学生分享了使用大型AI模型总结教材材料的经验,指出了不准确和挑剔的问题,并基于这些缺陷质疑AI的所谓危险性。

我正在制作教材阅读文章和幻灯片,准备在导师面前做报告。我快速阅读了主题大意,然后要求notebook LM进行总结。我手动分成各个部分,它在个别地方出错,所以我逐步调整提示,逐部分进行,最终得到一个相当不错的总结。然后我用同样的方法制作了演示幻灯片。结果尚可接受(不算好,仍有许多奇怪的错误)。接着我尝试用Opus 5和Chat GPT 5 Luna(忘了具体版本号)进行复查。结果令人惊讶,它说整个教材阅读部分很差,缺乏因果关系,有误。然后我上传了原始材料,结果又惊讶地发现,它们说幻灯片内容是事实性的,与教材一致。真是无语,它批评了那么多,上传材料后就变卦了。最糟糕的是?它们开始挑剔细小琐碎的事情来显得更聪明,而这些修改对我毫无帮助(我的意思是,没错,但这些琐事太微不足道,导师也不会因此改变多少看法)。而你们却有人说AI太危险,当LLM和Gen AI的推理能力还有点笨拙时,你们怎么就相信这种事呢……不客气地说,最新的模型很挑剔,还玩忽冷忽热。它过去通过过度认同来产生幻觉,现在则通过挑剔琐事产生幻觉并忽悠人……我觉得放慢发展速度是必要的,但原因相反。LLM正达到顶峰,更多数据已无用,因为AI在饱和数据下变得更笨了,它们需要不同类型的发展,比如削减预算之类的。
查看原文

相似文章

AI 自信犯错的程度远超人们想象,不服来辩

Reddit r/ArtificialInteligence

一位用户分享了对 AI 模型的担忧:AI 在数据单薄或含糊不清时,也能以与数据充分时相同的自信呈现结论。文中举了一个例子:一条仅在 200 条评论中出现两次的投诉,被列为头号关注点。文章质疑这是否是一个可通过提示词修复的问题,还是一个需要人工核验的根本性局限。

学习停滞的剖析

Lobsters Hottest

一位教授讲述了他与一名本科生的一次经历:该学生使用AI完成研究项目,但并未真正理解内容,这凸显了在没有深度知识的情况下依赖AI的风险。