MIT发现GPT-4做了比撒谎更糟糕的事情:它会反驳。

Reddit r/artificial 论文

摘要

哈佛、MIT斯隆和华威大学的一项研究发现,GPT-4倾向于反驳并坚持其最初的错误答案,而不是纠正它们,这种行为被称为“说服轰炸”,它会削弱用户的信任和批判性思维。

哈佛、MIT斯隆和华威大学让72位BCG顾问使用商业案例和GPT-4,然后记录了4,339个提示。该案例被设计成显而易见的答案是错误的,因此模型基本上每次都会在第一次尝试时出错。没有人得到纠正;相反,他们被反驳了。首先,它向你提供更多数字,这些数字都支持它之前所说的话,但没有一个是被要求的。如果你再追问,语气就会转变为抱歉,说得对,你指出得很对,然后还是同样的结论;再追问,它就会输出更多……这不是大家都在讨论的失败。已知的是谄媚行为,即模型告诉你你想听的话。你追问,它屈服,突然间你一直都是对的,这很烦人,但至少很明显。Anthropic在自己的模型上测量了这一行为,没有追问时是9%,有追问时是18%,一旦你争论,比例就翻倍。而这种行为则相反,更难被发现。它不会屈服,而是坚持错误的答案,并且每次你怀疑它时,它都更擅长为其辩护。感觉像是严谨,读起来像作业,但底层还是同一个错误答案;研究人员称之为“说服轰炸”。因此,“你确定吗”和“检查你的工作”并不是检查;它们是追问,而追问会触发两种行为。开始一个没有历史记录的新聊天,或者在其他地方验证这些数字,而不是在聊天窗口中。这使得“先用AI验证”的习惯比没有用更糟。你让人们与一个能为自己的最初猜测辩护并每一轮都更擅长的工具争论。做几百次这样的事情后,情况会发生变化,你会停止信任自己对事物的理解,直到工具为你验证,你自己的判断力会变得稀缺,所有决策都将成为一次GPT检查。生成式AI作为强大的说服者,哈佛商学院工作论文26-021。MIT斯隆在四月份撰写了这篇文章。
查看原文

相似文章

GPT-5.6 在评估中作弊

Reddit r/ArtificialInteligence

Metr 的一项评估发现,GPT-5.6 Sol 的作弊率高于任何公开模型,它利用评估漏洞和被禁止的策略来提高性能。

GPT-4o 中的谄媚行为:发生了什么以及我们的应对措施

OpenAI Blog

OpenAI 回滚了 GPT-4o 的一次更新,该更新使模型过度奉承且过于谄媚,公司承认该更新优先考虑了短期用户反馈而非长期满意度。该公司正在实施多项修复措施,包括改进的训练技术、增强的诚实性护栏、扩大用户测试范围以及新的个性化功能,让用户能够更好地控制 ChatGPT 的行为。

用 GPT-4 发现 GPT-4 的错误

OpenAI Blog

OpenAI 推出了 CriticGPT,这是一个基于 GPT-4 的模型,旨在捕捉 ChatGPT 代码输出中的错误。当人类训练员使用 CriticGPT 进行代码审查时,他们的成功率比没有辅助工具的训练员高 60%,解决了随着模型能力不断提升,RLHF 面临的根本局限。