昨天我把ChatGPT、Claude和Gemini放进了一个群聊。现在我想让Reddit来破解它。

Reddit r/artificial 新闻

摘要

一名用户在群聊中测试了ChatGPT、Claude和Gemini,让它们相互事实核查以捕捉幻觉,并邀请Reddit提供有挑战性的提示来发现共同盲点。

昨天,我发布的关于强制ChatGPT、Claude和Gemini进行圆桌讨论以相互事实核查的帖子获得了远超预期的关注。想法很简单:利用三个AI模型的多样性来捕捉幻觉。如果OpenAI遗漏了一个逻辑跳跃,Anthropic或Google会捕捉到它。但这里一些最犀利的评论指出了最终的失败模式:如果三个模型共享完全相同的训练盲点怎么办?因此,与其为这个设置辩护,我希望你们帮我破解它。给我一个你认为ChatGPT、Claude和Gemini都会答错的问题、难题或提示。这可能是一个晦涩的事实陷阱、一个非常令人信服的错误前提、一个常见的编程误解,或一个网络共识错误的逻辑谜题。我特别好奇的部分是:1. 一个模型立即发现错误 2. 它们争论并最终解决 3. 或者三个模型都自信地同意同一个错误答案。作为背景,这是我正在构建到Rauno中的多模型讨论设置,但我主要对在这里找到其失败案例感兴趣。给我你破解它的最佳尝试问题,我会回复如果它们确实捕捉到了彼此的幻觉。
查看原文

相似文章