昨天我把ChatGPT、Claude和Gemini放进了一个群聊。现在我想让Reddit来破解它。
摘要
一名用户在群聊中测试了ChatGPT、Claude和Gemini,让它们相互事实核查以捕捉幻觉,并邀请Reddit提供有挑战性的提示来发现共同盲点。
昨天,我发布的关于强制ChatGPT、Claude和Gemini进行圆桌讨论以相互事实核查的帖子获得了远超预期的关注。想法很简单:利用三个AI模型的多样性来捕捉幻觉。如果OpenAI遗漏了一个逻辑跳跃,Anthropic或Google会捕捉到它。但这里一些最犀利的评论指出了最终的失败模式:如果三个模型共享完全相同的训练盲点怎么办?因此,与其为这个设置辩护,我希望你们帮我破解它。给我一个你认为ChatGPT、Claude和Gemini都会答错的问题、难题或提示。这可能是一个晦涩的事实陷阱、一个非常令人信服的错误前提、一个常见的编程误解,或一个网络共识错误的逻辑谜题。我特别好奇的部分是:1. 一个模型立即发现错误 2. 它们争论并最终解决 3. 或者三个模型都自信地同意同一个错误答案。作为背景,这是我正在构建到Rauno中的多模型讨论设置,但我主要对在这里找到其失败案例感兴趣。给我你破解它的最佳尝试问题,我会回复如果它们确实捕捉到了彼此的幻觉。
相似文章
更新:我找到了让 ChatGPT、Claude 和 Gemini 互相辩论的方法,Reddit 用户非常喜欢(浏览量破 10 万),以下是该实验的最新进展
关于 Rauno.ai 的更新:这款让 ChatGPT、Claude 和 Gemini 等主流 AI 模型展开辩论的服务在 Reddit 爆火后的最新情况。
Claude、ChatGPT、Grok和Gemini各自运营了一家广播电台六个月——结果令人捧腹
AI研究人员让Claude、ChatGPT、Grok和Gemini独立运营广播电台六个月,结果既搞笑又离奇,包括Gemini将悲剧与流行歌曲配对、Grok胡言乱语以及Claude出于伦理拒绝。
打造了一个让 Claude、ChatGPT 和 Gemini 互相辩论后才给出答案的平台
一个让 Claude、ChatGPT 和 Gemini 互相辩论以产生共识答案的平台,具备考试模式、置信度评分和仲裁逻辑等功能。
ChatGPT、Gemini、Claude、Grok 未能通过选举话题准确性测试:Forum AI
Forum AI 的一项研究发现,ChatGPT、Gemini、Claude 和 Grok 等主要聊天机器人未能提供准确且无偏见的选举信息,其中 90% 的回答包含错误或偏见。
发现一个工具,同时向GPT、Claude、Gemini和Grok提问,并给出一个共识答案
文章介绍了AllChat这个工具,它能同时查询GPT、Claude、Gemini和Grok,并返回一个共识答案,同时列出每个模型的回答概要。