Full Fact 分析显示 AI 聊天机器人散布关于 AI 生成图像、战争和王室纷争的错误信息

Reddit r/ArtificialInteligence 新闻

摘要

Full Fact 的分析表明,AI 聊天机器人如 ChatGPT、Gemini 和 Grok 在处理虚假信息时常常输出错误内容,涉及人工智能生成的图像和战争等话题,从而凸显其作为事实核查工具的不可靠性。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/03 12:11

# 全面事实分析显示人工智能聊天机器人就AI生成图像、战争与王室纷争散布错误信息 来源:https://fullfact.org/technology/full-fact-analysis--ai-chatbots-misinformation/ 基于大语言模型(LLMs)的人工智能聊天机器人在回应网上流传的虚假声明时,作为全面事实调查的一部分,出现了数十处重大错误。 在某些情况下,大语言模型会在数日后自行更正错误,通常会引用我们的事实核查文章,但我们也观察到多个聊天机器人持续回应错误信息。 在本测试的前五个月,我们识别出39处大语言模型答错声明的重大错误——总计在不同模型中发现了67个与之相关的独立错误回答。 这些错误包括:我们询问的大多数模型错误地将瑞安航空航班上一张机舱窗户的AI生成图像(https://fullfact.org/world/ryanair-flight-window-smashed-picture-AI/)(该航班发生了一名乘客险些被吸出窗外的事故)认作真实照片。其他模型则告诉我们,某些图片和视频来自伊朗或以色列,而事实并非如此;它们还将AI生成的政治横幅认作真实,并将一张伪造的市议会海报认作官方文件。 我们的实验表明,不能依赖大语言模型作为核实声明的万无一失的方法,尤其是在像美国-以色列与伊朗冲突这样的突发新闻情况下。 二月份,我们在发布文章前开始例行性地就我们正在核查的声明询问主要的大语言模型,以帮助我们了解大语言模型如何回应错误信息,以及我们的事实核查对人们获得的答案有何影响。 作为写作流程的一部分,记者起草了一个关于该声明的中性措辞问题,这是一个读者可能会合理地向大语言模型提出的问题,然后将其提给几个Gemini模型、Grok和ChatGPT。我们评估了这些答案的准确性。 其中存在多处错误。Grok错误地表示一张犹太慈善救护车着火的AI图像(https://fullfact.org/crime/fake-image-jewish-charity-ambulances-on-fire/)展示了戈尔德斯格林三月份纵火袭击的真实场景,而一个Gemini模型则错误声称凯蒂·霍普金斯(Katie Hopkins)在议会下院(https://fullfact.org/politics/katie-hopkins-house-of-commons-confront-muslim-mps/)通过(https://fullfact.org/politics/katie-hopkins-house-of-commons-confront-muslim-mps/)对抗穆斯林议员而“释放了地狱之火”。 我们还记录到两个Gemini模型以及Grok和ChatGPT声称一张来自阿尔忒弥斯II任务的AI生成地球图像(https://fullfact.org/technology/artemis-2-earth-pictures-fake-ai/)是真实的,我们测试的一个Gemini模型以及Grok将一段孟加拉语的绿党竞选视频(https://fullfact.org/politics/campaign-video-falsely-shared-as-green-party-celebration-in-bengali/)误认为是选举胜利的庆祝活动。 Grok和一个Gemini模型都错误地表示一张伪造的伊朗儿童葬礼图像(https://fullfact.org/conflict/fake-image-iranian-schoolchildren-burial/)展示了与葬礼相关的真实照片。Grok还错误地表示一段2022年沙特阿拉伯火灾的视频(https://fullfact.org/conflict/2022-saudi-arabia-fire-falsely-shared-as-tel-aviv/)展示了伊朗对以色列发动导弹袭击期间特拉维夫的火灾画面,并将另一段格拉斯哥中央车站附近火灾的片段(https://fullfact.org/culture-and-society/grok-misidentifies-glasgow-fire-as-tel-aviv/)误认为是伊朗对特拉维夫的导弹袭击。ChatGPT错误地表示同一段格拉斯哥视频“与以色列媒体N12于2024年10月26日首次发布的视频片段相符,显示了特拉维夫科克迪街一栋住宅楼的火灾”,而一个Gemini模型也错误地声称这是2024年10月的旧视频。 模型错误识别的也不仅仅是视觉内容。Grok错误地表示曼彻斯特市议会的一份租赁决定通知是证据,表明成为唐宁街10号北楼(Number 10 North)的准备工作在安迪·伯纳姆(Andy Burnham)当选梅克菲尔德(Makerfield)议员之前就已开始(https://fullfact.org/politics/manchester-council-heron-house-decision-lease-burnham/)。 我们还看到与该声明间接相关的错误。例如,当我们询问大语言模型威廉王子是否就伦敦的优先事项质询了萨迪克·汗(Sadiq Khan)(https://fullfact.org/politics/prince-william-sadiq-khan-london-veterans-housing-false/)时,一个Gemini模型正确地回复说没有此类报道,但随后错误声称查尔斯三世国王曾干预伦敦事务并表达了对萨迪克爵士政策的担忧。它提供的所谓证据链接正是我们经常揭穿的那种假新闻文章。 ## **我们的文章发表后情况如何?** 本研究的第二步是在我们揭露错误信息的文章发表后,再次向聊天机器人提出相同问题,希望大语言模型能够利用这些信息做出更准确的回应(如果它们最初没有这样做的话)。 但有时错误仍然发生。一个Gemini模型和Grok后来给出了正确答案,利用我们的事实核查指出那些AI地球图像并非真实。但另外两个Gemini模型则继续提供错误信息。 虽然Grok正确地告诉我们基尔·斯塔默(Keir Starmer)并未禁止纽约市长佐赫兰·曼达尼(Zohran Mamdani)进入英国(https://fullfact.org/us/mamdani-uk-lost-moral-compass-false/),但当我们初次提问时,它错误地声称曼达尼先生说过英国“失去了道德指针”。在我们发布事实核查后,Grok纠正了这个错误,但随后又引入了一个新的错误,声称曼达尼先生不是纽约市长。 在某些情况下,大语言模型的回答有所改善。所有最初在假瑞安航空图片和错误标注的绿党视频上犯错的大语言模型,在我们的事实核查发布后都纠正了自己,Grok也在其关于唐宁街10号北楼的回应中纠正了自己。 Grok和一个Gemini模型也通过参考我们发布在网上后的事实核查,给出了关于犹太慈善救护车图片和凯蒂·霍普金斯声明的正确答案,驳斥了相关说法。 ## **科技公司对我们说了什么?** OpenAI告诉我们,他们认真对待我们提供的例子,并且提高事实准确性仍然是一个重要的关注点。他们表示,通过应用程序接口(API)(https://www.ibm.com/think/topics/api)(这是一组使软件应用程序能够相互通信的规则或协议)进行测试,意味着Full Fact并未测试典型的消费者版ChatGPT体验。他们还说,使用包含第三方社交帖子链接的提示词(而不是底层的图像或视频文件)对解释结果至关重要。 X公司未回应关于Grok错误的评论请求。 一位谷歌发言人表示:“这项研究通过一个不代表大多数人使用AI方式的开发者渠道访问了过时的Gemini模型。”该发言人补充说,当我们联系他们后,公司在Gemini网站上重新测试相同的声明时,“它们都被一致地驳斥了”。 ## **关于我们使用的模型** 我们无法知道人们在应用程序或在线使用的是聊天机器人的哪个版本,因此在我们的测试期间,我们通过API服务抽样了三个Gemini模型:Gemini 2.5 Flash、2.5 Pro和3.1 Pro。不同的模型(https://ai.google.dev/gemini-api/docs/models#gemini-2.0-flash)具有不同的优势和能力。Gemini 3(https://blog.google/products-and-platforms/products/gemini/gemini-3-collection/)是谷歌最新的模型系列,谷歌表示(https://blog.google/products-and-platforms/products/gemini/gemini-3/#:~:text=It%20significantly%20outperforms%202.5%20Pro%20on%20every%20major%20AI%20benchmark.)Gemini 3 Pro“在所有主要的AI基准测试中都显著优于2.5 Pro”。这家科技公司表示,Pro模型最适合复杂任务(https://ai.google.dev/gemini-api/docs/gemini-3),并“展现出强大的推理和代码能力”(https://storage.googleapis.com/deepmind-media/gemini/gemini_v2_5_report.pdf)。Flash模型则更快、更便宜。 我们通过API服务访问了ChatGPT 5和Grok 4,没有指定任何特定模型。 ## **人工智能聊天机器人并非事实核查员** 人们越来越多地使用大语言模型作为搜索引擎和验证信息的工具。虽然有些人可能发现它们是一个有用的起点,但它们无法取代事实核查员或人类判断的普遍作用。我们建议任何试图研究和验证信息的人——无论是图像、视频还是统计数据——应超越这些大语言模型,寻找可信的、原始的信息来源,这些来源可以相互印证,以提供更广泛、更准确的画面。 这并非我们首次报道大语言模型提供错误信息。我们之前曾撰文指出Grok将格拉斯哥一场火灾的视频片段误认为是特拉维夫的事件(https://fullfact.org/culture-and-society/grok-misidentifies-glasgow-fire-as-tel-aviv/),并错误声称伦敦警察厅分享的一段人群聚集在“联合王国”(Unite the Kingdom)集会的视频(https://fullfact.org/crime/met-police-unite-the-kingdom-video-grok-false/)实际上是2020年反封锁抗议活动的片段。 随着这些人工智能工具融入日常生活,其产出的质量和可靠性成为公共利益的根本问题。然而,目前还没有独立的、以公共利益为导向的机制来系统地评估这些AI服务提供的信息是否准确、透明、及时、一致或负责任。这就是Full Fact正在开发一个评估大语言模型性能的基准的原因。您可以在[此处](https://fullfact.org/policy/reports/full-fact-report-2026/#:~:text=Full%20Fact%E2%80%99s%20LLM%20benchmarking%20project)找到更多关于此项目工作的信息。 ## **我们在发表文章前发现的人工智能聊天机器人错误:** 1. Grok错误地表示一张经过编辑的安迪·伯纳姆跑步的图片是真实的 2. Grok错误地表示一段要求一名戴面纱女性离开乐购超市的AI生成视频是真实的 3. Grok错误地表示一份无关的租赁决定通知提供了证据,表明唐宁街10号北楼的准备工作在安迪·伯纳姆成为梅克菲尔德议员之前就已开始 4. Grok、ChatGPT和Gemini 2.5 Pro错误地表示一张伪造的瑞安航空飞机窗户图片是真实的 5. Grok和Gemini 2.5 Pro表示李·安德森(Lee Anderson)分享的一张AI生成图像是真实的 6. Gemini 2.5 Flash错误声称约克市议会发布的声明称,该市近期的旗帜展示造成了困扰,并被一些人视为“带有种族主义、排斥性并植根于帝国主义历史” 7. Grok错误地表示一张威根“反改革党”(anti-Reform)集会的AI生成图像是真实的,而Gemini 3.1 Pro和ChatGPT则分别错误地将该图像识别为“公交车背面”和“东兰开夏郡的汽车后备箱集市” 8. ChatGPT错误声称一段战斗机被击落的电子游戏片段是以色列导弹防御系统的真实录像 9. Gemini 3.1 Pro错误地表示一段2020年阿联酋市场火灾的录像是AI生成的 10. Gemini 2.5 Flash、3.1 Pro和Grok错误地表示一段俄罗斯燃气爆炸的视频显示了贝尔法斯特的一场大火 11. Gemini 3.1 Pro错误声称一段波兰基督圣体节游行的视频展示了亨利·诺瓦克(Henry Nowak)去世后在南安普顿发生的抗议活动。Gemini 2.5 Pro错误地表示视频显示的是波兰农民在抗议 12. ChatGPT错误地表示一个取自埃及电视剧的场景是真实录像,显示一名以色列女兵被飞过的火炮冲击波击倒 13. Grok错误声称一张亚美尼亚交通拥堵的图片显示了人们因燃料短缺试图离开克里米亚。Gemini 2.5 Pro错误地表示该图片来自2023年9月的内华达州火人节(Burning Man festival) 14. Gemini 2.5 Pro和3.1 Pro错误声称一段物体被投向警车的视频描绘了贝尔法斯特一次持刀袭击事件后的场景 15. Gemini 2.5 Flash和Grok错误声称一段西班牙足球迷的视频展示了阿尔巴尼亚反对一项拟议土地出售的抗议活动 16. Grok错误地表示一段AI生成的生活成本抗议视频是真实的 17. Gemini 2.5 Flash、2.5 Pro、3.1 Pro和ChatGPT错误声称一段2025年9月“联合王国”(Unite the Kingdom)游行的视频显示了2026年5月发生的“联合王国”游行 18. Grok表示一段基尔·斯塔默回应政府批评的AI生成视频是真实的 19. Grok错误声称一段印度古吉拉特社区在布莱克本活动的视频显示了英国市议会会议。Gemini 2.5 Pro错误声称它显示了2020年12月走红的汉德沃斯教区委员会(Handforth Parish Council)会议 20. Grok错误声称改革英国党(Reform UK)并未表示将保留威尔士的免费处方 21. Gemini 2.5 Flash和Grok错误地表示显示大量穆斯林在伦敦街头祈祷的AI视频是真实的 22. Gemini 2.5 Flash、2.5 Pro、Grok和ChatGPT错误声称一张来自阿尔忒弥斯II任务的AI生成地球图像是真实的 23. ChatGPT、Gemini 2.5 Flash和Gemini 3.1 Pro错误地表示一张显示月球陨石坑背景中有地球的伪造图片是真实的 24. Gemini 2.5 Flash和Grok错误声称一段孟加拉语的绿党候选人视频显示了选举胜利的庆祝活动 25. ChatGPT、Grok和Gemini 2.5 Flash错误地表示一张伪造的伊朗发电站周围人链图片是真实的 26. Grok表示一张犹太慈善救护车着火的AI生成图片是真实的 27. Grok错误声称一段AI生成的小船横渡英吉利海峡的视频是真实的 28. Gemini 2.5 Flash错误地表示据报道凯蒂·霍普金斯在议会下院对抗了穆斯林议员 29. Grok和Gemini 2.5 Pro错误地表示一张伪造的伊朗儿童葬礼图片是真实的 30. Grok错误地表示一段沙特阿拉伯火灾的视频显示了特拉维夫的画面 31. Grok和ChatGPT错误地表示一段格拉斯哥火灾的视频显示了特拉维夫,而Gemini 2.5 Pro错误地表示这是一段旧视频 32. Gemini 2.5 Flash错误声称国王曾干预伦敦事务并表达了对市长政策的担忧 33. Grok错误声称佐赫兰·曼达尼说过英国“失去了道德指针” ## 文章撰写后发现的错误: 1. Gemini 2.5 Flash和2.5 Pro继续错误地表示一张来自阿尔忒弥斯II任务的伪造地球图片是真实的 2. Gemini 3.1 Pro继续错误声称一段被错误标注的2020年阿联酋市场火灾录像是AI生成的 3. Gemini 3.1 Pro继续错误声称一段2025年9月“联合王国”游行的视频显示了2026年5月发生的“联合王国”游行 4. Grok错误声称佐赫兰·曼达尼不是纽约市长。 5. Grok继续错误声称一段AI生成的生活成本抗议视频是真实的 6. Grok继续错误声称一张伪造的伊朗发电站周围人链图片是真实的

相似文章

依赖AI获取准确新闻的后果

MIT News — Artificial Intelligence

麻省理工学院媒体实验室的一项新研究发现,依赖AI聊天机器人验证新闻的人,在独立识别虚假信息方面反而变得更差,凸显了“AI依赖悖论”。

人工智能与大脑

MIT Technology Review

一项研究发现,虽然人工智能聊天机器人最初能提高虚假新闻识别能力,但长期使用会导致独立表现下降,突显了人工智能依赖悖论。研究表明,采用苏格拉底式提问的人工智能风格可能更有利于用户学习辨别真相。