这篇由thehackernews撰写的关于AI幻觉的文章,本身竟然是用AI写的,lol...我们必须采取行动阻止这种现象。

Reddit r/singularity 新闻

摘要

本文讨论了AI幻觉如何造成真实的安全风险,并强调了2025年的一项基准测试,该测试显示大多数AI模型会给出自信但错误的答案。文章解释了原因,并呼吁对AI输出进行人工验证。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/17 09:26

# AI 幻觉如何引发真实的安全风险 来源:https://thehackernews.com/2026/05/how-ai-hallucinations-are-creating-real.html?m=1 [](https://blogger.googleusercontent.com/img/b/R29vZ2xl/AVvXsEi45HPlwBwWVoL1fRSEGy7bjtz4Z05lAO8NWxLqPrzQ93c3j5aaj_CaK5gCrJC6aYP0ePV36n27rw33vJv5mUXf3mtdOEItJjHrSkzckVGAdTU2UMp8s-HAVjNUE7jVDeTH0UikGxNZWeB6J3qVNguP2iO5V5-qUgW3g_IqxZ9cMEZy0tS0iEsl8MnSjB0/s1700-e365/keeper.jpg) AI 幻觉正通过高度自信但错误的输出,利用人类的信任,在关键基础设施决策中引入严重的安全风险。当 AI 模型缺乏确定性时,它并没有识别这一点的机制。相反,它会基于训练数据中的模式生成最可能的响应,即便该响应并不准确。这些输出听起来可能颇具权威性,因此在驱动现实世界安全决策时格外危险。 根据 Artificial Analysis 的 AA-Omniscience 基准测试(https://artificialanalysis.ai/evaluations/omniscience),一项对 40 个 AI 模型的 2025 年评估发现,除四个模型外,其他所有模型在面对难题时,更可能给出自信但错误的答案,而非正确答案。随着 AI 在网络安全运营中扮演更大角色,组织必须将每个 AI 生成的响应视为潜在漏洞,直至人工完成验证。 ## 什么是 AI 幻觉? AI 幻觉是指那些被自信呈现、看似合理但事实不准确的输出。基础语言模型并不会检索已验证的信息;它们通过预测训练数据中习得的词语和短语模式来构建响应。由于这些响应是统计上可能但并不一定真实,幻觉输出可能与准确信息极为相似。在产生幻觉时,AI 模型可能引用不存在的来源、引用从未进行过的研究,或以与可信信息相同的自信呈现编造的数据。 对于组织而言,AI 幻觉的主要问题不仅在于不准确性,还在于错误的信任。当 AI 输出听起来像绝对真理时,员工可能认为它是正确的,并直接据此行动而不加验证。在网络安全环境中,错误的 AI 输出会带来重大安全风险,因为它们不仅影响关键决策,还会直接输入到可触发操作行动的自动化系统中。后果可能包括系统中断、财务损失以及引入新的漏洞。 ### 导致 AI 幻觉的原因是什么? 减轻 AI 幻觉影响的第一步是理解它们是如何形成的。以下是可能导致 AI 幻觉的各种因素: - **有缺陷的训练数据:** AI 模型从其所训练的数据中学习。如果这些数据包含过时信息或明显错误,模型会将这些缺陷融入输出中。它不会标记这些差异,而是从中学习。 - **输入数据中的偏见:** 某些模式或场景的过度代表性可能导致 AI 模型将这些模式视为普遍适用,即使上下文有所不同。 - **缺乏响应验证:** 基础语言模型并非为验证事实准确性而构建。它们优化的是连贯、合理的输出。虽然有些系统添加了检索或接地层来降低此风险,但核心生成过程仍易出现幻觉。 - **提示模糊性:** 模糊的输入增加了 AI 模型用假设填补空白的可能性,从而提高了错误输出和幻觉的风险。 ## AI 幻觉影响网络安全的 3 种方式 并非所有 AI 幻觉都有相同的影响,但错误或编造的信息可能使组织容易受到严重的网络威胁。AI 幻觉主要表现为三种方式:遗漏威胁、编造威胁和错误解决方案。 ### 1. 遗漏威胁 AI 威胁检测通常依赖基于历史数据和已学习行为识别模式和异常。当网络攻击与已知行为一致时,AI 模型表现良好;但当攻击不符合已知模式时,模型没有可比较的内容,因此威胁可能被忽略。这对于代表性不足的攻击技术和零日攻击(https://www.keepersecurity.com/blog/2024/04/15/how-to-prevent-zero-day-attacks/)尤其成问题,零日攻击利用供应商未知且尚未修补的漏洞。由于这些威胁未反映在训练数据中,AI 模型缺乏足够的上下文来标记它们,导致漏洞被检测到的可能性降低,环境中暴露面增大。 ### 2. 编造威胁 与遗漏威胁相反,AI 模型也可能通过将正常活动错误分类为恶意行为来产生虚假的误报,向团队告警不存在的威胁。例如,正常的网络流量可能被误判为可疑,触发告警,引发不必要的应急响应操作。这些虚假警报可能导致系统关闭、资源浪费以及因编造威胁而产生的运营中断。随着时间的推移,重复的误报会导致告警疲劳,安全团队对所有警告变得麻木。这会增加环境中真实威胁被忽视的风险,因为团队已习惯于不信任告警。 ### 3. 错误修复 这是 AI 幻觉最危险的形式之一,因为它发生在信任已经建立之后。例如,AI 系统可能自信地建议删除敏感文件、修改系统配置或禁用防火墙规则。如果这些操作被执行,尤其是通过特权账户执行,它们可能使组织暴露于身份攻击、横向移动或不可逆的数据丢失风险中。即使 AI 威胁检测是准确的,幻觉产生的指导也可能将已控制的安全事件升级为更广泛的漏洞。 ## 组织如何降低 AI 幻觉风险 尽管 AI 幻觉无法完全消除,但通过以下控制和治理措施,其影响可以显著降低。 ### 要求行动前进行人工审核 AI 生成的输出不应急于触发敏感或特权操作,而应先由人工验证。这一点对于涉及基础设施变更、访问更新或应急响应的工作流尤为重要。审核要求不应仅在看起来有问题时才发生;模型在正确或错误时都可能表现出同样的自信。 ### 将训练数据视为安全资产 AI 幻觉常可追溯到训练数据。定期审计用于训练或接地 AI 系统的数据,消除过时记录、有偏见的数据集和不准确信息,可降低这些缺陷出现在输出中的可能性。随着 AI 生成内容在网上越来越普遍,未来模型被早期模型产生的编造信息所训练的风险也在增加,这种现象有时被称为模型崩溃。没有持续的数据治理,有缺陷的 AI 输出的风险只会增加。 ### 对 AI 系统实施最小权限访问 AI 驱动系统应仅被授予执行任务所需的权限。例如,一个 AI 系统可能只允许读取文件,而不允许删除它们——即使幻觉给出的建议是删除。通过以最小权限限制访问,组织可以确保即使 AI 系统生成了错误指导,它也无法执行超出其权限范围的操作。 ### 投资于提示工程培训 AI 输出很大程度上受输入质量影响,因此模糊的提示给模型更多机会用错误假设填补空白,增加幻觉风险。组织必须优先培训员工,特别是那些直接与 AI 系统交互的员工,如何编写具体提示,引导模型产生可验证的输出。那些理解 AI 输出在使用前必须始终验证的员工,不太可能默认将 AI 系统视为权威。 ## 将身份安全置于 AI 治理的核心 当 AI 幻觉导致实际行动时,它们就变成了真正的安全风险,这主要不是模型问题,而是访问问题。安全事件发生在 AI 系统拥有足够权限以执行错误指导时,或者人类信任输出而不加验证时。Keeper®(https://www.keepersecurity.com/privileged-access-management/)旨在为组织提供所需的可见性和访问控制,以防止未经授权的访问,即使 AI 驱动的决策是错误的。通过强制执行最小权限访问、监控特权活动以及保护人类身份和非人类身份(NHI),组织可以降低 AI 幻觉演变成破坏性安全事件的风险。 **注:** *本文由 Keeper Security 的内容作者 Ashley D'Andrea 精心撰写并贡献给我们的读者。* 觉得这篇文章有趣吗?本文是我们一位重要合作伙伴的投稿。请关注我们的 Google 新闻(https://news.google.com/publications/CAAqLQgKIidDQklTRndnTWFoTUtFWFJvWldoaFkydGxjbTVsZDNNdVkyOXRLQUFQAQ)、Twitter(https://twitter.com/thehackersnews)和 LinkedIn(https://www.linkedin.com/company/thehackernews/),阅读更多独家内容。

相似文章

AI幻觉可能比人类更“人性”

Reddit r/artificial

文章指出,AI幻觉其实映射了人类的认知偏差——确认偏误、过度自信等,它们并非纯粹的技术缺陷,而是像人类一样在知识缺口处“脑补”的结果。