定义多模态人工智能系统的十种失败模式
摘要
该文章基于基准测试论文和研究,列举了十种多模态AI系统中有记录的失败模式,在这些模式中,模型会生成流畅但与实际输入不符的回答。
暂无内容
查看缓存全文
缓存时间: 2026/08/20 22:51
# 多模态AI系统的十大失效模式 —— 绝对数字出版
来源:https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems
一个能看、能听、能读的模型仍然返回一个流畅的答案,而流畅性掩盖了这样一个事实:那个答案与实际输入内容之间的联系,会以十种独立、有据可查的方式断裂。
## 十个案例档案,一个文件柜
多模态系统的故障很少会自我宣告。模型仍然在回答。它仍然在描述图片,转录音频片段,在浏览会话中提议下一个点击——它返回的句子语法正确、内容具体,并且无论对错都带着同样平稳的自信。断裂的不是句子本身。断裂的是那个句子与图像、音频、深度图或第二份文档中实际内容之间的对应关系,而这份文档本应是模型用来核对第一份的。阅读输出结果,几乎无法告诉你这种对应关系是否得以保持。
本文列举了十种在部署级和研究级多模态系统中独立记录的、对应关系如何崩溃的方式。每种都源自基准测试论文、安全研究或训练动态分析,而非轶事证据,并且每种都有其自身的检测方法和根本原因——它们并非对同一个底层问题的重述。在列出清单之前,有两点说明。首先,这里的“多模态”涵盖视觉-语言、音视频以及使用多于一种信息通道的智能体系统;由于视觉-语言对拥有最完善的基准测试基础设施,相关证据最为确凿,本文在证据较薄弱的其他配对类型处会予以说明。其次,这些是文档记录的倾向性,在特定基准测试上有测量到的概率,并非普遍常数——模型暴露于其中任何一种的风险取决于其训练数据、融合架构以及实际运行时的任务分布。
**图1。** 模型原本就没怎么利用图像;遮蔽它对答案几乎没有影响。图像提示与艺术指导:Brecht Corbeel;图像根据该指导生成。
一个审计控制台,一个条纹拉丝铝制百叶窗半降着,遮住一个哑光玻璃图像输入监视器,而旁边一个文本输出显示器持续打印出一行不变的文字。
## 1. 跨模态幻觉:描述不存在的事物
研究最多的故障也是最基本的:模型对其输入中并不包含的对象、声音或事件生成了自信的描述。Rohrbach 及其同事在图像描述领域为这现象命名并制定了度量标准——CHAIR,它检查生成的对象提及是否与经过验证的真实对象列表相符——他们的核心发现有悖直觉:在标准流畅性和相似性指标上得分最高的模型,并非必然产生更少的幻觉,而那些包含更多幻觉内容的描述,更主要是由语言先验而非视觉误分类驱动的[2 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-rohrbach-chair-hallucination)]。这就是机制的缩影。模型并非未能“看见”;它是在以训练分布中描述通常会如何的方式补全一个描述,而这种补全通常是正确的,因为共现的对象通常确实会共现——直到它们不共现为止。
Li 及其同事用 POPE 扩展了这一诊断,这是一种基于投票的评估,直接询问模型特定对象是否存在,旨在绕过自由形式描述指标同时奖励流畅性和准确性这一混淆因素。他们的发现是,幻觉并非罕见的边缘情况,而是他们测试的大型视觉-语言模型的普遍特性,集中出现在训练数据中频繁出现的对象,或习惯性与图像实际内容共现的对象上[1 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-li-pope-hallucination)]。实际后果是:一段读起来像仔细视觉描述的文字,在可测量的部分,可能是语言模型关于它所看到内容通常会伴随什么内容的先验判断,并以与观察相同的语法进行断言。
## 2. 模态坍缩:依据先验而非输入回答
一种更微妙且更深层次的架构故障是,一个联合训练的多模态模型可能会系统性地忽略其某个输入通道——并非因为该通道信息量不足,而是因为梯度下降发现通过另一个通道更容易解决训练目标。Peng 及其同事直接记录了这一点:在使用单一统一目标的多模态判别式训练中,一个模态通常主导优化过程——他们的例子是刮风时音频主导视觉,或绘画任务中视觉主导音频——导致另一个模态的编码器相较于其独立运行时可达到的性能,测量上处于欠优化状态[3 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-peng-gradient-modulation)]。他们的修复方法——动态梯度调制,监控每个模态对损失的相对贡献并相应地重新平衡更新——本身也证明了该诊断:如果不平衡不真实或不可纠正,那么监控和重新平衡每个模态的梯度就不会产生可测量的提升。
这与跨模态幻觉在重要方面有所不同。幻觉是输出中可见的症状——描述中的错误名词。模态坍缩是训练后权重本身的特性:在训练过程中,承载一个通道信息进入共享表示的路径从未被充分驱动,以至于在推理时无关紧要,无论该通道在给定输入上实际包含什么。处于此状态的模型可以通过在主导模态上进行模式匹配来通过基准测试的大部分内容,而名义上的多模态通道几乎不发挥作用——这与模型主动捏造内容是不同的失败模式,尽管两者可能产生相同的错误答案。
**图2。** 在单一标准视图上训练的空间推理,一旦物体转动就会失效。图像提示与艺术指导:Brecht Corbeel;图像根据该指导生成。
一个小物体放在哑光黑色转盘上,正在转向远离旁边钉着的平面印刷参考照片所匹配的角度,一个测量探头臂抵在物体错误的面上。
## 3. 生成和处理内容中的音视频对齐错误
当两个模态必须以锁定方式产生或处理时——口型与音素、脚步与接触帧、音乐节拍与剪辑点——小的时序错误比自动检测它们要容易得多,因为大多数质量指标单独评估每个通道的合理性,而非它们的联合时序。Liu 及其同事专门构建了 JavisDiT 来弥合文本到音视频生成中的这一差距,他们在模型内部引入了分层时空同步机制,并配套推出了专用基准 JavisBench 以及一个专门构建的同步性度量——因为正如他们自己所述,现有的评估方法不足以捕捉生成内容中的音视频错位[4 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-liu-javisdit-avsync)]。需要专用架构、基准和度量这一事实本身就是文档记录:联合音视频生成并不会因为强大的单通道质量而自动获得同步性,作者报告称他们的方法在他们构建的用于检测此特定故障的同步性度量上,优于先前的联合生成方法[4 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-liu-javisdit-avsync)]。
问题的普遍形式超越了生成,延伸到任何将音频和视频作为松散耦合流处理的管道——配音、基于转录的字幕生成和多摄像机事件重建都继承了同样的风险,因为在具有独立计时编码器的双塔架构中,没有任何东西保证关于音轨的断言和关于视频轨的断言谈论的是同一时刻。这是本目录中证据基础更新且更薄弱的故障模式;请将机制本身视为已确立,而关于其在特定已部署产品中频率的任何单一数字,在该产品公布之前都应视为未经验证。
## 4. 将二维训练应用于三维任务导致的空间推理错误
视觉-语言模型主要在平面的、单视图图像与描述可见内容而非产生该视图的三维几何结构的描述进行配对训练。三个独立的基准测试得出了相同的发现:模型尚可处理标准的、常见的视角,一旦需要真正的空间或深度推理,性能就会急剧下降。Fu 及其同事围绕十四个经典计算机视觉感知任务(包括相对深度和空间关系)构建了 BLINK,这些任务“人类能在瞬间解决”,他们发现人类平均准确率为 95.70%,而 GPT-4V 为 51.26%,Gemini 为 45.72%,两者仅略高于 38.09% 的随机猜测基线[5 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-fu-blink-perception)]。Liu 及其同事的视觉空间推理数据集涵盖六十六种空间关系,发现人类上限超过 95%,而最佳模型约为 70%,并且——更重要的结构性发现——按关系细分的表现与模型见过该关系的训练样本数量几乎没有相关性,这意味着仅通过增加同类配对数据的数量并不能缩小差距[6 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-liu-visual-spatial-reasoning)]。Ma 及其同事的 3DSRBench 更进一步,明确区分了同一场景的常见与非常见摄像机视角,发现大型多模态模型在非常见视角条件下表现出显著降低的三维空间推理能力[7 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-ma-3dsrbench)]。
综合来看,这些结果支持一种特定的解释(此处作为分析而非任何一篇论文明确提出的结论):在互联网图像的摄影师视平线、标准角度分布上训练的模型,可以学习到模仿其在已见过的视图上的空间理解的表面统计,而并未获得能推广到真正三维几何的任何能力。旋转物体、改变相机高度或询问被遮挡的关系,模仿就会失效。
## 5. 多模态输出特有的生成伪影
单幅静图本身,要么看起来正确,要么不正确。生成的视频增加了一个维度,这是标准的逐帧质量检查从未设计来捕捉的:一个对象是否随时间保持为同一对象。Huang 及其同事构建了 VBench,因为用单一分数量化视频生成会混淆那些独立失效的维度,他们明确将质量分解为十六个独立维度,包括时间闪烁和运动平滑度,以便模型在不同维度上的优势和劣势可见,而不是被平均掉[8 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-huang-vbench)]。一个全面的基准测试需要十六个可分离的维度而非一个,这一事实本身就是证据,表明逐帧合理性和跨帧一致性是不同的属性,当前模型并未自动同时提供——一个片段可能由单独看似合理的帧组成,但其主体在相邻帧之间形状、颜色或身份发生微妙变化,这种失效对于任何仅逐帧独立评分的度量来说都是不可见的。
**图3。** 没有任何机制确保同一个对象在生成帧之间保持为同一对象。图像提示与艺术指导:Brecht Corbeel;图像根据该指导生成。
一段生成视频片段的胶片条放在灯箱上,分成单独剪裁的帧,中间附近的一帧仍在其夹子上摇晃,并显示出一个形状与其两侧匹配帧明显不同的对象。
## 6. 通过单模态捷径欺骗基准测试
一个看起来像是多模态能力证据的基准分数,可能在实质上是一个戴着多模态标签的纯文本分数。Chen 及其同事对此类广泛使用的视觉-语言基准进行了审计,发现这并非边缘效应:GeminiPro 在完全没有视觉输入的情况下,在 MMMU 上达到了 42.9%,在六个基准测试中,移除图像的模型平均比随机选择基线高出 24% 以上,Sphinx-X-MoE 在 MMMU 上未访问图像却得到 43.6%——比其自身的语言模型骨干单独运行高出 17.9 分,这是泄露而非仅仅是语言先验猜测的证据[9 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-chen-mmstar-shortcuts)]。他们的回应是 MMStar,一个为真正视觉必要性而人工策划的基准。
这一发现促使一个简单、可检查的分解而非新指标:对于任何多模态基准,令 \(s_{\text{multi}}\) 为所有模态存在时的分数,\(s_{\text{text}}\) 为移除非文本模态后同一基准的分数。量
\[
\Delta = s_{\text{multi}} - s_{\text{text}}
\]
才是实际的多模态增量——移除通道在文本本身已提供的基础上额外贡献了什么。一个 \(s_{\text{multi}}\) 很大但 \(\Delta\) 很小,并非多模态能力的证据;它表明是基准测试,而非模型,在做单模态的事情。在报告 \(s_{\text{multi}}\) 的同时报告 \(\Delta\),只需额外运行一次评估,就能将一个无法证伪的头条数字变为可验证的数字。
## 7. 对模态特定对抗性扰动的脆弱性
在语言模型上增加图像或音频通道,不仅增加了一种能力;还增加了一个有其自身物理特性的攻击面,而主要针对文本进行的安全训练并不能自动覆盖这一点。Qi 及其同事表明,一张对抗性优化过的图像——对一张普通图片施加的不可察觉或近乎不可察觉的扰动——可以普遍破解一个对齐的视觉-语言模型,诱导其遵从一系列在没有图像存在时会拒绝的有害文本指令,且该效果在不同指令间普遍化,而非仅仅复现一个记忆中的有害样本[10 (https://absolutedigitalpublishers.com/articles/ten-failure-modes-that-define-multimodal-ai-systems#ref-qi-visual-adversarial-jailbreak)]。Bailey 及其同事将攻击扩展到越狱之外,实现任意行为控制:他们的“图像劫持”,通过行为匹配算法生成,据报道在多个不同的攻击目标(强制特定输出、泄露上下文、覆盖安全行为)上对 LLaVA 达到了超过 80% 的成功率,使用的是来自与目标行为无关的通用数据集的源图像,
相似文章
显性还是隐性?多模态临床AI中逐模态失败分析的可复用框架
本文提出了一个与模型无关的框架,用于多模态临床AI中的逐模态失败分析,以区分在丢弃某个模态时出现的显性失败与隐性失败。该框架在植入的ground truth上进行了验证,并应用于EchoJEPA和HuBERT-ECG嵌入进行LVEF预测,结果表明丢弃echo后误差几乎翻倍。
AI代理的下一个失败模式将不会像一个糟糕的提示那样简单。
本文讨论了AI代理的下一个预期失败模式,它可能比单一的糟糕提示更复杂。
AI代理的失败方式鲜有人论及。以下是我亲眼所见。
文章强调了AI代理工作流程中实际的系统级失败,例如上下文泄漏和幻觉细节,认为这些通常是基础设施问题而非模型缺陷。
AI智能体在企业环境中最常见的故障模式有哪些?
探讨AI智能体在企业环境中的常见故障模式,例如过度依赖长期记忆和无状态工具门控导致的安全风险。
AI 实战前线:为何其辉煌与失败源于同一根源
作者分享了两年内使用AI构建平台的经验,指出了六种反复出现的故障模式(补丁式、假设式、漂移式、幻觉式、缺乏常识式、最小阻力式),并认为即使模型不断改进,这些故障模式依然存在,且变得更加难以察觉。