合规、能力与冲突:系统消息下多模态LLM的基准测试

arXiv cs.CL 论文

摘要

文章介绍了VSysBench,一个评估多模态大语言模型在系统消息下约束合规性与答案正确性的基准。研究发现系统消息降低了任务准确率,且开源权重模型与专有模型的合规表现存在差异。

arXiv:2608.19207v1 Announce Type: new 摘要:多模态大语言模型在生产部署中越来越多地依赖系统消息来管理模型行为。然而现有基准测试要么仅评估文本约束,要么将其嵌入用户交互环节,导致多模态场景下的系统消息遵守程度基本未被测量;同时这些基准也未能揭示合规性是否以牺牲基础视觉语言能力为代价。我们推出VSysBench——一个基于MMVet-v2构建的基准,将约束条件组织为5大类22小类,涵盖从视觉情境中的文本指令到完全基于视觉的约束,每类均配有失调对照组以压力测试指令层级结构。VSysBench通过联合满足率(JSR)与跨约束敏感度(CCS)两个维度对响应进行双重评分,分别评估约束合规性与答案正确性。对16个MLLMs的测试表明:系统消息的引入显著降低了基础任务准确率;在用户指令冲突场景下,开源权重模型的合规性急剧下降而头部专有模型保持稳定;且基于视觉的约束是所有模型中最难处理的类别。
查看原文
查看缓存全文

缓存时间: 2026/08/21 09:58

# 合规、能力与冲突:系统消息下的多模态大语言模型基准测试

来源:https://arxiv.org/html/2608.19207

Juan Yeo*‡ 首尔国立大学数据科学研究生院 [email protected] & Geewook Kim*† NAVER Cloud AI KAIST AI [email protected]

###### 摘要
多模态大语言模型(MLLMs)在生产部署中越来越多地依赖系统消息来引导模型行为。然而,现有的基准测试要么仅评估文本约束,要么将约束嵌入到用户轮次中,使得系统消息在多模态场景下的遵循度在很大程度上未被衡量;它们也未解决合规性是否以牺牲基础视觉语言能力为代价的问题。我们推出了 **VSysBench**,这是一个基于 MMVet-v2 构建的基准测试,它将约束组织为 5 个主要类别和 22 个子类别,涵盖从视觉场景中的文本指令到完全基于视觉的指令,每个约束都配有一个失配的对应项,用于压力测试指令层级。 **VSysBench** 通过联合满足率(JSR)和跨约束敏感度(CCS)两个指标,共同评估每个响应在约束合规性和答案正确性两个轴上的表现。通过对 16 个 MLLMs 的评估,我们发现,施加系统消息会显著削弱基础任务准确性;对于开源权重模型,合规性在用户冲突下崩溃,而顶级闭源模型则保持稳定;并且基于视觉的约束是所有模型最难处理的类别。我们的基准测试已公开发布于 https://github.com/naver-ai/VSysBench。

**合规、能力与冲突:系统消息下的多模态大语言模型基准测试**
Juan Yeo*‡ 首尔国立大学数据科学研究生院 [email protected] Geewook Kim*† NAVER Cloud AI KAIST AI [email protected]

††脚注文本:*Juan Yeo 和 Geewook Kim 对此工作贡献相等,共同列为第一作者。††脚注文本:‡工作在 NAVER Cloud AI 完成。††脚注文本:†通讯作者。

## 1 引言

参考图注
**图 1:VSysBench 中两个代表性案例。(上)模型返回了正确答案(橙色),但违反了 JSON 模式,仅输出了 4 个必需 bbox 坐标中的 2 个——答案正确,约束失败。(下)模型严格遵循了位置标签格式,但错误识别了水果(香蕉而非橙子)——约束满足,答案错误。** 仅对两个轴中的一个进行评分的基准测试会将每个案例标记为成功。VSysBench 在同一实例上对两者进行联合评分。

多模态大语言模型(MLLMs)的生产部署行为,现在越来越多地不是由用户查询单独引导,而是由其之前的系统消息引导。在实践中,行为是由系统消息而非微调来引导的:提示级别的控制成本更低、迭代更快,并且允许单个基础模型服务于多个下游产品。因此,系统消息位于用户查询之上,管理跨交互的整体行为。这一角色在 MLLMs 中分量更重,因为系统消息还必须塑造模型解释视觉输入的方式。尽管扮演着如此核心的角色,大多数多模态基准测试在评估 MLLMs 时使用默认的“有帮助的助手”提示,导致系统消息的遵循度在很大程度上未被衡量。越来越多的指令遵循工作开始填补这一空白,但每个现有方向都未触及基于视觉的系统消息设置。SysBench (Qin et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib1)) 直接探究系统消息遵循,但仅限于文本,无法检查视觉输入如何与系统级约束交互。MIA-Bench (Qian et al., 2025 (https://arxiv.org/html/2608.19207#bib.bib3)) 和 MM-IFEval (Ding et al., 2025 (https://arxiv.org/html/2608.19207#bib.bib4)) 将指令遵循扩展到图文对,但将约束嵌入用户轮次中,因此无法测试系统消息在面对冲突的用户请求时是否能保持坚定。VC-IFEval (He et al., 2026 (https://arxiv.org/html/2608.19207#bib.bib2)) 引入了视觉依赖性约束并采用 LLM-as-judge 评分,但同样将其置于用户层面,并且没有测量系统级执行如何与模型的核心视觉推理交互。仍然缺少一个基准测试,它 (i) 在真正的多模态场景中将约束置于系统层面,(ii) 将其暴露于有意的冲突用户输入,并 (iii) 在同一实例上联合评估合规性和基础任务准确性。

我们推出了 **VSysBench**,一个直接解决这三个空白的基准测试。它基于 MM-Vet v2 (Yu et al., 2024b (https://arxiv.org/html/2608.19207#bib.bib30)) 构建,包含 2,258 个人工验证的样本,涵盖 5 个主要类别和 22 个子类别的约束,范围从视觉场景中的文本指令(例如,角色扮演、输出模式)到完全基于视觉的指令(例如,空间标记、图像条件内容控制)。每个查询都与 3 到 5 个不同的系统级约束(每个主要类别一个)相关联,每个查询-约束对都配有一个失配的对应项,共产生 4,516 个实例。然后,每个实例都在两个轴上进行评分——**约束合规性** 和 **答案正确性**——因此遵循系统指令不能掩盖模型基础视觉语言能力的退化,反之亦然。图 1 (https://arxiv.org/html/2608.19207#S1.F1) 具体化了这种权衡:在每个案例中,单轴指标会记录成功,而模型实际上在正交轴上失败了。失配的变体——用户消息与系统约束明确冲突——反映了生产部署中经常遇到的对抗性覆盖,使我们能够直接探究指令层级。

沿着这三个轴——对系统消息的合规性、基础视觉语言能力以及在明确用户冲突下的行为——评估 16 个著名的 MLLMs,揭示了先前基准测试无法检测到的模式。仅仅施加系统级约束就会引发显著的**约束税**,在不同模型家族中侵蚀 30–70% 的基础任务准确性。在冲突下,稳健性沿着对齐范式而非模型规模急剧分化:GPT-5.4 在对抗性用户查询下保留了 83.3% 的合规性,而 Qwen3-VL-32B 则暴跌至 8.4%。基于视觉的约束是每个被评估模型最难处理的类别,表明一旦必须根据图像内容进行验证,合规性就变得异常脆弱。然而,没有模型达到理想状态——高联合满足率与低跨约束敏感度——这标志着多模态对齐的一个明确前沿。我们的贡献总结如下:

- • **基准测试。** 我们构建了 VSysBench,第一个针对多模态 LLMs 中系统消息遵循的基准测试,具有涵盖文本和基于视觉的约束的 22 子类别分类法,以及用于探究指令层级的失配变体。
- • **评估框架。** 我们提出了一种联合协议,在同一实例上对约束合规性和任务准确性进行评分,引入了联合满足率(JSR)和跨约束敏感度(CCS)指标,以揭示边际指标无法检测的权衡。
- • **实证发现。** 通过对 16 个开源权重和闭源 MLLMs 的评估,我们确定了普遍的约束税、用户冲突下开源与闭源模型治理能力的显著差距,以及视觉约束作为当前模型主要瓶颈的地位。

## 2 相关工作

参考图注
**图 2:VSysBench 的四阶段数据集构建流程。该流程包括四个阶段:(1) 使用动态变化轴从 MM-Vet v2 基础任务生成多样的系统约束;(2) 应用自动二进制过滤和整数线性规划(ILP)来选择高质量、均衡的子集;(3) 对边界样本进行严格的人工验证;(4) 生成与系统消息明确冲突的失配用户提示,以评估指令层级的稳健性。**

##### 系统消息研究。系统消息随着 ChatGPT (OpenAI, 2022 (https://arxiv.org/html/2608.19207#bib.bib14)) 进入 LLMs,现在已成为已部署模型的标准 (Touvron et al., 2023 (https://arxiv.org/html/2608.19207#bib.bib16); Anthropic, 2024 (https://arxiv.org/html/2608.19207#bib.bib15); Yang et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib17))。随后的工作从多个角度研究了它们:使用多样系统消息进行训练可以提高对用户偏好的对齐度 (Lee et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib22); Mukherjee et al., 2023 (https://arxiv.org/html/2608.19207#bib.bib23));指令优先级训练对于安全性是必要的,因为平等对待系统和用户指令的模型容易被越狱 (Wallace et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib18); Lu et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib19); Mu et al., 2023 (https://arxiv.org/html/2608.19207#bib.bib20));并且系统消息的影响随着对话变长而衰减 (Li et al., 2024b (https://arxiv.org/html/2608.19207#bib.bib21))。所有这些工作都针对纯文本 LLMs;基于视觉的设置尚未被探索。

##### 指令遵循基准测试。指令遵循的评估已从简单的可验证模板 (Zhou et al., 2023 (https://arxiv.org/html/2608.19207#bib.bib27); Xia et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib28)) 进展到多约束组合 (Jiang et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib24); Wen et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib26); He et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib25)),最直接的是进展到系统消息本身 (Qin et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib1))。SysBench 形式化了失败模式(约束违规、指令误判、多轮不稳定)以及纯文本设置的 CSR/ISR/SSR 指标族。VSysBench 将 CSR 约定适应多模态情况,并围绕纯文本数据无法表达的类别组织其约束分类法(第 3 节 (https://arxiv.org/html/2608.19207#S3))。

##### MLLM 评估。MLLM 评估的主要轴一直是视觉能力——识别、OCR、空间推理、知识和综合推理——由 MM-Vet (Yu et al., 2024a (https://arxiv.org/html/2608.19207#bib.bib29), b (https://arxiv.org/html/2608.19207#bib.bib30))、MMBench (Liu et al., 2024b (https://arxiv.org/html/2608.19207#bib.bib31)) 和 MMMU (Yue et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib32)) 测量,它们将用户提示视为唯一的规范。另一条多模态指令遵循线将约束置于用户消息中:开放式现实世界任务 (Bitton et al., 2023 (https://arxiv.org/html/2608.19207#bib.bib5))、组合分层指令 (Qian et al., 2025 (https://arxiv.org/html/2608.19207#bib.bib3))、原子约束管道 (Ding et al., 2025 (https://arxiv.org/html/2608.19207#bib.bib4)),以及使用 LLM-as-judge 的并行视觉依赖性约束 (He et al., 2026 (https://arxiv.org/html/2608.19207#bib.bib2))。这些都没有隔离出我们针对的基于视觉的***系统***提示设置:VSysBench 将约束置于指令层级中的系统层面,允许用户有意与系统失配,并在 MM-Vet v2 的真实数据之上报告联合任务-约束指标(JSR/CCS)。

## 3 VSysBench

我们现在描述 VSysBench,这是一个旨在评估 MLLM 是否能在保持核心视觉语言(VL)能力的同时,忠实地遵循系统级约束的基准测试。

### 3.1 设计原则

引言中提出的核心问题——如何在不忽视核心 VL 能力的情况下评估多模态场景中的系统消息遵循——转化为三个指导 VSysBench 每个组成部分的设计原则。

##### P1. 多模态场景中的约束。评估 MLLMs 中的系统消息遵循需要约束在真正的多模态环境中运行,即使约束本身是文本形式,视觉输入也始终存在。因此,我们围绕一个分类法组织 VSysBench,该分类法包含 **5 个主要类别**(样式、格式、背景知识、内容控制、视觉处理),涵盖 **22 个子类别**,从视觉场景中的文本指令到完全基于视觉的指令。例如,一个约束可能要求模型仅在图像中有人物出现时采用特定角色,或者在生成答案之前列出检测到物体的空间坐标。分类法的完整细节见附录 D (https://arxiv.org/html/2608.19207#A4)。

##### P2. 双评估框架。一个稳健的评估必须不仅验证指令是否被遵循,还要验证基础任务是否在不同的约束下以一致的准确性执行。为此,VSysBench 基于 MM-Vet v2 (Yu et al., 2024b (https://arxiv.org/html/2608.19207#bib.bib30)) 的图文对构建,这些图文对广泛涵盖了 VL 能力,如识别、OCR、知识检索、空间感知和数学推理。每个 MM-Vet v2 查询都与 3 到 5 个不同的系统消息配对,我们构建相应的助手消息(新的真实答案),这些消息在满足这些约束的同时保留原始答案。这种双重结构允许我们在同一实例上同时评估两个维度:*模型是否遵循了系统约束?*以及*它是否保持了答案的正确性?*

##### P3. 失配的用户消息。先前的工作 (Wallace et al., 2024 (https://arxiv.org/html/2608.19207#bib.bib18)) 将系统消息视为指令层级的顶点,在消息类型中拥有最高权限。为了探究这一层级,VSysBench 中的用户消息分为两种条件:*对齐*变体(用户请求与系统约束兼容)和*失配*变体(用户明确与系统消息矛盾)。即使是强大的指令遵循者也可能在冲突下无法维持这一层级,这在必须维持系统级边界的部署中构成了实际风险。为了压力测试这一漏洞,VSysBench 正好一半(4,516 个样本中的 2,258 个)专门用于失配场景。

### 3.2 数据集构建

图 2 (https://arxiv.org/html/2608.19207#S2.F2) 展示了 VSysBench 的四阶段构建流程;我们在此总结,将所有阶段级别的细节、评分标准和 ILP 公式推迟到附录 A (https://arxiv.org/html/2608.19207#A1)。从 MM-Vet v2 的 517 个图文对和我们的 22 子类别分类法出发,GPT-5.1 生成了 11,374 个候选约束元组。两个二元过滤器(答案正确性和约束可验证性)保留了 10,208 个候选(85.8%),然后在两个质量轴(现实世界合理性和判断清晰度)上重新评分,并通过整数线性规划步骤减少到 2,545 个样本,该步骤强制在 5 个主要类别上实现均衡覆盖。一位人工审阅者进一步移除了 287 个边界案例,最终剩下 2,258 个验证样本。对于每个验证样本,GPT-5.1 还生成五种风格的对抗性用户前缀——直接越狱(DJ)、礼貌个人(PP)、角色扮演(RP)、权威声明(AC)和紧急绕过(UB);我们采用 DJ 作为标准失配条件(理由见第 4.3 节 (https://arxiv.org/html/2608.19207#S4.SS3)),并将每个验证样本配对。

相似文章

大语言模型能否用 TLA+ 建模实际系统?

Hacker News Top

Specula 团队的研究人员创建了 SysMoBench 基准测试,用于评估大语言模型能否准确建模实际计算系统的 TLA+ 规范,还是仅仅照本宣科地背诵教材内容。该基准测试涵盖四个阶段共 11 个系统,揭示了当前大语言模型在准确建模系统实现与参考论文方面的系统性差距。

LLM基准测试

Reddit r/AI_Agents

一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。

多模态大语言模型评估中我们缺失了什么?

arXiv cs.AI

本文回顾了当前多模态大语言模型评估基准,找出了关键差距,如时空连贯性、物理世界理解、多模态一致性和选择性注意力,并指出现有的孤立任务基准无法衡量真正的跨模态整合。