PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
摘要
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
arXiv:2608.05249v1 公告类型:新增
摘要:现实世界的多模态指令通常包含多个重要性不等的要求,然而大多数多模态训练数据仍然将指令跟随简化为回答一个独立的问题。我们通过\textbf{规则理解}来研究这一差距,该设定将模型不是视为根据规则被评估的生成器,而是视为遵循规则的\textbf{执行者}:给定一张图像和一个带类型、带优先级的规则集,模型必须在产生整体判断之前验证每条规则。为支持这一设定,我们提出了\textbf{PRISM},一个四阶段数据合成框架,用于生成角色-任务对、前缀引导的规则集、质量过滤的规则以及结构化验证轨迹。我们还进一步介绍了\textbf{PRISM-Eval},其宽松和严格指标使用确定性匹配对照固定标签,因此不需要推理时的评判模型。仅用10K合成样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5\%提升到30.1\%,同时保持了通用基准的平均性能,并且这些提升可迁移到另外四个开源多模态大语言模型上,涵盖稠密和MoE架构,这表明结构化规则监督是通往多规则、优先级感知的多模态指令跟随的可扩展路径。
查看缓存全文
缓存时间: 2026/08/07 07:49
# PRISM:基于结构化多模态数据合成的优先级感知规则内化 来源:https://arxiv.org/abs/2608.05249 查看PDF (https://arxiv.org/pdf/2608.05249) > 摘要:现实世界的多模态指令往往捆绑了多个重要性不等的需求,然而大多数多模态训练数据仍将指令遵循简化为回答一个自包含的问题。我们通过**规则理解**来研究这一差距,它将模型不是视为以规则为衡量标准的生成器,而是视为遵循规则的**执行者**:给定一张图像和一个类型化、按优先级排序的规则集,模型必须在产生总体判断之前验证每一条规则。为支持这一设定,我们提出了**PRISM**,一个四阶段数据合成框架,用于生成角色-任务对、前缀引导的规则集、质量过滤的规则以及结构化验证轨迹。我们进一步引入了**PRISM-Eval**,其Loose和Strict指标使用与固定标签的确定性匹配,因此不需要推理时的评判模型。仅使用10K合成样本,PRISM即可将Qwen3-VL-4B在PRISM-Eval上的Strict准确率从9.5%提升至30.1%,同时保持其在通用基准上的平均性能,并且这些收益可迁移到另外四个开源MLLM上,涵盖密集架构和MoE架构,这表明结构化规则监督是通往多规则、优先级感知的多模态指令遵循的可扩展路径。 ## 提交历史 来自:Xiaomin He [查看邮箱](https://arxiv.org/show-email/55986ff4/2608.05249) **[v1]** 周三,2026年8月5日 15:55:15 UTC(14,284 KB)
相似文章
PRISM:评估LLM审稿人的多维度基准
介绍PRISM,一个用于评估基于大语言模型的同行评审员的多维度基准,涵盖分析深度、新颖性评估、缺陷识别和建设性。研究结果表明,大语言模型在单个维度上能与人类评审员匹敌甚至超越,但缺乏跨所有维度的平衡表现,因此最适合作为人类评审的补充工具。
PRISM: 程序化时空推理基准
PRISM是一个大规模基准,包含10,372个人工校准的指令-代码对,用于评估程序化视频生成,并采用了一个漏斗式框架,包含四个指标。对七个大型语言模型的评估揭示了代码可执行性与空间一致性之间存在显著差距。
PRISM:面向共情口语对话的韵律集成多智能体推理框架
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
PRISM-VLM:一个面向紧凑型视觉语言模型的多维度鉴别性基准
PRISM-VLM 是一个多维度鉴别性基准,评估紧凑型视觉语言模型在七个维度上的表现,包括任务质量和行为鲁棒性,与单维度基准相比,能提供更可靠的区分和洞察。它旨在发布一个开放流程,供社区改进AI评估方法。
PReMISE:将策略规则作为LLM评估者的度量规范
介绍了PReMISE,一个用于发现和审计LLM评估者策略级规则的框架,涵盖四个维度:结构充分性、可靠性、偏好匹配度和对抗鲁棒性。