超越正确性:混合思维多模态大语言模型的响应行为基准测试与对齐

Hugging Face Daily Papers 论文

摘要

本文介绍了PatternEval,一个用于评估混合思维多模态大语言模型中响应模式故障的诊断基准,并提出了PatternRL,通过带有特定惩罚的强化学习来对齐这些模式。

混合思维多模态大语言模型(MLLMs)允许单个模型在深思熟虑的思维和低延迟的非思维推理之间交替。虽然这些模式在推理预算上有所不同,但它们提供的响应应满足相同的用户面向标准。仅靠正确性可能不足以描述这种响应质量;因此,我们评估任务准确率和响应模式故障作为互补的结果。我们通过响应模式对齐来研究这一差距:思维和非思维接口是否保持可接受的最终响应行为。我们引入PatternEval,一个包含丰富故障的诊断基准,由2,415个多模态提示组成,涵盖视觉感知与定位、结构化图像理解和多模态知识推理。PatternEval测试四种反复出现的故障:思维链泄漏、响应重复、逻辑矛盾和表演性推理。响应模式故障在来自不同提供商的模型中普遍存在,非思维推理表现出显著更高的故障率,从而导致思维和非思维接口之间的系统性错位。受此诊断的启发,我们开发了PatternRM,一个响应级别的奖励模型,以及PatternRL,它在强化学习中引入了针对模式的惩罚。在Qwen3-VL-4B和Qwen3-VL-8B上的实验表明,在强化学习中纳入针对模式的惩罚可以缓解跨模式错位,同时带来轻微的性能权衡。总之,PatternEval和PatternRL提供了一个评估与训练框架,用于对齐跨混合思维接口的用户可见响应模式。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:40

论文页面 - 超越正确性:混合思维多模态大语言模型中的响应行为基准测试与对齐

来源:https://huggingface.co/papers/2608.12781 作者: , , , , , , , , , , , , , ,

摘要

混合思维多模态语言模型在思考与非思考模式之间存在响应模式错位问题,本文通过一个诊断基准测试和针对模式的强化学习惩罚来解决该问题。

混合思维(https://huggingface.co/papers?q=Hybrid-thinking)多模态大语言模型(https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs) 允许单个模型在深思熟虑的思考与低延迟的非思考推理之间交替。尽管这些模式在推理资源消耗上有所不同,但其提供的响应应满足相同的用户端标准。仅仅正确性可能不足以描述这种响应质量;因此,我们将任务准确性和响应模式故障作为互补的结果进行评估。我们通过响应模式对齐(https://huggingface.co/papers?q=response-pattern%20alignment)来研究这一差距:即思考和非思考接口是否保留了可接受的最终响应行为。我们引入了PatternEval(https://huggingface.co/papers?q=PatternEval),这是一个包含丰富故障的诊断基准测试,包含2,415个多模态提示,涵盖视觉感知与定位、结构化图像理解以及多模态知识推理。PatternEval(https://huggingface.co/papers?q=PatternEval)测试四种常见故障:思维链泄露(https://huggingface.co/papers?q=chain-of-thought%20leakage)、响应重复、逻辑矛盾(https://huggingface.co/papers?q=logical%20contradiction)和表演性推理(https://huggingface.co/papers?q=performative%20reasoning)。响应模式故障在不同供应商的模型中普遍存在,其中非思考推理表现出明显更高的故障率,从而在思考与非思考接口之间造成了系统性的错位。基于此诊断,我们开发了PatternRM(https://huggingface.co/papers?q=PatternRM),一个响应级别的奖励模型,以及PatternRL(https://huggingface.co/papers?q=PatternRL),它在强化学习(https://huggingface.co/papers?q=reinforcement%20learning)中引入了针对模式的惩罚。在Qwen3-VL-4B和Qwen3-VL-8B上的实验表明,在强化学习中纳入针对模式的惩罚可以减轻跨模式错位,同时仅带来边际的任务性能权衡。综上,PatternEval(https://huggingface.co/papers?q=PatternEval)与PatternRL(https://huggingface.co/papers?q=PatternRL)提供了一个评估与训练框架,用于对齐混合思维(https://huggingface.co/papers?q=hybrid-thinking)接口间用户可见的响应模式。

查看arXiv页面 (https://arxiv.org/abs/2608.12781)查看PDF (https://arxiv.org/pdf/2608.12781)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.12781)

在你的代理中获取此论文:

hf papers read 2608\.12781

没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型README.md中引用arxiv.org/abs/2608.12781以从此页面链接到它。

引用此论文的数据集0

没有数据集链接到此论文

在数据集README.md中引用arxiv.org/abs/2608.12781以从此页面链接到它。

引用此论文的Space0

没有Space链接到此论文

在Space README.md中引用arxiv.org/abs/2608.12781以从此页面链接到它。

包含此论文的收藏0

没有收藏包含此论文

将此论文添加到收藏 (https://huggingface.co/new-collection)以从此页面链接到它。

相似文章

通过宽基线匹配激发MLLMs中的复杂空间推理

Hugging Face Daily Papers

本文介绍了ReasonMatch-Bench,一个用于多模态大语言模型中宽基线匹配的基准,并提出了动态对应强化学习(DCRL)以提升空间推理能力。实验表明,该方法在基准测试上取得了显著提升,同时保持了通用性能。

HumanLLM:通过人类认知模式对大语言模型拟人化的基准测试与改进

arXiv cs.CL

HumanLLM 提出了一个框架,通过将心理模式建模为相互作用的因果力来对大语言模型的拟人化进行基准测试和改进。该方法从学术文献中构建了244个心理模式和11,359个多模式场景。研究表明,真正的人类对齐需要认知建模而非表面行为模拟,HumanLLM-8B 在多模式动态上的表现超越了 Qwen3-32B 等更大的模型。

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。