BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架

Hugging Face Daily Papers 论文

摘要

本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。

图像描述生成是计算机视觉中最基础的任务之一。由于其开放式的特性,在多模态大语言模型(MLLM)时代受到了广泛关注。为了追求更加详细和准确的描述,近期研究越来越多地转向使用强化学习(RL)。然而,现有的基于 RL 的描述生成方法和评估指标往往强调狭隘的描述质量概念,导致在描述的核心维度之间产生权衡。例如,以实用性为目标可能会鼓励产生噪声大、幻觉严重或过于冗长的描述,这虽然能提高下游问答任务的性能,却损害了流畅性;而以竞技场风格为目标则可能倾向于生成流畅但通用、实用性有限的描述。为了解决这一问题,我们提出了一个更加平衡的 RL 框架,联合优化感知实用性的准确性、参考覆盖率和语言质量。为了有效优化由此产生的连续多目标奖励公式,我们对连续值的描述奖励应用了 GDPO 风格的奖励解耦归一化,并证明其性能优于标准的 GRPO。此外,我们引入了长度条件奖励屏蔽,为图像描述生成提供了更合适的长度惩罚。在 LLaVA-1.5-7B 以及 Qwen2.5-VL 3B 和 7B 基础模型上的实验表明,我们的方法一致提升了描述质量,在不同模型上最高增益分别为 DCScore +13.6、CaptionQA +9.0 和 CapArena +29.0。
查看原文
查看缓存全文

缓存时间: 2026/05/12 02:50

论文页面 - BalCapRL:一种用于基于 RL 的 MLLM 图像字幕生成的平衡框架

来源:https://huggingface.co/papers/2605.07394

摘要

一种用于图像字幕生成的平衡强化学习框架,通过联合优化正确性、覆盖率和语言质量,在现有方法基础上提升了性能。

图像字幕生成 (https://huggingface.co/papers?q=Image%20captioning) 是计算机视觉中最基础的任务之一。由于其开放性特征,在多模态大语言模型 (https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)时代受到了广泛关注。为了追求更详细、更准确字幕,最近的研究越来越多地转向强化学习 (https://huggingface.co/papers?q=reinforcement%20learning)(RL)。然而,现有的字幕生成 RL 方法和评估指标往往强调狭隘的字幕质量概念,导致字幕生成核心维度之间的权衡。例如,以效用为导向的目标可能会鼓励产生噪声、幻觉或过长的字幕,这虽然能提升下游问答任务的性能,但会损害流畅性;而竞技场式目标则倾向于偏好流畅但通用的描述,实用性有限。为此,我们提出了一种更平衡的 RL 框架,联合优化感知效用的正确性、参考覆盖率和语言质量。为了有效优化由此产生的连续多目标奖励公式 (https://huggingface.co/papers?q=continuous%20multi-objective%20reward%20formulation),我们对连续值的字幕生成奖励应用了 GDPO-style (https://huggingface.co/papers?q=GDPO-style) 的奖励解耦归一化 (https://huggingface.co/papers?q=reward-decoupled%20normalization),并证明其性能优于原始 GRPO (https://huggingface.co/papers?q=GRPO)。此外,我们引入了条件长度奖励掩码 (https://huggingface.co/papers?q=length-conditional%20reward%20masking),为字幕生成提供了更合适的长度惩罚。在 LLaVA-1.5-7B 和 Qwen2.5-VL 3B 和 7B 基础模型上,我们的方法 consistently 提升了字幕质量,在不同模型上取得了高达 +13.6 DCScore (https://huggingface.co/papers?q=DCScore)、+9.0 CaptionQA (https://huggingface.co/papers?q=CaptionQA) 和 +29.0 CapArena (https://huggingface.co/papers?q=CapArena) 的峰值增益。

查看 arXiv 页面 (https://arxiv.org/abs/2605.07394) 查看 PDF (https://arxiv.org/pdf/2605.07394) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.07394)

在你的 agent 中获取此论文:

hf papers read 2605\.07394

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型 0

暂无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。

引用此论文的数据集 0

暂无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。

引用此论文的 Spaces 0

暂无 Space 链接此论文

在 Space 的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。

包含此论文的收藏集 0

暂无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。

相似文章

通过标签空间重塑平衡多模态学习

arXiv cs.LG

介绍了平衡多模态标签重塑(BMLR),该方法通过重塑标签空间来平衡跨模态的映射难度,从而解决多模态学习中的模态不平衡问题,并在多种架构上提升性能。

增强多模态推理以对抗视觉退化

Hugging Face Daily Papers

本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。

ReAD:面向大型语言模型的强化引导能力蒸馏

arXiv cs.CL

本文提出了 ReAD,这是一种强化引导的能力蒸馏框架,通过考虑大型语言模型中的跨能力迁移来优化 token 预算。与现有基线相比,该方法在提升下游效用的同时,减少了有害溢出。