BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架
摘要
本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。
查看缓存全文
缓存时间: 2026/05/12 02:50
论文页面 - BalCapRL:一种用于基于 RL 的 MLLM 图像字幕生成的平衡框架
来源:https://huggingface.co/papers/2605.07394
摘要
一种用于图像字幕生成的平衡强化学习框架,通过联合优化正确性、覆盖率和语言质量,在现有方法基础上提升了性能。
图像字幕生成 (https://huggingface.co/papers?q=Image%20captioning) 是计算机视觉中最基础的任务之一。由于其开放性特征,在多模态大语言模型 (https://huggingface.co/papers?q=multimodal%20large%20language%20models)(MLLMs)时代受到了广泛关注。为了追求更详细、更准确字幕,最近的研究越来越多地转向强化学习 (https://huggingface.co/papers?q=reinforcement%20learning)(RL)。然而,现有的字幕生成 RL 方法和评估指标往往强调狭隘的字幕质量概念,导致字幕生成核心维度之间的权衡。例如,以效用为导向的目标可能会鼓励产生噪声、幻觉或过长的字幕,这虽然能提升下游问答任务的性能,但会损害流畅性;而竞技场式目标则倾向于偏好流畅但通用的描述,实用性有限。为此,我们提出了一种更平衡的 RL 框架,联合优化感知效用的正确性、参考覆盖率和语言质量。为了有效优化由此产生的连续多目标奖励公式 (https://huggingface.co/papers?q=continuous%20multi-objective%20reward%20formulation),我们对连续值的字幕生成奖励应用了 GDPO-style (https://huggingface.co/papers?q=GDPO-style) 的奖励解耦归一化 (https://huggingface.co/papers?q=reward-decoupled%20normalization),并证明其性能优于原始 GRPO (https://huggingface.co/papers?q=GRPO)。此外,我们引入了条件长度奖励掩码 (https://huggingface.co/papers?q=length-conditional%20reward%20masking),为字幕生成提供了更合适的长度惩罚。在 LLaVA-1.5-7B 和 Qwen2.5-VL 3B 和 7B 基础模型上,我们的方法 consistently 提升了字幕质量,在不同模型上取得了高达 +13.6 DCScore (https://huggingface.co/papers?q=DCScore)、+9.0 CaptionQA (https://huggingface.co/papers?q=CaptionQA) 和 +29.0 CapArena (https://huggingface.co/papers?q=CapArena) 的峰值增益。
查看 arXiv 页面 (https://arxiv.org/abs/2605.07394) 查看 PDF (https://arxiv.org/pdf/2605.07394) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.07394)
在你的 agent 中获取此论文:
hf papers read 2605\.07394
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 0
暂无模型链接此论文
在模型的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。
引用此论文的数据集 0
暂无数据集链接此论文
在数据集的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。
引用此论文的 Spaces 0
暂无 Space 链接此论文
在 Space 的 README.md 中引用 arxiv.org/abs/2605.07394 即可从此页面链接。
包含此论文的收藏集 0
暂无收藏集包含此论文
将此论文添加到收藏集 (https://huggingface.co/new-collection) 即可从此页面链接。
相似文章
ClaimDiff-RL:通过视觉声明比较进行细粒度描述强化学习
介绍了ClaimDiff-RL,一种用于长格式图像描述的强化学习框架,该框架使用类型化、可验证的声明差异作为奖励单元,分别衡量和平衡幻觉与缺失事实,从而提高忠实度和覆盖率。
通过标签空间重塑平衡多模态学习
介绍了平衡多模态标签重塑(BMLR),该方法通过重塑标签空间来平衡跨模态的映射难度,从而解决多模态学习中的模态不平衡问题,并在多种架构上提升性能。
面向智能体与多模态大语言模型的上下文感知强化学习
介绍了ContextRL,一种强化学习方法,教会大语言模型识别哪些上下文支持答案,在智能体和多模态基准上取得了性能提升。
增强多模态推理以对抗视觉退化
本文介绍了 ROMA,这是一种强化学习微调框架,旨在提高多模态大语言模型(MLLMs)对模糊和压缩伪影等视觉退化的鲁棒性。该框架通过双重前向传播策略和专门的正则化技术实现这一目标,在保持干净输入准确性的同时,提升了推理基准测试的性能。
ReAD:面向大型语言模型的强化引导能力蒸馏
本文提出了 ReAD,这是一种强化引导的能力蒸馏框架,通过考虑大型语言模型中的跨能力迁移来优化 token 预算。与现有基线相比,该方法在提升下游效用的同时,减少了有害溢出。