通过强化学习将分布感知注入多模态大语言模型以应对深度不平衡回归

Hugging Face Daily Papers 论文

摘要

本文介绍了一种分布感知的强化学习框架,该框架利用基于批级比较的监督信号,提升了多模态大语言模型在长尾数值回归任务中的性能。

多模态大语言模型(MLLMs)在处理具有长尾目标分布的数值回归任务时面临挑战。基于令牌级的监督微调(SFT)以及逐点回归奖励会导致学习过程偏向高密度区域,从而引发“回归均值”现象并导致尾部性能不佳。我们发现,缺乏跨样本的关系监督是现有 MLLM 训练范式的一个关键局限。为了解决这一问题,我们提出了一种基于分组相对策略优化(Group Relative Policy Optimization)的分布感知强化学习框架。该框架通过基于符合相关系数(Concordance Correlation Coefficient, CCC)的奖励引入批级比较监督,使预测分布与真实分布在相关性、尺度和均值方面保持一致。该框架即插即用,无需修改模型架构。在统一的长尾回归基准测试套件上的实验表明,该方法相比 SFT 及现有的 MLLM 回归方法实现了稳定的性能提升,特别是在中等和少样本场景下增益尤为显著。
查看原文
查看缓存全文

缓存时间: 2026/05/12 07:28

论文页面 - 通过强化学习向 MLLMs 注入分布感知以进行深度不平衡回归

来源:https://huggingface.co/papers/2605.01402 发布于 5 月 11 日

·

提交者:https://huggingface.co/ChanganYao

DUYao (https://huggingface.co/ChanganYao) 于 5 月 12 日

摘要

一种分布感知的强化学习框架通过基于批级的比较监督,提升了多模态大语言模型在长尾分布上的数值回归性能。

多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models)(MLLMs)在长尾目标分布下的数值回归 (https://huggingface.co/papers?q=numerical%20regression) 方面存在困难。基于 Token 级的监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和逐点回归奖励 (https://huggingface.co/papers?q=point-wise%20regression%20rewards) 会使学习偏向高密度区域,导致回归均值行为及尾部性能不佳。我们认为,现有 MLLM 训练范式中缺乏跨样本的关系监督是一个关键限制。为解决这一问题,我们提出了一种基于组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) 的分布感知强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 框架。该框架通过基于一致性相关系数 (https://huggingface.co/papers?q=Concordance%20Correlation%20Coefficient) 的奖励引入基于批级的比较 (https://huggingface.co/papers?q=batch-level%20comparison) 监督,从而在相关性、尺度和均值方面对齐预测分布与真实分布。该框架即插即用,无需修改架构。在统一的长尾回归基准测试套件上的实验表明,该方法在 SFT 和现有 MLLM 回归方法上均取得了持续改进,特别是在中度和少样本场景下表现尤为强劲。

查看 arXiv 页面 (https://arxiv.org/abs/2605.01402) 查看 PDF (https://arxiv.org/pdf/2605.01402) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.01402)

在您的代理中获取此论文:

hf papers read 2605.01402

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

没有链接到此论文的模型

在模型的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。

引用此论文的数据集 0

没有链接到此论文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。

引用此论文的 Spaces 0

没有链接到此论文的 Space

在 Space 的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。

包含此论文的收藏集 0

没有包含此论文的收藏集

将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。

相似文章

通过平滑MMD对齐增强LLM中的数值预测

arXiv cs.CL

引入平滑最大均值差异(SMMD),一种损失函数,通过核匹配和基于图的平滑性将预测数值分布与目标对齐,提高了LLM在多个任务中的数值预测准确性。

使用分布对齐对抗性蒸馏估计黑盒LLM的不确定性

arXiv cs.CL

本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。

超越推理:强化学习释放大型语言模型中的参数化知识

arXiv cs.CL

本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。