通过强化学习将分布感知注入多模态大语言模型以应对深度不平衡回归
摘要
本文介绍了一种分布感知的强化学习框架,该框架利用基于批级比较的监督信号,提升了多模态大语言模型在长尾数值回归任务中的性能。
查看缓存全文
缓存时间: 2026/05/12 07:28
论文页面 - 通过强化学习向 MLLMs 注入分布感知以进行深度不平衡回归
来源:https://huggingface.co/papers/2605.01402 发布于 5 月 11 日
·
提交者:https://huggingface.co/ChanganYao
DUYao (https://huggingface.co/ChanganYao) 于 5 月 12 日
摘要
一种分布感知的强化学习框架通过基于批级的比较监督,提升了多模态大语言模型在长尾分布上的数值回归性能。
多模态大语言模型 (https://huggingface.co/papers?q=Multimodal%20large%20language%20models)(MLLMs)在长尾目标分布下的数值回归 (https://huggingface.co/papers?q=numerical%20regression) 方面存在困难。基于 Token 级的监督微调 (https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和逐点回归奖励 (https://huggingface.co/papers?q=point-wise%20regression%20rewards) 会使学习偏向高密度区域,导致回归均值行为及尾部性能不佳。我们认为,现有 MLLM 训练范式中缺乏跨样本的关系监督是一个关键限制。为解决这一问题,我们提出了一种基于组相对策略优化 (https://huggingface.co/papers?q=Group%20Relative%20Policy%20Optimization) 的分布感知强化学习 (https://huggingface.co/papers?q=reinforcement%20learning) 框架。该框架通过基于一致性相关系数 (https://huggingface.co/papers?q=Concordance%20Correlation%20Coefficient) 的奖励引入基于批级的比较 (https://huggingface.co/papers?q=batch-level%20comparison) 监督,从而在相关性、尺度和均值方面对齐预测分布与真实分布。该框架即插即用,无需修改架构。在统一的长尾回归基准测试套件上的实验表明,该方法在 SFT 和现有 MLLM 回归方法上均取得了持续改进,特别是在中度和少样本场景下表现尤为强劲。
查看 arXiv 页面 (https://arxiv.org/abs/2605.01402) 查看 PDF (https://arxiv.org/pdf/2605.01402) 添加到收藏集 (https://huggingface.co/login?next=%2Fpapers%2F2605.01402)
在您的代理中获取此论文:
hf papers read 2605.01402
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型 0
没有链接到此论文的模型
在模型的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。
引用此论文的数据集 0
没有链接到此论文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。
引用此论文的 Spaces 0
没有链接到此论文的 Space
在 Space 的 README.md 中引用 arxiv.org/abs/2605.01402 以从此页面链接它。
包含此论文的收藏集 0
没有包含此论文的收藏集
将此论文添加至收藏集 (https://huggingface.co/new-collection) 以从此页面链接它。
相似文章
通过平滑MMD对齐增强LLM中的数值预测
引入平滑最大均值差异(SMMD),一种损失函数,通过核匹配和基于图的平滑性将预测数值分布与目标对齐,提高了LLM在多个任务中的数值预测准确性。
使用分布对齐对抗性蒸馏估计黑盒LLM的不确定性
本文提出了一种分布对齐对抗性蒸馏(DisAAD)方法,该方法使用一个轻量级代理模型,仅以原始模型1%的规模来估计黑盒大语言模型的不确定性,实现了无需内部参数或多次采样的可靠量化。
超越推理:强化学习释放大型语言模型中的参数化知识
本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。
基于丰富反馈的分布式DAgger强化学习
介绍DistIL,一种从丰富反馈中进行强化学习的方法,保证策略单调改进,在科学推理、编程和数学推理上优于现有方法。
ResRL:通过负样本投影残差强化学习提升大语言模型的推理能力
本文介绍了 ResRL,一种通过负样本投影解耦正负回复之间语义分布,从而提升大语言模型(LLM)推理能力的方法。该方法旨在改善各项基准测试性能的同时,保持生成的多样性。