Stable-Layers:使用VLM评分的强化学习微调图像层分解模型

Hugging Face Daily Papers 论文

摘要

Stable-Layers是一个强化学习框架,它利用VLM反馈而非配对监督来微调预训练的图层分解模型,采用Flow-GRPO与LoRA以及两阶段奖励校准流程,在Crello数据集上提升图层质量。

我们提出了Stable-Layers,这是一个强化学习框架,通过仅使用视觉语言模型(VLM)的反馈来微调预训练的图层分解模型,从而消除了对配对监督的需求。从Qwen-Image-Layered开始,我们应用了带有LoRA适配的Flow-GRPO,对每张图像采样多个候选分解,使用VLM对它们进行评分,并根据组相对优势优化策略。关键挑战在于设计可靠的奖励信号:VLM对孤立样本进行评分时,往往将判断压缩到一个狭窄的范围内,导致GRPO缺乏组内方差来学习。我们通过两阶段评估流程解决了这个问题:该流程将基于五个编辑中心准则的结构化逐样本评分与基于网格的校准步骤相结合,其中VLM对所有候选者进行并排重新评分。与基础模型相比,Stable-Layers在Crello数据集上生成的分解具有更强的图层分离、更少的空白或伪影严重的图层,以及更低的逐层重建误差。
查看原文

相似文章

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。

LionVote:面向Lion的逐层学习率自适应

arXiv cs.LG

LionVote 为Lion优化器引入了一种逐层学习率自适应机制,利用梯度方向稳定性和动量健康诊断,并辅以投票系统。与标准Lion和AdamW相比,它在ViT-Tiny/CIFAR-100上实现了更高的准确率。

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。