Stable-Layers:使用VLM评分的强化学习微调图像层分解模型
摘要
Stable-Layers是一个强化学习框架,它利用VLM反馈而非配对监督来微调预训练的图层分解模型,采用Flow-GRPO与LoRA以及两阶段奖励校准流程,在Crello数据集上提升图层质量。
我们提出了Stable-Layers,这是一个强化学习框架,通过仅使用视觉语言模型(VLM)的反馈来微调预训练的图层分解模型,从而消除了对配对监督的需求。从Qwen-Image-Layered开始,我们应用了带有LoRA适配的Flow-GRPO,对每张图像采样多个候选分解,使用VLM对它们进行评分,并根据组相对优势优化策略。关键挑战在于设计可靠的奖励信号:VLM对孤立样本进行评分时,往往将判断压缩到一个狭窄的范围内,导致GRPO缺乏组内方差来学习。我们通过两阶段评估流程解决了这个问题:该流程将基于五个编辑中心准则的结构化逐样本评分与基于网格的校准步骤相结合,其中VLM对所有候选者进行并排重新评分。与基础模型相比,Stable-Layers在Crello数据集上生成的分解具有更强的图层分离、更少的空白或伪影严重的图层,以及更低的逐层重建误差。
相似文章
使用ART微调多模态大语言模型:基于艺术强化训练
ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。
RL^2-VLA:面向视觉-语言-动作模型的自适应强化学习潜在组合引导与测试时缩放
本文介绍了RL^2,一种用于视觉-语言-动作模型的自适应推理时引导框架,它利用潜在表示上的离线强化学习来组合动作流,并且仅在预测到失败时激活引导。在SIMPLER和PolaRiS基准上,它实现了最高+17.3%的成功率提升,并展示了真实世界的迁移能力。
LionVote:面向Lion的逐层学习率自适应
LionVote 为Lion优化器引入了一种逐层学习率自适应机制,利用梯度方向稳定性和动量健康诊断,并辅以投票系统。与标准Lion和AdamW相比,它在ViT-Tiny/CIFAR-100上实现了更高的准确率。
跳过一层还是循环它?学习LLM中的Program-of-Layers
本文介绍了一种名为Program-of-Layers(PoLar)的方法,它允许大语言模型根据每个输入动态地跳过或循环预训练层,从而在固定深度推理的基础上提高准确性和效率。
当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化
本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。