无需训练的多概念LoRA组合:基于提示感知权重

Hugging Face Daily Papers 论文

摘要

本文提出了 W-Switch 和 W-Composite 两种无需训练的方法,用于在文本到图像生成中组合多个 LoRA 模块,通过基于提示感知的重要性加权来减少概念干扰。该方法在 ComposLoRA 测试平台上进行评估,在视觉质量和身份保持方面均持续优于现有最先进方法。

低秩适配(LoRA)通过将预训练扩散模型适配到特定视觉概念和风格,成功实现了文本到图像生成中的个性化。然而,将此类模型扩展到多概念定制仍然具有挑战性。简单地将多个 LoRA 权重或其输出进行组合,往往会导致概念之间的干扰,从而降低视觉质量并减少单个概念参考图像的保真度。本文提出了一种简单而有效的多概念定制方法,通过最优组合多个 LoRA 模块的输出。我们利用了生成过程中每个概念的相对重要性(从其对应的提示词中推断得出),并引入了两种方法:W-Switch 和 W-Composite。这两种方法采用了一种基于提示感知的重要性加权策略,其中每个 LoRA 根据其触发词在目标提示中的语义影响进行加权。此外,我们扩展了现有的量化评估指标,提出了一种新的基于图像的相似性评估框架,该框架通过比较真实参考图像和生成图像中自动分割的概念区域,来评估图像保真度和身份保持。我们在 ComposLoRA 测试平台上评估了我们的方法,并证明了在视觉质量、身份保持和组合性方面,该方法持续优于现有的最先进方法。定性评估,包括基于大语言模型(LLM)的评估和用户研究,进一步验证了所提方法的有效性,并与新引入的基于图像的量化指标相一致。我们的代码可在 https://github.com/GeorgeTsoumplekas/Prompt-Aware-Multi-LoRA-Composition 获取。
查看原文

相似文章

Video2LoRA: 视觉-语言模型的参数化视频内化

Hugging Face Daily Papers

本文介绍Video2LoRA,一种直接从视频表示预测低秩适配(LoRA)权重的方法,能够在冻结的视觉-语言模型中实现高效的视频处理。它将视觉令牌负载降低最多1500倍,查询TTFT降低6-80倍,同时在视频摘要和字幕生成基准上保持性能。

Hybrid-LoRA:桥接全微调与低秩适应的后训练方法

arXiv cs.LG

Hybrid-LoRA提出了一种框架,选择性地对一小部分模块进行全微调,同时对其他模块使用LoRA,在显著降低计算成本的同时实现了接近全微调的性能。实验表明,与现有参数高效基线方法相比,性能提升高达5.65%。

使用ART微调多模态大语言模型:基于艺术强化训练

Hugging Face Daily Papers

ART(基于艺术强化训练)通过梯度反向传播优化原始视觉输入,实现对冻结的多模态大语言模型的参数高效微调,其性能与LoRA相当,同时支持为vLLM等高吞吐引擎预编译的计算图。