基于自批判掩码语言模型的广告标题生成

arXiv cs.CL 论文

摘要

提出了一种使用强化学习在掩码语言模型上生成电子商务广告标题的方法,性能优于基线模型和人工提交的标题。

arXiv:2607.06818v1 公告类型:新 摘要:对于任何电子商务网站来说,构建能够吸引购物者的持久广告都是一个重要问题。要满足网站的创意质量标准尤其困难,尤其是在大规模情况下。因此,我们提出了一种基于零售内容的程序化解决方案,用于生成产品广告标题。我们提出了一种最先进的强化学习策略梯度方法在基于Transformer的掩码语言模型上的应用。我们的方法通过联合条件化卖家希望广告的多个产品来生成广告标题。我们证明,在重叠指标和质量审计方面,我们的方法优于现有的Transformer和LSTM+RL方法。我们还表明,根据审计结果,我们的模型生成的标题在语法和创意质量方面均优于人工提交的标题。
查看原文
查看缓存全文

缓存时间: 2026/07/09 07:48

# 使用自我批判掩码语言模型生成广告标题
来源:https://arxiv.org/html/2607.06818  
Yashal Shakti Kanungo yashalk@amazon\.com & Sumit Negi suminegi@amazon\.com & Aruna Rajan rajarna@amazon\.com  

###### 摘要

对于任何电商网站来说,构建能够吸引购物者的持久广告都是一个不容小觑的问题。特别是大规模地通过创意质量审核这一关十分困难。因此,我们提出了一种程序化解决方案,利用零售内容生成产品广告标题。我们提出了一种最先进的强化学习(RL)策略梯度方法在基于Transformer(Vaswani等人,2017 (https://arxiv.org/html/2607.06818#bib.bib20))的掩码语言模型(Devlin等人,2019 (https://arxiv.org/html/2607.06818#bib.bib2))上的应用。我们的方法通过联合考虑卖家希望广告宣传的多个产品来生成广告标题。我们证明,在重叠度量与质量审核方面,我们的方法优于现有的Transformer和LSTM + RL方法。我们还表明,根据审核结果,我们模型生成的标题在语法和创意质量方面均优于人工提交的标题。

## 1 引言

广告有多种类型。图1(https://arxiv.org/html/2607.06818#S1.F1)展示了一组示例广告,其中包含卖家选择的产品以及宣传这些产品的标题。卖家为多种产品创建多个广告活动,通过竞价来投放广告,并为广告的点击付费。

参见说明文字

图1:来自互联网上多个网站的不同产品广告示例。这些广告中包含多种广告标题。  
电商产品目录中可能有数百万个可供广告宣传的产品。为了简化广告标题的撰写过程,人们会编程式地填充关键词,或者将零售目录内容重新粘贴到广告中。

诸如“立即省钱购买……”或“购买更多(品牌)的(产品)”之类的模板化创意虽然节省了创意工作,但未能激发购物者的兴趣或建立品牌认同感。高质量的标题对购物者更具吸引力,并能提供更好的价值主张。在本文中,我们描述了如何构建一个自然语言生成(NLG)系统,为旨在推广品牌下广泛产品的广告生成即时、有吸引力并能建立品牌认同感的标题。

与零售产品相关的内具有一些具有挑战性的特点。一些产品标题结构不佳、存在语法问题或包含不完整的短语。产品标题还包括数量不等的产品特性,例如“Hyper Tough 18V无绳电钻,3/8英寸夹头,变速,带1.2Ah镍镉电池、充电器、钻头支架LED灯”,以及像“ZIPIT Grillz背包,迷彩灰”这样的标题。

生成的标题需要捕捉零售属性中呈现的信息,同时又要与众不同且具有独特的吸引力。广告主会选择多个相关产品,作为单个广告活动的一部分进行宣传。然后,该广告活动的标题将在这所有相关产品之间共享。因此,标题还需要概括产品的共同特征,不能只针对广告活动中的单个产品。

我们工作的主要贡献是:

- • 我们使用掩码语言模型(MLM)同时基于多个产品来生成广告标题。广泛测试集度量、质量和语法审核表明,在质量和语法方面,我们提出的模型优于所有基线以及人工提交的标题。
- • 将强化学习用于训练MLM的新颖用法使我们能够直接优化MLM以获得更好的标题质量指标,而无需改变推理设置或延迟。我们的方法也可以应用于任何其他NLG任务,如摘要、翻译等。
- • 我们的模型减少了手动创建标题所需的大量精力和时间,并且具有低延迟。

## 2 相关工作

近年来,使用语言模型(LM)进行自然语言理解(NLU)取得了巨大飞跃。语言模型已从使用单词级别模型(Joulin等人,2016 (https://arxiv.org/html/2607.06818#bib.bib6))发展到Transformer(Vaswani等人,2017 (https://arxiv.org/html/2607.06818#bib.bib20))的各种扩展。BERT(Devlin等人,2019 (https://arxiv.org/html/2607.06818#bib.bib2))在预训练设置中采用了Transformer,并引入了MLM训练目标。

Ramachandran等人(2016 (https://arxiv.org/html/2607.06818#bib.bib14))首次通过使用seq2seq架构中的自回归预测展示了文本生成。基于Transformer的自回归方法,如GPT2(Radford等人,2019 (https://arxiv.org/html/2607.06818#bib.bib13))和BART(Lewis等人,2019 (https://arxiv.org/html/2607.06818#bib.bib9)),它们一次预测一个单词,也取得了良好效果。Zhu等人(2020 (https://arxiv.org/html/2607.06818#bib.bib25))将BERT表示与另一个LM的编码器和解码器层连接起来,以融入预训练LM。另一个模型(Dong等人,2019 (https://arxiv.org/html/2607.06818#bib.bib3))将基于BERT的Transformer编码器与Transformer解码器的注意力掩码相结合。Rothe等人(2019 (https://arxiv.org/html/2607.06818#bib.bib17))将预训练的BERT编码器与GPT解码器相结合用于NLG。

Ranzato等人(2016 (https://arxiv.org/html/2607.06818#bib.bib15))将NLG框架化为一个强化学习问题,并将生成质量作为奖励。自我批判序列训练(SCST)方法(Rennie等人,2017 (https://arxiv.org/html/2607.06818#bib.bib16))用模型自身的推理时间算法替换了其他方法(Bahdanau等人,2017 (https://arxiv.org/html/2607.06818#bib.bib1))中学习到的基线,以标准化奖励。

在广告方面,近期的研究(Xu等人,2019 (https://arxiv.org/html/2607.06818#bib.bib24);Hughes等人,2019 (https://arxiv.org/html/2607.06818#bib.bib5))将基于LSTM的指针网络(See等人,2017 (https://arxiv.org/html/2607.06818#bib.bib18))与RL方法相结合,以生成广告标题。虽然这些方法改进了结果,但它们未能利用基于Transformer模型的广泛预训练及其各种已得到充分证明的优势。

我们的方法通过使用自我批判策略梯度方法(Rennie等人,2017 (https://arxiv.org/html/2607.06818#bib.bib16))并同时联合考虑多个产品来条件化生成句子,从而扩展了基于BERT的生成(Dong等人,2019 (https://arxiv.org/html/2607.06818#bib.bib3))。这使我们能够使用预训练的基于BERT的语言模型,这些模型可以经过训练,以优化各种通常不可微的推理时间指标,如BLEU、ROUGE、可读性等。

## 3 自我批判掩码语言模型

### 3.1 掩码语言模型

BERT模型接收一个未标记的输入序列 \(x=(x_1,x_2,...,x_{|x|})\),并通过将某些位置 \(M_x\) 替换为特殊的掩码标记 [MASK] 来随机掩码这些位置,从而生成类似 \((x_1,\text{[MASK]},...,x_{|x|})\) 的序列。所有标记都被嵌入并添加到特殊的位置嵌入中。然后,它使用 \(N\) 个相同的Transformer层来生成上下文表示,每一层都通过接收前一层的输出来使用自注意力。为了计算自注意力,前一层的输出被投影到三元组向量中,分别称为查询、键和值(\(Q, K, V\)),维度为 \(d\)。注意力 \(A\) 则由下式给出:

\[
A = \text{softmax}\left(\frac{QK^T}{\sqrt{d}}\right)V \tag{1}
\]

在最后一个Transformer层之后,模型使用一个前馈层,然后通过词汇表上的softmax来预测被掩码的标记。序列 \(x\) 的MLM损失计算如下:

\[
\mathcal{L}_{MLM} = -\log \prod_{m \in M_x} p(x_m | (x_{m'} \in x \setminus M_x)) \tag{2}
\]

其中 \(x_{m'} \in x \setminus M_x\) 表示 \(x\) 中未被掩码的所有标记,而 \(m \in M_x\) 是所有被掩码的位置。

### 3.2 为提出的MLM对多个产品及通用标题进行编码

参见说明文字

图2:来自产品标题和标题的子标记被嵌入,并与其他编码位置和片段信息的嵌入相加。我们还选择性地添加一个表示产品类别的嵌入。在训练期间,使用Transformer层和交叉熵(公式2)损失来预测被掩码的标记,并使用自我批判(公式9)梯度来优化模型。在推理期间,我们使用束搜索以从左到右的自回归方式一次预测一个单词。  
在训练期间,对于给定的广告活动,我们的模型将其标题 \(x^h = (x^h_1, ..., x^h_{|x^h|})\) 以及一组一个或多个产品 \(P\) 作为输入。每个产品 \(p\) 由其标题 \(x^p = (x^p_1, ..., x^p_{|x^p|})\) 表示。标题和广告标题被分词为子词标记。

为了使用仅接受单个产品的模型进行编码,我们简单地将 ‘\[EOS\]∈V’ 附加到标题和广告标题的末尾,并将它们的标记连接起来。整个连接序列前面加上 ‘\[SOS\]∈V’。

我们通过使用特殊标记 ‘\[P\_SEP\]∈V’ 连接不同产品的标记来对多个产品进行编码。在多产品微调期间,我们将预训练期间未使用的标记 ‘\[UNUSED\_0\]∈V’ 替换为此特殊标记。这使得不同标题之间以及源子序列和目标子序列之间得以区分。它还为其他任务生成了每个产品的单独嵌入。

只有标题 \(x^h\) 中的标记被随机掩码为标记 ‘\[MASK\]∈V’。我们在5.1节中讨论了额外掩码源标记的模型的结果。

对于广告中所有产品都有两个标记且标题有四个标记的示例,完整过程如图2所示。

我们还尝试添加基于类别的嵌入。每个产品的类别标签,例如“手机及配件”,被分词为子词单元,使用与标题标记相同的嵌入矩阵进行编码,进行平均,然后添加到标题标记嵌入中。

### 3.3 使用自我批判掩码语言模型进行生成

在第3.1节中讨论的具有多方向注意力的BERT MLM框架不能直接用于自回归生成。这是因为在训练期间,被掩码的标题词语可能会依赖于未来词语,而这些词语在自回归推理期间是不可用的。对于MLM自回归生成,我们采用掩码注意力(Dong等人,2019 (https://arxiv.org/html/2607.06818#bib.bib3)),将公式1中的注意力修改如下:

\[
A_{\textit{masked}} = \text{softmax}\left(\frac{QK^T}{\sqrt{d}} + \Phi_{ij}\right)V \tag{3}
\]

其中 \(\Phi_{ij}\) 表示位置 \(i\) 和 \(j\) 之间的注意力掩码。如果允许注意力,则元素设置为0;如果不允许,则设置为 \(-\infty\)。图3展示了使用多个输入产品进行标题生成的注意力掩码。

参见说明文字

图3:掩码注意力部分限制了一些标记对的注意力。它防止注意力指向在推理期间生成每一步时无法访问的标题标记。  
BERT MLM在训练期间使用被掩码词语的对数似然(公式2)来优化模型参数。该似然是使用训练期间的其他真实词语和推理期间的其他预测词语进行预测的。这导致了暴露偏差(Ranzato等人,2016 (https://arxiv.org/html/2607.06818#bib.bib15);Rennie等人,2017 (https://arxiv.org/html/2607.06818#bib.bib16)),并在推理期间累积误差。此外,训练是针对对数似然优化的,而我们实际关心的是其他更复杂的标题质量度量,如重叠指标BLEU(Papineni等人,2002 (https://arxiv.org/html/2607.06818#bib.bib11))和ROUGE(Lin,2004 (https://arxiv.org/html/2607.06818#bib.bib10))。

为了克服这些问题并提高生成标题的质量,我们将MLM框架化为一个强化学习问题。该模型是一个“智能体”,它执行“预测被掩码词语”的“动作”,并更新“状态”,例如自注意力权重。MLM遵循由模型参数 \(\theta\) 定义的策略 \(\pi_\theta\)。它接收一个与生成标题质量成比例的奖励。这个质量可能是与已由内部主题专家批准的参考标题的重叠程度,或由另一个模型预测得到。我们的目标是在训练期间最大化与生成的标题 \(\hat{x}^h\) 相对应的奖励,其中某些被掩码位置 \(M_{x^h}\) 的标记是从模型中采样的。

因此,我们最小化由任何标题质量奖励函数 \(r(\cdot)\) 定义的负期望奖励 \(r(\hat{x}^h)\):

\[
\mathcal{L}_{RL} = -\mathbb{E}_{\hat{x}^h \sim \pi_\theta} [r(\hat{x}^h)] \tag{4}
\]

我们可以使用REINFORCE算法(Williams,1992 (https://arxiv.org/html/2607.06818#bib.bib21))计算梯度 \(\nabla_\theta \mathcal{L}_{RL}\)。它定义为:

\[
\nabla_\theta \mathcal{L}_{RL} = -\mathbb{E}_{\hat{x}^h \sim \pi_\theta} [r(\hat{x}^h) \nabla_\theta P] \tag{5}
\]

其中,

\[
P = \sum_{m \in M_{\hat{x}^h}} \log p_\theta(\hat{x}^h_m | (\hat{x}^h_{m'} \in \hat{x}^h \setminus M_{\hat{x}^h}) \tag{6}
\]

使得 \(M_{\hat{x}^h}\) 是被掩码的位置,而 \(\hat{x}^h \setminus M_{\hat{x}^h}\) 是所有未被掩码的标记。

为了在保持期望梯度不变的情况下减少方差,该算法提出使用一个不依赖于生成标题 \(\hat{x}^h\) 的基线 \(b\)。\(b\) 用于与公式6中的 \(P\) 一起标准化奖励:

\[
\nabla_\theta \mathcal{L}_{RL} = -\mathbb{E}_{r(\hat{x}^h) \sim \pi_\theta} [(r(\hat{x}^h) - b) \nabla_\theta P] \tag{7}
\]

可以为每组产品和标题使用单个蒙特卡洛样本来近似梯度。使用公式6中 \(P\) 的定义,我们得到近似梯度:

\[
\nabla_\theta \mathcal{L}_{RL} \approx -(r(\hat{x}^h) - b) \nabla_\theta P \tag{8}
\]

我们没有像其他方法那样使用其他模型来估计期望基线奖励(Ranzato等人,2016 (https://arxiv.org/html/2607.06818#bib.bib15);Bahdanau等人,2017 (https:

相似文章

BalCapRL:一种用于基于强化学习的 MLLM 图像描述生成的平衡框架

Hugging Face Daily Papers

本文介绍了 BalCapRL,这是一种针对多模态大语言模型(MLLM)的平衡强化学习框架,旨在联合优化图像描述生成中的准确性、覆盖率和语言质量。通过奖励解耦和长度条件屏蔽来解决实用性与流畅性之间的权衡,该方法在性能上优于现有方法。