PILA:面向LLM原生广告的即插即用式插入
摘要
PILA将LLM原生广告重新定义为条件响应重写问题,通过一个轻量级、模型无关的侧车模块,将广告插入与上游生成解耦,从而在保持响应质量的同时实现可控的广告曝光。
arXiv:2607.25590v1 公告类型:新
摘要:如何通过将赞助内容自然地整合到大语言模型(LLM)的回复中来实现盈利,即所谓的LLM原生广告,近期已成为一个关键问题。然而,现有解决方案将广告与内容生成纠缠在单一模型内部,这与现代仅API或基于工作流的LLM应用不兼容,且不可避免地损害了原始回复质量。为解决此问题,我们提出PILA,它将广告插入重新定义为条件回复重写问题,并作为轻量级侧车模块与上游服务解耦。PILA是模型无关的,可以无缝集成到现有LLM服务中,无需修改基础模型或其工作流。它还在用户侧自然性与广告侧曝光之间提供了可控的权衡,为下游定价和部署提供了实用接口。在多种上游模型上的实验表明,\\pila 在保持回复质量的同时持续提升了广告效果,凸显其作为LLM原生广告实用解决方案的前景。
查看缓存全文
缓存时间: 2026/07/29 09:55
# PILA: 面向LLM原生广告的即插即用插入方法
来源:https://arxiv.org/html/2607.25590
Zhaowei Zhang¹\*,Yuhan Fu²\*,Yihang Zhang²,Xiaohan Liu³,Ceyao Zhang¹,Xiaoyuan Zhang¹,Yipeng Kang⁴†,Tonghan Wang²⁵†,Yaodong Yang¹
###### 摘要
通过将赞助内容自然整合到大型语言模型(LLM)的回复中来实现变现(即LLM原生广告),近期已成为一个关键问题。然而,现有解决方案将广告与内容生成纠缠在单个模型内部,这与当前仅通过API或基于工作流的智能体LLM应用不兼容,且不可避免地损害了原始回复质量。为解决此问题,我们提出PILA,它将广告插入重新表述为一个条件性响应重写问题,并将其从上游服务解耦为一个轻量级的边车模块。PILA是模型无关的,可以在不修改基础模型或工作流的情况下无缝集成到现有LLM服务中。它还提供用户侧自然性与广告侧曝光之间的可控权衡,为下游定价和部署提供了实用接口。在多种上游模型上的实验表明,PILA在保持回复质量的同时持续提升广告效果,突显了其作为LLM原生广告实用解决方案的潜力。
## 引言
大型语言模型(LLM)的快速发展使其成为各种应用中用户流量的关键入口,包括生成式搜索(Aggarwal等,2024)、内容生成(Achiam等,2023),以及日益广泛部署的LLM智能体系统(Anthropic,2025a;OpenAI,2025;OpenClaw,2026)。这种转变催生了新的变现策略,其中最引人注目的是新兴的LLM原生广告范式(Zhao等,2025;Zhang等,2026;Yun等,2026),其中广告被整合到模型生成的回复中。由于其用户体验影响存在持续争议(Spivack,2026;NDTV新闻编辑部,2025),设计能够保持回复质量的原生广告插入机制已成为LLM应用生态系统中的重要研究问题,包括OpenAI(OpenAI,2026a)等领先AI公司。
现有的LLM原生广告方法主要通过微调模型参数(Zhao等,2025)或利用内部模型机制(Duetting等,2024;Yun等,2026)来干预生成过程本身,从而联合生成回复和广告。这种耦合范式面临若干实际限制。(1)前沿LLM通常是闭源的且仅通过API访问,其参数和内部状态对下游开发者不可用。(2)现实应用越来越多地由智能体工作流(Zhuge等,2024;Zhang等,2025a)或编排系统(Anthropic,2026a;Lopopolo,2026)构建,广告必须在异构组件之间运行,而非在单个模型内部。(3)要求同一个模型同时优化回复质量和广告可能会干扰服务于用户的主要目标。这些限制指向一个共同的架构瓶颈:现有方法将内容生成与广告生成紧密耦合。这促使我们提出一种解耦的表述,将广告插入形式化为一种外部的、模型无关的能力,可以在回复生成之后而非期间应用。

*图1:我们的PILA框架概览。给定用户查询以及广告名称和广告内容,现有基线要么依赖单个LLM配合提示、采样或微调策略,要么遵循预定义工作流,这些方法往往产生较差案例且失去灵活性。相比之下,PILA作为一个轻量级的即插即用模块,能够适配多种上游模型以生成高质量、自然整合的回复,实现广告内容无缝融入面向用户的回复的更优案例。案例中的蓝色和红色高亮表示PILA在用户侧和广告侧都提升了质量。*
基于这一原则,我们提出面向LLM原生广告的即插即用插入(PILA),这是一个简单但高效的框架,能够一次性解决上述挑战。受云原生架构中的边车模式(Burns和Oppenheimer,2016)启发,PILA保持上游系统(LLM模型或智能体工作流)不变,并将广告委托给一个轻量级的外部模型。如图1所示,PILA仅以自然语言作为通信接口,可以无缝附加到各种上游系统,仅在最终回复阶段进行干预,决定何时、何地以及如何插入广告,同时保持原始系统的生成能力。通过这种方式,我们将广告插入形式化为一个条件性响应重写问题。
为实例化PILA,我们在NaiAD基础设施(Zhang等,2026)之上通过质量受控的合成、自我评判和多样性增强构建了一个25k高质量语料库;微调Qwen骨干作为重写器;并引入一个基于说服知识模型(PKM)的强度控制器,曝光一个广告强度因子ρ以平衡用户侧满意度和广告侧曝光。我们在多种设置下进行了广泛实验,包括对多种商业模型的即插即用增强、可控广告强度调整,以及与单LLM基线的比较。结果表明,PILA在用户侧质量和广告侧效用方面均取得了最佳性能,平均分别优于基于提示、采样和微调的基线34.2%、47.3%和7.7%。作为一个通用的即插即用模块,PILA-4B和PILA-8B进一步将七个前沿商业上游模型分别提升17.2%和18.4%,使其走向更有利的用户侧和广告侧权衡区域。此外,广告强度控制器提供了一个可控的部署时接口,用于灵活导航这一权衡。
总结而言,我们的贡献有三方面:
首先,我们将LLM原生广告插入形式化为条件性响应重写,并提出PILA,一个即插即用、模型无关的边车框架,可在各种上游LLM和智能体工作流上运行。
其次,我们提供了构建PILA的实用方案,包括一个25k样本的数据流程和一个基于PKM的对比解码控制器,用于可调节的广告强度。
第三,大量实验表明,PILA在保持用户侧满意度的同时持续提升广告侧效果,证明了其在现实部署中的实用性。
## 相关工作
在本节中,我们提供相关工作背景。首先介绍LLM原生广告的概念,然后回顾LLM拍卖的现有工作。
##### LLM原生广告。
随着LLM日益成为面向用户的信息门户,LLM的广告正从销售预定义广告位转向将赞助内容自然整合到生成回复中,这被称为*LLM原生广告*(Zhao等,2025;Zhang等,2026)。现有研究探索了不同方式将广告自然融入LLM回复。Xu等(2026)提出一种“硬广告插入”方法,直接在回复的固定位置插入广告。Hajiaghayi等(2024);Liu等(2026)使用提示工程指导LLM根据给定要求插入广告。Soumalias等(2025)提出一种基于采样的解码策略,搜索更优化广告收入的回复。然而,这些工作距离实用仍然很远。最近,Zhao等(2025)提出一个基于学习的生成式拍卖框架,联合建模广告分配、定价和原生回复生成。尽管如此,其端到端的基于学习解决方案通常假设平台可以修改或微调底层模型,而许多应用通过API访问LLM,并且已经依赖精心设计的流程来保证回复质量。相比之下,PILA旨在提供一个即插即用的广告插入框架,可以附加到现有LLM智能体系统,无需修改基础模型或破坏原始编排。
##### LLM的拍卖机制。
与为预定义位置或展示次数分配的传统在线广告拍卖不同,LLM原生广告的价值可能取决于措辞、顺序和上下文整合。因此,这一研究方向致力于设计能够合理定价LLM生成内容的机制。Duetting等(2024)提出一个令牌级拍卖框架,其中出价可以影响LLM的顺序生成过程。Dubey等(2024)研究LLM生成摘要的拍卖,广告主竞标其内容被包含在生成的摘要中。Mordo等(2024);Balseiro等(2026)将位置拍卖扩展到AI生成内容,其中广告效果取决于创意及其上下文位置。其他研究考虑了预算约束(Chen等,2024)或在LLM微调和推理中的偏好聚合(Zhang等,2025c;Sun等,2026)。然而,这些工作主要关注理论分析,无法实际应用于LLM原生广告生成。

*图2:PILA框架的数据构建过程。从涵盖多种广告类别的NaiAD数据开始,Claude Opus 4.5为每个查询-广告元组生成初始配对回复(有广告和无广告)。然后质量评判器执行自我评判和基于分数的过滤,保留10k合格种子集。每个种子进一步通过多样化数据增强扩展,Claude Haiku 4.5生成三个重述变体,通过同时应用多样性和质量过滤的多样性评判器,最终得到15k增强训练样本。我们将种子数据和增强数据合并,总计得到25k高质量数据样本。*
## 方法
在本节中,我们正式介绍PILA框架,随后介绍数据构建过程和广告强度控制。
### PILA:解耦的广告插入
如图1所示,我们将LLM原生广告插入视为一个*条件性响应重写*问题,而非端到端的响应生成。请求由一个元组 \((x, a, c)\) 指定,其中 \(x \in \mathcal{X}\) 是用户查询,\(a\) 和 \(c\) 分别表示广告主名称和广告内容。一个冻结的上游系统 \(\mathcal{M}_{\mathrm{up}}: \mathcal{X} \rightarrow \mathcal{Y}\) 首先生成一个无广告的回复:
\[
y = \mathcal{M}_{\mathrm{up}}(x).
\]
(1)
这里 \(\mathcal{M}_{\mathrm{up}}\) 可以是单个LLM或任意工作流,例如检索增强生成(RAG)(Lewis等,2020;Arslan等,2024)、工具使用(Yao等,2022;Schick等,2023)或多智能体编排系统(Talebirad和Nadiri,2023)。重要的是,PILA只访问最终回复 \(y\),而不访问模型参数、中间状态或改变原始流程。
我们将PILA实例化一个边车重写器 \(\pi_\theta\),它以 \((x, y, a, c)\) 作为输入,并输出一个增强广告的回复:
\[
\tilde{y} \sim \pi_\theta(\cdot \mid x, y, a, c),
\]
(2)
其中插入的赞助跨度由 `<ad>` 和 `</ad>` 标签包围,以便显式跟踪。这种表述将答案生成与广告插入分离:上游系统负责解决用户的任务,而PILA在完成的答案之上执行定向重写。这种解耦正是PILA即插即用且可直接应用于仅API或基于工作流的LLM系统的原因。
### 数据构建
我们的数据构建过程如图2所示。我们从公共指令式语料库中收集的用户查询以及从包含1,936个广告的策划品牌目录中提取的广告开始。使用NaiAD基础设施,我们将这些来源转换为统一格式,并构建形式为 \((x, y, a, c, \tilde{y})\) 的监督训练实例。
我们首先使用Claude Opus 4.5(Anthropic,2025c)构建一个合成种子数据集。合成过程分多轮进行,直到达到目标规模。在每一轮中,我们对用户查询进行采样,一旦某个查询产生了一个被接受的示例,它将被从后续轮次中排除,以便后续轮次能够覆盖其他意图。对于每个采样的查询,我们使用句子嵌入结合多样性惩罚 \(\lambda = 0.15\) 检索前四个语义匹配的广告。然后我们将查询与每个检索到的广告配对,并要求模型同时生成无广告回复 \(y\) 和增强广告的回复 \(\tilde{y}\),其中赞助跨度显式标记为 `<ad>...</ad>`。为了鼓励插入风格的变化,每个候选在四种预定义整合策略之一下生成。遵循NaiAD协议,模型对回复进行评分,我们只保留高质量候选。这一阶段从24,883次尝试中产生了10,014个被接受的种子示例,每个示例要求总分下降不超过2分才能通过。
为了获得更大且更多样化的数据集,我们进一步通过使用Claude Haiku 4.5(Anthropic,2025b)的多样性增强来扩展种子集。对于每个种子示例,我们在包含 `<ad>` 跨度的局部话语窗口内生成三个释义,同时保留边界标签。相似文章
LLM-OSDA:多轮LLM对话中原生广告的最优停止动态拍卖
本文提出了LLM-OSDA,一种用于多轮LLM对话中原生广告的动态点击付费拍卖机制,融合了贝尔曼最优停止、获胜者分配和包络定价。实验表明,与固定时机基线相比,净收入提高了11%,同时保持了用户留存率。
基于模型压缩与并行验证的高效大语言模型广告生成
本文提出了一种利用模型压缩和并行验证的高效大语言模型广告框架,在百度的实际部署中实现了超过 1.8 倍的加速。
预填充 vs. 解码与本地大语言模型的投资回报率:预填充被低估了吗?
一项分析对比了大语言模型推理中的预填充与解码阶段,探讨在本地大语言模型部署中,预填充在投资回报率方面是否未被充分重视。
不要让LLM说话,直接探测它(8分钟阅读)
本文介绍了一种技术,该技术从LLM的最后一个提示标记处提取隐藏状态,无需文本生成即可进行分类,使用一个小型MLP读取模型的内部决策,从而实现快速且廉价的零样本分类器。
利用移动NPU的高效端侧扩散大语言模型推理
本文提出了llada.cpp,一种NPU感知推理框架,用于在智能手机上加速扩散大语言模型(dLLM)。它引入了三种技术——Multi-Block Speculative Decoding、Dual-Path Progressive Revision和Swap-Optimized Memory Runtime——以使dLLM推理与移动NPU特性对齐,实现了相比CPU基线17-42倍的延迟降低。