大型推荐解释中LLM-as-a-Judge的生命周期

arXiv cs.AI 论文

摘要

本文提出了一个在Netflix使用大语言模型作为评判者来评估推荐解释的生命周期框架,涵盖从开发到部署和监控的各个阶段,并通过A/B测试取得了积极结果,显示用户参与度得到提升。

arXiv:2608.18300v1 公告类型:新 摘要:LLM-as-a-Judge,即利用大语言模型来评估由其他AI应用或模型生成的自然语言,已成为加速和扩展昂贵的人工评估的标准、可扩展方法。然而,大多数工作将评判者视为静态产物,仅在构建时或针对固定基准进行一次评估。相比之下,我们认为在生产系统中运行的LLM评判者更应被理解为具有生命周期:它必须在周围数据演进的过程中被构建、训练、部署和持续维护,每个阶段都带来独特的技术和运营挑战。 我们为Netflix评估面向用户的推荐解释的LLM评判者提出了这样一个生命周期,我们的流水线每周生成并由评判者评估数十万个独立的剧集级解释,并通过移动体验为数百万会员提供服务。我们的框架包含四个阶段:(一)诞生,定义多个评估标准,并构建带有标签和推理依据的人工标注基准数据集;(二)训练,通过推理对齐评分标准调优来优化评判者的评分标准,这是一种使用元评判者对推理输出的评估作为学习信号的评分标准调优过程;(三)部署,其中一个评判者同时服务于两个生产角色:质量把关和反思性生成;以及(四)监控,一个持续的人在环中对齐流程,用于检测漂移并在人工审核关卡后触发重新调优。我们报告了一项在数千万会员中进行的为期五周的A/B测试的上线后结果,其中经评判者对齐的解释将会员的观看行为引向了新颖内容(之前未观看的内容),并在无解释对照组的基础上增加了从浏览到播放的成功会话,且未发生与质量相关的下架事件。
查看原文
查看缓存全文

缓存时间: 2026/08/20 10:06

# 基于大语言模型的评判系统在大规模推荐解释中的生命周期  
来源:https://arxiv.org/html/2608.18300

## 大语言模型评判系统在推荐解释中的生命周期  
**CCS分类:** 计算方法 自然语言生成;**CCS分类:** 信息系统 推荐系统  

JJ Tan  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

Ishan Gupta  
注:工作于Netflix期间完成  
机构:邮箱:[[email protected]](mailto:[email protected])  

Lars Olds  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

Claire Campbell  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

David Fagnan  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

Veli Balin  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

Rohan Gosain  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

Louis Garcia  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

以及  
Minsu Jang  
机构:美国加利福尼亚州洛斯加托斯 Netflix  
邮箱:[[email protected]](mailto:[email protected])  

###### 摘要  
大语言模型评判系统利用大语言模型评估由其他AI应用或模型生成的自然语言,已成为加速和扩展昂贵人工评估的标准可扩展方法。然而,大多数研究将评判器视为静态产物,仅在构建时或针对固定基准进行评估。相反,我们认为运行在生产系统中的大语言模型评判器更应被理解为具有*生命周期*:随着周围数据的演变,它必须被构建、训练、部署并持续维护,每个阶段都带来独特的技术和运营挑战。我们介绍了Netflix评估面向用户的推荐解释的大语言模型评判器的生命周期,我们的流水线每周生成并评估数十万条独特的节目级解释,通过移动体验服务于数百万会员。我们的框架包含四个阶段:(I)诞生:定义多个评估标准,并建立包含人工标注和推理的精选基准数据集;(II)训练:通过*推理对齐的评分标准调整*精炼评判器的评分标准——这是一种使用基于推理输出的元评判器作为学习信号的评分标准调整程序;(III)部署,其中一个评判器承担两个生产角色:质量把关和反思性生成;(IV)监控,一个持续的人机协同对齐过程,用于检测漂移并触发人工审核关卡后的重新调整。我们报告了针对数千万会员进行的为期五周的A/B测试的*发布后*结果,其中与评判器对齐的解释将会员观看行为转向新颖内容(之前未观看过),与无解释的对照组相比增加了成功的浏览至播放会话,且没有因质量问题而被下架。  

###### 关键词:大语言模型评判系统,推荐解释,生产机器学习,人机协同评估,评分标准调整  

## 1. 引言  
推荐解释是伴随推荐项目的简短自然语言消息,影响用户如何感知和信任推荐系统。在Netflix,解释是面向会员的可读证据,基于会员之前的观看历史说明*为什么*推荐某个标题。我们关注*基于相似性*的解释,这些解释通过共享属性(如类型和风格)将推荐标题与会员互动过的一个参考标题联系起来,例如:“一部关于爱情与新开始的幽默、真挚的假日浪漫故事,非常像《我的秘密圣诞老人》”。这些解释旨在推动*内容发现*并建立会员的*信任*,这也是质量至关重要的原因。误导性或依据不足的解释会侵蚀该功能本应建立的信任。  

大规模评估质量非常困难。我们的流水线每周产生成千上万条独特的、针对特定项目的解释,可能呈现给数百万会员。解释必须准确、针对特定项目,且不含敏感或冒犯性内容。然而,作为金标准的人工评估无法覆盖如此庞大的数量。大语言模型评判系统提供了可扩展的替代方案,但评判器并非一次性的产物。它必须基于可信赖的人工标注进行初始化,调整以与人类判断对齐,部署到生产流量中进行操作,并随着上游数据的漂移而持续维护。据我们所知,此前没有研究将这四个阶段描述为一个单一的、可监控的生命周期。因此,我们不将评判器视为固定的评估器,而是视为一个*终身代理*:一个必须持续从积累的人类反馈中*学习*、保持与人类判断的*对齐*(出于正确的原因而非偶然),并通过持续的对齐审计和自动化再调整随着目录、推荐算法和用户群体的变化而*演进*的持久组件。  

在本文中,我们介绍了Netflix面向用户的推荐解释的大语言模型评判器的案例研究,将其构建为一个包含四个阶段的生命周期(图1):(I)诞生(§4),(II)训练(§5),(III)部署(§6),以及(IV)监控(§7)。我们的贡献是:  
1. (1)大规模推荐系统中大语言模型评判器的生命周期视图,涵盖端到端的全部四个阶段。  
2. (2)推理对齐的评分标准调整:一种迭代更新评判器评分标准的方法,使用元评判器对评判器的推理进行评分,消融研究展示了推理对齐如何提升大语言模型评判器的整体性能。  
3. (3)在生产环境中运行评判器的操作设计:双角色部署(质量把关和自我反思修正循环中的批评者)与持续漂移监控相结合,标记评判器性能下降事件并在人工审核关卡后触发再调整。  
4. (4)通过大规模操作此生命周期,在生产中部署大语言模型评判器的行业实践要点。  

## 2. 相关工作  
#### 可解释推荐。解释*为什么*推荐某个项目是推荐系统中的长期关注点,从早期关于呈现协同过滤邻域的工作,到围绕透明度、信任、说服力和有效性等目标组织解释目的和评估的综述。我们的基于相似性解释属于该分类法中透明度和信任的分支,因为它们通过将推荐基于会员已经观看过的标题来证明其合理性。在我们的场景中不同之处不是解释风格,而是它所产生的评估问题。解释是自由形式的自然语言,由大语言模型在目录规模上编写,因此早期系统通过设计可以保证的模板级正确性不再成立,质量本身必须由模型来衡量。这正是本节其余部分要解决的差距。  

#### 大语言模型评判系统。使用大语言模型为另一个模型的输出打分,已成为开放式生成任务中替代昂贵人工评估的标准做法。大语言模型评判器也带有系统性偏差,包括对答案位置和冗长性的敏感性,以及对自己生成内容的偏好;这也是我们在其生命周期的每个阶段都将评判器锚定于人工标注和推理的原因之一。公共基准如JudgeBench和RewardBench评估评判器在通用正确性、安全性和指令遵循方面的表现,并作为新评判器报告的标准。这些基准必然是静态和领域通用的;它们很少说明评判器部署到动态变化的实时项目目录后如何表现,并且没有一个将评判器本身视为需要发布后重新验证的生命周期实体。我们的第一阶段基准正是为了解决这一差距而构建的。它是一个针对基于相似性推荐解释的领域特定、推理标注的数据集,根据生产流量持续更新,而非在构建时固定不变。  

#### 自我完善与反思。在不通过梯度更新的情况下,使用模型自身的批评来改进其输出,这已经在生成器(Self-Refine、Reflexion)和更贴近我们场景的评判器本身方面得到了探索。Meta-Rewarding增加了一个元评判器来对评判器自身的推理进行评分,以提高奖励模型的质量。我们的推理元评判器直接建立在这一想法之上,但在生产部署中有两点重要差异。首先,它基于人工推理而非无监督的自一致性。其次,它有意专注于失败案例。原因是在第三阶段,同一评判器的拒绝理由会作为修订指令反馈给生成器,因此正确的判决但错误的理由情况会将误导性信号传播到下游。在离线奖励建模设置中则不会。  

#### 提示与评分标准优化。基于文本的梯度类优化通过反馈修改提示或评分标准,而非通过权重反向传播。它们包括进化提示搜索(EvoPrompt、Promptbreeder)、文本梯度(TextGrad、ACE)、候选帕累托池上的反思进化(GEPA,基于DSPy构建),以及直接从选择/拒绝对合成评分标准。RART是这一系列方法的一个实例,专门用于评分标准调整。它在精神上最接近GEPA,但它是贪婪的、单目标的特例,而非帕累托池搜索(§9)。它的文本梯度也是基于*推理*不匹配计算的,这有助于它瞄准推理质量而不仅仅是标签准确性。  

这些先前工作均未在部署后持续评估评判器,或将再调整与监控的漂移信号关联;每个都以训练时的对齐作为最终状态。我们的贡献与这些方法正交且兼容。我们展示了当评判器作为闭环生产系统中的一个节点被嵌入时会发生什么变化,而不是仅针对固定基准进行一次性评分。  

(图1说明:一个四阶段循环图。第一阶段从专家设计的示例、LLM合成的边界示例和抽样的生产解释中构建人工标注的基准数据集。第二阶段使用反思LLM和推理元评判器调整每个标准的评分标准。第三阶段将调整后的评判器作为护栏部署在生成-评判-修正循环中,该循环决定是提供还是丢弃每个解释。第四阶段每周抽样已提供和被把关的解释进行人工审核,比较评判器和人工标签,当漂移超过阈值时重新触发第二阶段。)  

图1. 推荐解释的大语言模型评判器的四阶段生命周期。(I)诞生(§4):构建包含人工标注、推理标注示例的基准,分为训练/验证/测试集。(II)训练(§5):一个反思LLM根据评判器-人工标签和*推理*不匹配调整每个标准的评分标准,直到验证指标通过。(III)部署(§6):评判器把关生产解释并驱动有界重试的自我反思修正。(IV)监控(§7):每周人工评分的样本检测评判器-人工漂移并提供基准增强,当漂移超过阈值时重新触发(II)。  

## 3. 系统概述  
图1总结了四个阶段及其间流动的产物;各阶段机制在标题中有详细说明。大语言模型评判器扮演三个角色:第二阶段的优化目标、第三阶段的反馈提供者和护栏决策者,以及第四阶段的监控对象。人工标签和推理在第一阶段收集,然后在第四阶段持续增强(约每周300条)。第四阶段闭合两个循环:(i)当评判器-人工一致性下降时重新触发第二阶段再训练的快速漂移检测循环,以及(ii)使第一阶段数据集保持代表实时目录的较慢基准增强循环。我们的系统每周生成并评估数十万条解释,超过75%在重试预算3次内通过,并通过第6.2节的在线A/B测试验证。  

## 4. 第一阶段:诞生,建立基本事实  
诞生阶段是四个阶段中人力最密集的阶段。我们的内部写作专家定义必须满足的标准,为人工标注员编写标注指南,手工制作对抗性示例,并锚定人工评分。指南也用作第二阶段优化的大语言模型评判器的种子评分标准。公共大语言模型评判器基准针对通用评估,忽略了推荐解释的约束条件——它们是特定于项目、依赖上下文且简短的。因此,我们构建了一个基于相似性解释的领域特定基准。每个解释都基于目标项目以及用户过去互动过的一个或两个参考项目。标准分为*必须满足*的通过/失败条件(每个解释在展示前必须满足),以及较宽松的风格和推荐相关性标准(具体的生产标准因保密要求未列出)。对于每个标准,标注指南、通过/失败条件和边界示例均已定义。

相似文章

从提示到行为对齐:用于推荐评估的个性化LLM评判器

arXiv cs.AI

本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。

评判电路

arXiv cs.CL

本文研究了LLM-as-a-judge的内部机制,发现模型在中期到后期的多层感知机(MLP)中共享一个稀疏的潜在评估器子图,该子图处理抽象评判,而格式特定的终端分支将评判映射到输出令牌,揭示了格式导致的不一致性的原因。