从提示到行为对齐:用于推荐评估的个性化LLM评判器
摘要
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
arXiv:2608.11493v1 公告类型:新
摘要:传统的离线推荐评估严重依赖复杂且人工维护的特征管道,难以扩展。虽然大语言模型(LLM)通过直接从原始文本日志预测用户参与情况,提供了一种有前景的替代方案,但本研究的实证分析发现了一个关键失败模式,称为双向合理化。在零样本设置下,LLM被发现能够针对完全相同的项目、使用相同的证据,令人信服地论证用户参与的正向和负向结果,这凸显了现成LLM在预测用户参与方面的不可靠性。为解决这一问题,我们开发并应用了一种顺序行为对齐框架,将微调与基于配对正确及反事实理由的偏好优化相结合。在真实世界的主页交互日志上进行评估后,这种对齐推理方法相比零样本基线在Macro-F1分数上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。结果表明,行为对齐缓解了双向合理化问题,同时提供人类可解释的推理轨迹,且无需人工管道开销。
查看缓存全文
缓存时间: 2026/08/13 15:26
# 从提示到行为对齐:用于推荐评估的个性化LLM评审 ###### 摘要。 传统的离线推荐评估严重依赖复杂且需要人工维护的特征管线,难以扩展。尽管大语言模型(LLM)提供了一种有前景的替代方案——直接根据原始文本日志预测用户参与度,但本研究的实证分析发现了一种关键的失败模式,称之为双向合理化。在零样本设置下,LLM被发现能够针对完全相同的物品、基于相同的证据,令人信服地论证正面和负面两种用户参与结果,这凸显了现成LLM在预测用户参与度方面的不可靠性。为解决这一问题,我们开发并应用了一种序列行为对齐框架,将微调与基于配对正确与反事实理由的偏好优化相结合。在真实主页交互日志上的评估表明,这种对齐推理方法相较于零样本基线在Macro-F1分数上提升了32.19%,并与生产环境中的特征工程基线持平。结果表明,行为对齐能够缓解双向合理化问题,同时提供人类可解释的推理轨迹,且无需人工管线开销。 ###### 关键词: 个性化推荐评估;大语言模型;推理模型;离线评估 ## 1. 引言 推荐系统是现代数字平台的核心组成部分,驱动用户参与度和长期留存[4](https://arxiv.org/html/2608.11493#bib.bib2)。为了持续改进这些系统,快速可靠的评估框架至关重要。虽然在线A/B测试仍是衡量真实用户满意度和业务影响的金标准,但它本质上速度慢、计算密集,并且存在让用户暴露于次优体验的风险。因此,工业实践者严重依赖使用历史交互日志的离线评估。然而,传统离线指标(如NDCG或Recall)常常存在曝光偏差,并且往往无法与在线A/B测试结果强相关[3](https://arxiv.org/html/2608.11493#bib.bib5)。这种离线与在线性能之间的持续差距为快速模型迭代造成了显著瓶颈。 为了弥合这一评估差距,工业界越来越多地采用基于模型的评估:部署学习的模型来估计反事实结果和业务指标[15](https://arxiv.org/html/2608.11493#bib.bib9)。此外,近期工作探索了使用LLM作为离线评审[17](https://arxiv.org/html/2608.11493#bib.bib3)。与标准检索指标不同,LLM具备理解复杂上下文信号的语义能力。基于LLM评估的潜力,我们的工作聚焦于增强这些模型的严谨性和判别能力。然而,将LLM部署于推荐评估引入了个性化这一关键挑战。传统LLM评审基于全球人类共识评估一般性质量,如有用性或安全性。相比之下,推荐质量本质上是主观的——物品的相关性取决于个体用户偏好,而非统一标准。因此,通用评估标准无法捕捉真实用户意图,这使得可扩展的个性化评估成为工业应用的主要瓶颈。 在Netflix推荐系统的背景下,我们将这一个性化评估构建为参与度预测任务。具体而言,当用户在其主页上看到一排精选推荐标题时,评估者必须分析用户的按时间顺序的观看历史和即时会话上下文,以预测一个二值行为结果:用户是否会与推荐互动(“播放”动作)或完全忽略该行(“跳过”动作)。虽然开箱即用的LLM具备读取这种序列化历史的语义能力,但它们本质上难以充当可靠评审。没有领域特定的对齐,这些模型会表现出有偏见的评估[11](https://arxiv.org/html/2608.11493#bib.bib6)。此外,未对齐的模型往往表现为无约束的合理化器[8](https://arxiv.org/html/2608.11493#bib.bib4);因此,在评估总体高质量的推荐行时,未对齐的LLM可以轻松为“播放”或“跳过”动作构建看似合理的理由,而无论真实用户意图如何。 为解决这一问题,我们提出了一种端到端框架,将LLM评审的推理与基于真实用户参与度对齐。我们不依赖零样本提示,而是训练模型生成锚定于实际用户参与结果的思维链(CoT)[12](https://arxiv.org/html/2608.11493#bib.bib8)推理轨迹,并系统性地基准测试该任务上的推理时和参数级适应策略。 本文中,我们刻画了基于LLM的评估器在个性化场景中的特定失败模式,并展示了使用偏好优化的*行为对齐*——将LLM评审的推理锚定到观察到的用户参与度——能够匹配特征工程的生产基线,同时保持可解释性。我们的主要贡献如下: - •我们识别出*双向合理化*是LLM评审在个性化场景中的特定失败模式,其在结构上不同于幻觉。这一失败追溯到推荐系统的基础性权衡(例如,短期与长期、准确性与多样性、新颖性与流行性、探索与利用),每种权衡都支持多条可辩护的推理路径,未对齐的模型可以将其扩展为任一方向的流畅论证。在过滤掉包含不实主张的理由对后,双向分歧模式仍然存在,表明该失败不能归结为捏造。 - •通过对提示策略的系统比较,我们发现基于推理的预测和纳入即时会话上下文是仅有的两个对LLM评审准确性有一致贡献的因素。然而,仅靠提示工程不足以弥合零样本LLM评审与重度特征工程基线之间的差距,这促使我们转向参数级适应。 - •我们提出了一种对齐方法:首先在推理轨迹上应用SFT,然后基于真实参与结果,在配对的正确与反事实理由上应用离线偏好优化。这一方法弥合了剩余的性能差距:由此得到的基于文本的LLM评估器在Netflix主页参与度预测上匹配了特征工程基线,且无需任何人工特征工程,同时产生人类可解释的推理轨迹,揭示驱动每个预测的用户历史信号。 ## 2. 相关工作 ##### LLM作为推荐评估的评审。 LLM已被用作广泛任务的离线评估器,通常通过对候选输出进行直接或成对判断[17](https://arxiv.org/html/2608.11493#bib.bib3)。在推荐场景中,Profile-Aware LLM评审[2](https://arxiv.org/html/2608.11493#bib.bib1)表明,向LLM提供用户画像的提示可以产生接近人类评分的判断。另外一条互补的研究线通过衡量LLM驱动的对话式推荐系统的推荐策略与人类推荐者的一致性来评估这些系统[13](https://arxiv.org/html/2608.11493#bib.bib17)。我们的工作沿两个轴扩展了这些研究线:判断目标从人工标注标签转向观察到的行为结果(用户是否与推荐行互动),适应方法从推理时提示转向通过基于推理理由的偏好优化进行行为对齐。 ##### 推荐任务中的推理。 一条并行的工作线将显式推理整合到推荐模型中,与我们提高准确性和可解释性的目标一致。OneRec-Thinking[5](https://arxiv.org/html/2608.11493#bib.bib13)将思维链推理引入生成式推荐,在物品预测之外产生人类可解释的理由,并展示了在线部署中的增益。相关方法如ThinkRec[14](https://arxiv.org/html/2608.11493#bib.bib14)和Reason-to-Recommend[16](https://arxiv.org/html/2608.11493#bib.bib15)使用监督微调和强化学习为生成式推荐器注入推理能力,显式推理轨迹作为模型决策过程的透明机制。我们的工作将推理应用于互补的问题——*评审*(离线评估)而非生成推荐:我们的评审产生的推理轨迹是人类可读的,并暴露了哪些用户历史信号驱动了每个预测的参与结果,为不透明的基于特征的评估器提供了可解释的替代方案。 ##### LLM评审中的双向合理化。 未对齐的LLM被描述为无约束的合理化器,可以在模糊输入上向任一方向展开看似合理的理由[8](https://arxiv.org/html/2608.11493#bib.bib4)。近期研究表明,两个推理模型在同一主题上被给予对立立场时,各自会产生自信且内部一致的论证[6](https://arxiv.org/html/2608.11493#bib.bib12),并且思维链轨迹即使在有稳定真值的客观任务上也往往不能忠实反映实际决策过程[10](https://arxiv.org/html/2608.11493#bib.bib10);[1](https://arxiv.org/html/2608.11493#bib.bib11)。我们在第3节(https://arxiv.org/html/2608.11493#S3)基础上展开,论证在个性化推荐评估中,合理化失败模式与迄今为止研究的客观设置中具有结构性的不同形式。 表1. 相同的用户历史,相同的推荐行,两条推理路径得出相反结论。在人工过滤掉包含不实主张的理由对后,这些双向分歧模式仍然存在,并追溯到推荐系统的基础性权衡。每条路径的预测输出和真实参与标签均已标注;推理摘录来自教师生成的理由的节选。 ## 3. 预备知识:双向合理化 要理解将LLM应用于推荐评估的瓶颈,关键在于刻画未对齐模型在个性化设置中如何失败。已有工作刻画了在具有稳定、外部可验证真值的设置中的合理化、位置偏差和迎合心理。然而,推荐质量本质上是主观的。为了研究个性化推荐评估的失败模式,我们基于模型对其评估的理由进行了定性分析。 为给我们的分析提供基础,我们采样了真实世界的主页交互日志,其中用户被暴露于Netflix主页的精选推荐行。真实参与度通过一种空间滚动启发式确定:如果用户播放了某行中的某个物品,则该行被记录为正的“播放”事件,而位于其上方且用户明确滚动经过的任何行被记录为硬负例“跳过”事件。由于所有推荐物品通常与用户高度相关,这些“跳过”案例充当强反事实而非琐碎不匹配。对于这些实例的平衡集合,我们序列化了用户的交互历史、即时会话上下文和推荐行,并将其提供给一个能力很强但未对齐的LLM。通过提示模型为两个候选结果分别进行论证,我们提取了每个实例的一个自信的“播放”理由和一个自信的“跳过”理由,创建了一个数据集,其中每对中只有一条推理路径与真实用户动作匹配。 为排除捏造作为分歧来源,我们过滤掉了任一理由包含对推荐物品的错误描述、虚构的用户历史事件或编造的不可支持行为特征的情况。令人惊讶的是,77.0%(1246对中的960对)的平衡对通过了这一事实性过滤。这表明失败模式并非幻觉;相反,模型能够从相同证据构建出内部连贯、基于事实的相反方向论证。 检查这些持续存在的分歧,我们发现双向路径系统地对应于推荐系统的基础性权衡: - •短期与长期(时间视角)。近期观看和长期历史都是评估时关于用户的有效信号。 - •校准与专门化(多模态品味)。用户通常表现出多种共存的品味,推荐物品也是异质的。一条推理路径可以校准到用户的完整品味分布[9](https://arxiv.org/html/2608.11493#bib.bib16),也可以聚焦于单一侧面。 - •新颖性与流行性(平台曝光)。可以通过强调用户对热门、知名物品的参与度或用户对利基内容的偏好来预测参与度。 - •探索与利用(兴趣扩展)。用户的历史既可以支持探索新的、偶然的兴趣,也可以支持利用舒适区内的偏好。 在通过事实性过滤的960对中,95.4%(916对)表现出符合上述四种权衡之一或其组合的对比。表1(https://arxiv.org/html/2608.11493#S2.T1)用我们过滤后的理由集中的示例说明了每种权衡。 其底层机制是*双向推断*:相同的观察到的用户信号,根据推理路径采用哪种权衡,支持关于未来参与度的相反结论。由于未对齐的LLM评审缺乏与真实用户参与度的行为对齐,它没有原则性基础来解决这些权衡,从而充当无约束的合理化器。 因为双向合理化在捏造过滤后仍然存在,仅抑制幻觉的方法是不够的。模型必须学习众多局部有效框架中哪一种能最可靠地预测基于真实用户的行为。这一结构性挑战引出了两个主要研究问题: - •RQ1(推理时适应):提示工程能在多大程度上缓解双向合理化并提高个性化参与度预测的准确性? - •RQ2(参数级对齐):哪种行为对齐范式(如监督微调或直接偏好优化)最有效地弥合性能差距并解决提示工程无法处理的失败模式? 双向合理化在捏造过滤后依然存在,这对对齐有直接影响。抑制虚构用户特征或错误描述物品的监督微调解决了幻觉失败模式,但保留了合理化器问题,因为我们识别的双向模式不是发明的产物,而是任务的结构属性。行为对齐提供了一种有针对性的干预:通过让模型接触锚定于真实参与结果的配对正确与反事实理由,偏好优化教会模型*众多局部有效框架中哪一种能最可靠地预测基于真实用户行为*,将双向合理化器坍缩为方向性评审,解决这一模糊性。
相似文章
在LLM个性化中重新以人类为中心
本文通过将真实人类重新引入评估循环,研究LLM个性化的有效性,揭示了在个性化管道的每个阶段人类判断与LLM输出之间的系统性差距,并强调了合成数据和LLM评判的局限性。
Review Arcade:论LLM评审的人类对齐与可游戏性
本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。
共识与异议:群体推荐系统中主观偏好的动态LLM建模
本研究在人类调查数据上微调LLM,使其作为群体推荐系统的判断模型,动态选择聚合策略以最大化满意度和共识。一项用户研究验证了该方法与人类对公平性和满意度的感知相一致。
LLM-as-Judge的几何学:为何LLM间共识并非人类对齐
本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。