检索、评分与解码对基于LLM的对话推荐性能与稳定性的影响
摘要
本文评估了对话推荐系统中的LLM重排器,表明性能和稳定性高度依赖于检索协议、候选池配置和解码设置。
arXiv:2609.00086v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地被用作对话推荐系统中的重排器,然而测量到的性能增益强烈依赖于检索和推理协议。在ReDial对话电影推荐基准上,我们在共享的检索后重排管道中比较了专有、开源权重和微调的LLM重排器与协同过滤和序列基线。我们变化了候选池大小、第一阶段检索器和解码温度。在共享的语义前250候选池和严格的候选感知评分下,最好的专有重排器在NDCG@10上达到0.1497,而非LLM最强基线的0.0939。同一重排器在零样本生成中达到0.2925,表明无约束评分可以产生比匹配池评估大得多的明显优势。在该协议下,没有评估的开源LLM超过调谐的浅层自编码器基线。对于最强的专有和开源重排器,从语义切换到协同过滤候选将NDCG@10提高了50%以上,表明测量到的重排器性能对候选生成高度敏感。对于最好的专有重排器,将温度从0提高到1.0将前10名Jaccard距离从0.0900增加到0.1240,而平均NDCG@10变化可忽略不计,而较弱的LLM显示更大的退化。这些ReDial结果支持将候选生成、候选池大小、评分策略和解码配置视为必需的报告字段而非实现细节。
查看缓存全文
缓存时间: 2026/09/02 05:46
# 检索、评分与解码如何塑造基于LLM的对话推荐性能与稳定性 来源:https://arxiv.org/html/2609.00086 会议:第35届ACM信息与知识管理国际会议(CIKM '26)论文集;2026年11月7–11日;意大利罗马 DOI:10.1145/3799682.3840066 (https://doi.org/10.1145/3799682.3840066) ISBN:979-8-4007-2539-5/2026/11 CCS:信息系统 推荐系统;CCS:信息系统 检索模型与排序;CCS:信息系统 检索结果评估 Tomislav Durićic邮箱:[[email protected]](mailto:[email protected]) 单位:Infobip,萨格勒布,克罗地亚 Andro Mercep邮箱:[[email protected]](mailto:[email protected]) 单位:Infobip,萨格勒布,克罗地亚 Emanuel Lace邮箱:[[email protected]](mailto:[email protected]) 单位:Infobip,萨格勒布,克罗地亚 © cc ###### 摘要 大型语言模型(LLMs)越来越多地被用作对话推荐系统中的重排序器,但其测量到的增益强烈依赖于检索和推理协议。在ReDial对话式电影推荐基准测试中,我们采用共享的“检索后重排序”流程,将专有LLM、开源权重LLM、微调LLM重排序器与协同过滤和序列基线进行了比较。我们变化了候选池大小、第一阶段检索器以及解码温度。在使用共享的语义top-250候选池和严格的候选感知评分下,最佳专有重排序器的NDCG@10达到0.1497,相比之下,最强的非LLM基线为0.0939。同一重排序器在零样本生成任务中达到0.2925,表明无约束评分可能比匹配池评估带来更大的表面优势。在严格协议下,没有评估的开源LLM能超越经过调优的浅层自编码器基线。对于最强的专有和开源重排序器,将候选从语义候选切换为协同过滤候选,使NDCG@10提升了超过50%,表明测量到的重排序器性能对候选生成高度敏感。对于最佳专有重排序器,将温度从0提高到1.0使top-10 Jaccard距离从0.0900增加到0.1240,而平均NDCG@10变化可忽略不计,而较弱的LLM则表现出更大的退化。这些ReDial结果支持将候选生成、候选池大小、评分策略和解码配置视为必需报告字段,而非实现细节。 ###### 关键词:对话推荐系统,大型语言模型,重排序,候选生成,评估,稳定性 ## 1. 引言 对话推荐系统(CRS)从对话而非密集交互历史中推断偏好(Jannach等人,2021)。大型语言模型(LLMs)在推荐任务上展现出有前景的零样本排序能力(Hou等人,2024),并且可以针对该角色进行微调(Bao等人,2023),这就是近期CRS工作在排序阶段越来越依赖它们的原因。报告的相对于早期基线的增益通常很显著,但这些数字依赖于许多情况下被低估报告的流程选择,即:哪些项目被检索为候选,有多少候选被呈现给LLM,评估是否将信用限制在候选集内还是对任何生成的目录标题进行评分,以及模型如何解码。在单个基准测试上,这些选择可以改变排序质量的程度超过顶级系统之间的差距,因此同一个模型可能根据评估方式显得强大或平庸。 两阶段“检索后重排序”是LLM排序的标准做法(Sun等人,2023),近期的LLM重排序器在显式候选阶段之上增加了用户偏好检索或图信号(Zhang等人,2025;Wei等人,2024)。然而,LLM CRS比较很少对候选生成进行控制,可复现性研究显示,推荐器比较不仅对这些协议选择敏感,也对基线强度敏感(Dacrema等人,2019;Krichene和Rendle,2020)。随机解码进一步使得LLM输出在重复采样中具有变异性,并且对候选在提示中出现的顺序敏感(Ma等人,2025;Bito等人,2026),然而在LLM CRS评估中,列表级稳定性很少与准确度一起报告。 我们研究这些因素如何共同塑造在ReDial(Li等人,2018)上的观察效果,这是一个由搜索者-推荐者电影对话组成的CRS基准测试,其中偏好必须仅从对话中推断。我们在共享的两阶段流程中比较了专有、开源权重和微调LLM重排序器与协同过滤(CF)和序列重排序器。匹配池比较固定检索到的候选,同时我们变化候选池大小、第一阶段检索器和解码温度。我们回答以下研究问题: - **RQ1** 在匹配的语义候选池下,LLM重排序器与CF和序列重排序器相比如何? - **RQ2** LLM重排序质量对候选池大小的敏感性如何,从零样本生成到全目录重排序? - **RQ3** 第一阶段检索器(即语义、CF或序列)的选择如何影响LLM重排序器的质量? - **RQ4** 在解码温度采样下,LLM推荐列表的稳定性如何,包括排序质量和列表级一致性? 四个专有LLM显著优于EASE(0.0939),以Claude Opus 4.6的0.1497领先,而所有评估的开源重排序器都低于它。将语义池从250个项目扩展到完整目录,使专有NDCG@10提高了57-89%。在两个测试的重排序器中,用EASE候选替代语义候选使NDCG@10提高了52-59%。随着温度升高,Claude Opus 4.6保持了平均准确度,而Jaccard距离@10从0.0900上升到0.1240,相比之下Llama-3.3-70B从0.0230上升到0.7600。这些结果确定了检索策略、候选池大小、评分策略和解码配置是核心实验变量。 ## 2. 方法论 ### 2.1 数据集和任务 我们在ReDial的标准测试集划分(1,025个对话)和6,924部电影的目录(Li等人,2018)上进行评估。对于每个对话,接受的推荐被遮蔽并用作真实目标。每个模型从特定族的输入中返回十个排序的电影标题。LLM提示包含喜欢的标题、被遮蔽的对话,以及(在零样本生成之外)打乱的候选列表。我们按候选数量标记设置:cK表示K个候选,c0表示无候选列表,cAll表示完整目录。候选感知提示要求输出仅使用列出的标题。对于CF模型,喜欢的电影构成隐式交互历史,而接受的推荐定义验证和测试目标。对于序列模型,我们通过将喜欢的电影放在接受的推荐之前并扩展这些历史记录为预增强的RecBole序列格式(Zhao等人,2021)来保留项目顺序。目标保持不变,而输入表示匹配每个模型族。匹配池控制了项目可用性但并非模型信息:LLM使用原始对话和预训练知识,而CF和序列模型使用交互历史。因此,我们的比较评估的是系统,而非在相同信息下的重排序。 ### 2.2 两阶段流程与候选生成 我们使用一个包含两个角色的两阶段流程:候选生成器为对话u返回K个目录项目池Cu^K,重排序器对此池中的项目排序并输出top-10推荐列表。同一个模型可以担任任一角色。在我们的实验中,CF和序列模型既作为匹配语义池上的重排序器,也生成top-K池供LLM重排序。主要的候选生成器是基于电影元数据的内容过滤(CBF)。我们用all-mpnet-base-v2(一种Sentence-BERT模型,Reimers和Gurevych,2019)嵌入每个目录项目,并对生成的向量e_i进行L2归一化。对于喜欢集Lu和不喜欢集Du的对话u,我们形成质心(1) c_u^+ = norm(1/|L_u| * Σ_{j∈L_u} e_j), c_u^- = norm(1/|D_u| * Σ_{j∈D_u} e_j),并对每个不在Lu∪Du中的目录项目i按(2) s_{u,i} = λ+⟨e_i, c_u^+⟩ - λ-⟨e_i, c_u^-⟩评分,其中λ+ = 1且λ- = 0.5。当Du为空时,负项被舍弃。按s_{u,i}排序的top-K项目形成Cu^K,我们在将其插入LLM提示块之前进行打乱,以减少提示位置效应。K=250的CBF池驱动主要的重排序器比较。对于候选池敏感性评估,我们还评估零样本生成(无候选列表)、K∈{500, 1000}的CBF池,以及全目录重排序(将所有6,924个目录标题放在单个提示中)。此外,我们为相同的LLM重排序器构建了以EASE为CF检索器、SASRec为序列检索器的top-250池,以隔离第一阶段效应。 ### 2.3 重排序器、推理与评估 #### 重排序器 我们比较了专有API LLM、开源权重LLM和一个微调的开源权重LLM与CF和序列重排序器。LLM重排序器接收对话上下文和候选标题,然后生成排序的电影标题列表。CF重排序器使用从RecBole交互数据(Zhao等人,2021)中学到的协同信号对相同的候选项目评分。序列重排序器使用相应的有序对话/用户序列对候选项目评分。我们还包括未重排序的CBF顺序和一个流行度基线。微调重排序器是Qwen2.5-7B-Instruct,在c250训练提示上使用LoRA(rank 16,α=32,3个epoch,学习率×10^{-5})进行了适配。对于主要的重排序运行,LLM以温度0解码,top-p保持默认值1.0。代码库包含完整的提示模板、精确的提供商模型标识符、运行配置、输出和解析代码。 #### 指标 我们的主要指标是NDCG@10(Järvelin和Kekäläinen,2002),对接受的目标电影使用二元相关性。我们还报告Hit@10、项目覆盖率@10和平均训练集流行度@10。LLM输出被解析为排序的标题列表,并在Unicode归一化、小写标题匹配并去除尾随标点后与ReDial目录项目匹配。无法匹配到目录项目的标题保留在原始输出中,但不计入指标。在候选约束设置中,提示指示LLM仅从候选列表中选择。生成的标题若不在该列表中,则不计入指标,即使它们匹配某个目录项目。 #### 检索诊断与显著性 CandRecall@250是检索到的top-250候选池中真实项目所占比例的平均值。Oracle NDCG@10是仅能对池中项目排序的重排序器可达到的最佳NDCG@10。置信区间使用对话级示例上的自助法重采样。对于主要的重排序器比较,我们使用配对Wilcoxon符号秩检验和Holm校正(Holm,1979)检验NDCG@10相对于EASE的显著性。 ### 2.4 温度敏感性与列表稳定性 对于每个LLM重排序器,我们在温度{0, 0.5, 1.0, 2.0}中的每个温度下,在c250测试集的固定30个提示子集上,对每个提示运行20次生成,top-p=1.0。Anthropic模型(Claude Opus 4.6,Claude Sonnet 4.6)被提供商限制在T=1.0。我们报告平均NDCG@10和重复生成间的对话级变化。列表变化通过top-10集合上的Jaccard距离@10和位置不一致@10来衡量,后者是跨配对生成中排名对齐位置上项目不同的比例的平均值。 ## 3. 结果 结果显示了三个主要模式。专有LLM在固定语义候选池下领先,第一阶段检索对NDCG@10的影响与模型选择相当,解码温度对列表稳定性的影响大于平均排序质量。 表1. ReDial上重排序器在零样本评分(c0,无候选列表)和对语义top-250池的严格候选感知评分(c250)下的有效性。行分组为LLM、协同过滤、序列和流行度重排序器。Cov.是top-10列表的项目覆盖率。Pop.是top-10项目的平均训练集流行度。*标记NDCG@10显著高于EASE c250基线(配对Wilcoxon符号秩检验,Holm校正,p<0.05)。c0和c250 LLM分数分别与该基线进行测试。CF、序列和流行度基线需要候选集,没有c0条目。Qwen2.5-7B-FT在c250提示上进行了微调,仅报告该策略的结果。 #### RQ1. 在匹配的语义top-250池(表1)下,Claude Opus 4.6以0.1497的严格NDCG@10取得最高值,GPT-5.2、Claude Sonnet 4.6和GPT-4.1紧随其后,介于0.1283和0.1335之间。这四个专有模型是经过Holm校正后唯一显著高于EASE(0.0939)的重排序器。GPT-4.1 Mini在数值上高于EASE但不显著,所有开源重排序器都低于EASE。零样本评分改变了这一图景。Claude Opus 4.6达到0.2925,几乎是其严格c250分数的两倍,并且更多模型相对于EASE基线变得显著。表1还显示了覆盖率和流行度的差异。在c250下,GPT-4.1和GPT-4.1 Mini在专有LLM中具有最高覆盖率,而EASE覆盖率较低但平均流行度较高。最强的专有重排序器在不完全依赖最流行项目的情况下提高了NDCG。开源模型表现出混合行为:一些覆盖了目录的广泛部分,但排序准确性仍然较低。 图1. 不同候选池大小下LLM重排序器的NDCG@10(采用语义检索)。设置包括c0(零样本,无候选)、c250、c500、c1000的严格候选感知top-k评分,以及全目录(cAll)。线图显示NDCG@10在c0、c2...
相似文章
相同问题,不同答案:超越准确性评估LLM的可靠性
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
Shape Your Feed:基于LLM的对话式推荐智能体系统
Meta 推出了 Shape Your Feed (SYF),这是一个基于 LLM 的智能体框架,用于实时对话式推荐,通过多模态输入、智能体重排序和基于 DPO 的自我进化共同策展内容,在离线和在线评估中均取得了优异结果。
跨LLMs的回复语义变异性:对基于对话评估的设计启示
本研究考察了不同模型和对话上下文中LLM生成的回复的语义一致性,强调了维护基于对话评估的稳定响应所需的基础设施和设计策略。
在LLM个性化中重新聚焦人类
本文研究了在评估LLM个性化的三个阶段(属性提取、相关性匹配和响应生成)中,合成数据与人类数据之间的差距。结果表明,模型在真实人类数据上表现更差,作者引入了轻量级训练干预措施以改善对齐。