共识与异议:群体推荐系统中主观偏好的动态LLM建模
摘要
本研究在人类调查数据上微调LLM,使其作为群体推荐系统的判断模型,动态选择聚合策略以最大化满意度和共识。一项用户研究验证了该方法与人类对公平性和满意度的感知相一致。
arXiv:2607.10235v1 公告类型:新
摘要:以往关于群体推荐系统的工作表明,对群体内偏好分布敏感。具体而言,偏好聚合策略的选择受益于考虑此类群体配置。在本文中,我们研究LLM是否能够模仿这种敏感性,并根据人类对公平性、满意度和共识的细微感知选择理想的聚合策略(以及相应的推荐)。
我们通过在人类调查数据上微调大型语言模型(LLM)来实现这一点,使其在推荐管道中作为实时判断模型。使用从DeepSeek-V3.1和人类真实评估中提炼的推理数据集,我们开发了Judgmental Llama和Judgmental OLMo来模拟群体评估。我们的管道成功地基于社会选择聚合策略生成多个推荐候选,并动态选择最大化这些预测类人评估的推荐。我们进一步在一项用户研究(n=284)中验证了这些建议,发现我们的方法在满意度和群体共识方面取得了最高分数。此外,我们发现当我们也考虑基于LLM的方法与群体配置(例如少数派或联盟)之间的交互效应时,LLM的判断与人类对公平性、满意度和共识的感知最为一致。这些发现进一步支持动态调整聚合策略以适应特定的群体内偏好分布,并突出了使用LLM进行与主观人类判断一致的适应的优势。
查看缓存全文
缓存时间: 2026/07/14 04:21
# 共识与分歧:组推荐中主观偏好的动态LLM建模 来源: https://arxiv.org/html/2607.10235 ###### 摘要。 组推荐系统的先前工作已表明其对组内偏好分布具有敏感性。具体而言,偏好聚合策略的选择受益于考虑此类群体配置。本文研究LLM是否能够模仿这种敏感性,并根据人类对公平性、满意度和共识的细微感知来选择理想的聚合策略(以及相应的推荐)。 我们通过在人类调查数据上微调大语言模型(LLM),使其作为推荐管道中的实时评判模型来实现这一点。使用从DeepSeek-V3.1和人类真实评估中提炼出的推理数据集,我们开发了Judgmental Llama和Judgmental OLMo来模拟群体评估。我们的管道基于社会选择聚合策略成功生成多个推荐候选,并动态选择最大化这些预测的人类评价的候选。我们在用户研究(n=284)中进一步验证了这些建议,并发现我们的方法在满意度和群体共识方面获得了最高分。此外,我们发现,当我们还考虑基于LLM的方法与群体配置(例如,少数派或联盟)之间的交互效应时,LLM的判断与人类对公平性、满意度和共识的感知最为一致。这些发现进一步支持了根据特定组内偏好分布动态调整聚合策略的做法,并突显了使用LLM进行与主观人类判断一致的调整的优势。 大语言模型,公平性,组推荐系统,LLM-as-judge,用户研究 ††ccs:信息系统 推荐系统††ccs:计算方法 自然语言生成 ## 1. 引言 组推荐系统(GRS)面临的挑战在于生成和调整推荐以适应不同群体成员细微且有时相互冲突的偏好。GRS研究通常依赖基于社会选择的聚合策略,例如平均、最小痛苦或最大愉悦,来弥合个体评分与群体结果之间的差距(Senot et al., 2010)。虽然这些方法计算高效、透明且文献中评估良好,但它们本质上是静态的数学计算。为了评估其有效性,研究人员通常进行用户研究,从人类参与者那里收集对感知满意度、公平性和群体共识的主观评估(Barile et al., 2023, 2026)。 然而,评估与实施之间存在显著差距。虽然用户研究为推荐可能被群体如何看待提供了宝贵的见解,但这些主观指标难以轻松集成到自动化的实时推荐管道中。当前系统缺乏一种可扩展的机制来在推荐呈现之前预测特定群体对它的感受。因此,GRS无法适应人类参与者在用户评估中所考虑的那些细微的群体场景和动态。 在本文中,我们提出了一种新颖的方法,通过利用大语言模型(LLM)和文献中的调查数据来弥合这一差距。我们利用现有的人类数据微调LLM,将其转变为能够提供类似人类评估的**判断模型**。通过将这些模型直接集成到推荐管道中,我们超越了静态聚合。更准确地说,我们的系统通过多种基于社会选择的策略生成多个推荐选项,并采用我们微调后的模型为每个结果生成多个评估,模拟一组人类参与者评估特定群体推荐。然后,我们的系统选择最大化这些类人评估的结果,为群体提供一个最终推荐,该推荐根据他们特定的偏好配置被认为是公平、令人满意且达成群体共识的。我们通过用户研究评估了我们的方法,将我们的动态基于LLM的方法与传统静态策略进行了比较。我们的用户评估显示,基于LLM的聚合策略选择在感知公平性和共识方面获得了最高平均分,在感知满意度方面获得了第二高分。总而言之,我们的结果表明,我们的动态系统能够处理两个极端情况:高共识群体(均匀)和明显分歧群体(联盟)。完整文档、代码和数据可在配套仓库中找到:https://github.com/Cwaterschoot/Consensus-vs-dissent-2026/tree/main 简言之,本文做出了以下贡献: - • 我们提出了一个基于DeepSeek-V3.1的**蒸馏推理数据集**,该数据集基于Barile等人(2023);Barile(2023)对公平性、满意度和共识的人类评估。 - • 我们引入了 **Judgmental Llama** 和 **Judgmental OLMo**,这些模型专门针对人类判断和蒸馏推理进行微调和评估,以模拟群体评估。 - • 我们开发了一个**端到端推荐管道**,利用这些微调模型根据类人评估动态选择组推荐结果。 - • 我们进行了一项用户研究(n=284),以评估我们基于判断的GRS的有效性,并表明我们提出的方法在公平性和共识方面获得了最高评估。此外,我们的用户研究展示了与群体配置的统计显著交互作用。 表1. 本研究中使用的偏好聚合策略(Tran et al., 2019; Barile et al., 2023; Felfernig et al., 2018) ## 2. 相关工作 在以下段落中,我们概述了GRS的相关工作以及LLM在组推荐背景下的使用。此外,我们讨论了(组)推荐中的公平性以及文献中如何评估它。最后,我们介绍了在LLM-as-judge范式下使用LLM自动化评估此类指标的文献。 ### 2.1. 组推荐 传统推荐系统在个体层面生成推荐。相比之下,GRS需要处理多个可能相互冲突的偏好,以产生反映群体成员偏好的组推荐(Masthoff and Delić, 2022)。我们发现GRS在餐馆推荐(例如,Barile et al., 2021, 2023; Waterschoot et al., 2025c)、旅游(Chen et al., 2021; Delić et al., 2024)、内容审核(Waterschoot and van den Bosch, 2024)或音乐推荐(Najafian and Tintarev, 2018)中有最近的应用。 已经提出了多种方法论来基于一组个体偏好评分生成此类组推荐。Cao等人(2018)和Huang等人(2020)提出了基于注意力神经网络的GRS,而其他人则提出了图神经网络(Zhang et al., 2021)或强化学习(Stratigi et al., 2023)。虽然这些最新方法论为生成组推荐提供了有前景的途径,但根植于**社会选择理论**(Kelly, 2013)的基于社会选择的聚合策略,在GRS文献中仍然是一个突出的过程,无论是作为主要聚合步骤(Barile et al., 2023; Tran et al., 2019; Waterschoot et al., 2025b)还是作为与更复杂模型比较的基线(例如,Nguyen et al., 2019; Rossi et al., 2018; Delic et al., 2018; Tommasel, 2024)。此外,基于神经网络的方法需要包含群体决策和反馈的大型数据集,这些数据集并不广泛可用。另一方面,基于社会选择的聚合策略提供了多种计算方法,将简单的个体偏好矩阵(用户-项目评分)转化为单一的群体结果(Masthoff, 2015; Senot et al., 2010)。它们通常被分类为**边界型**(仅使用评分子集,例如最小痛苦或最大愉悦)、**多数型**(仅使用最受欢迎的项目/评分,例如批准投票)或**共识型**(使用所有评分,例如加法功利主义)。在本研究中,我们包含了来自所有三个类别的策略。所包含的聚合策略总结于表1。我们实施基于社会选择的聚合而不是更新的方法,是因为其聚合过程透明且在文献中广泛使用,最大限度地提高了可重复性。 最近,LLM出于各种原因被集成到GRS管道中。LLM已被用作个体(Bao et al., 2024; Liao et al., 2024)和组推荐(Tommasel, 2024; Waterschoot et al., 2025a)的决策制定。此外,LLM已被用于为(组)推荐系统生成解释(Lubos et al., 2024; Said, 2025; Waterschoot et al., 2025a)以及解决冷启动(Sanner et al., 2023; Wu et al., 2024; Dai et al., 2023)或跨域推荐(Petruzzelli et al., 2024; Kim et al., 2024)等特定问题。最近的一个焦点是采用LLM作为骨干模型的对话式推荐系统(Gao et al., 2023; Yang et al., 2024)。虽然LLM能够挑战生成推荐的传统方法,但这些模型带有特定缺点,例如不断增长的计算能力和隐私问题(Wu, 2023; Zhao et al., 2024; Waterschoot et al., 2025b)。在我们的研究中,我们利用LLM-as-judge,目标是生成对感知公平性、满意度和群体共识的类人评估。 请参考图注 图1. 在Barile等人(2023)的用户研究中收集的,人类对组推荐在公平性、满意度和共识方面的评分分布(7点李克特量表,n=1,152)。数据来自Barile(2023)。 ### 2.2. GRS的人类评估 公平性是推荐系统中的一个重要主题(Deldjoo et al., 2024; Kaya et al., 2020; Li et al., 2023)。其他主观评估,如满意度,特别是针对组推荐的感知群体共识,也受到关注(Barile et al., 2023, 2026)。关于公平性,已经提出了几个指标。每个指标都关注公平性的特定方面,例如人口统计均等和机会均等,即所有符合条件的项目都被考虑(Kumar et al., 2023)。对于GRS,Kaya等人(2020)将公平性定义为平衡群体成员之间排名靠前项目的偏好,从而定义一个贪婪算法来生成满足此条件的组推荐。 在GRS背景下,人类评估通常通过用户研究收集(Barile et al., 2026)。文献区分了外部评估(参与者不属于该群体,作为外部人评估推荐)(Barile et al., 2023; Tran et al., 2019)和内部评估(用户提供他们的评分并且自己是群体的一部分)(Barile et al., 2026)。参与者被提供群体上下文(用户-项目矩阵),并被要求用李克特量表对陈述进行评分。在本研究中,我们使用了这样一个数据集¹¹源数据集可在此处找到:https://dataverse.nl/dataset.xhtml?persistentId=doi:10.34894/8EVX4U(Barile et al., 2023; Barile, 2023),该数据集要求参与者对**公平性**(“该组推荐对所有群体成员都是公平的”)、**满意度**(“群体成员将对该组推荐感到满意”)和**共识**(“群体成员将就组推荐达成一致”)进行评分。该研究中的人类响应分布如图1所示。 ### 2.3. LLM-as-judge LLM-as-judge范式已成为人类评估的一种潜在、可扩展的替代方案,适合解决传统群体招募的瓶颈以及与用户研究相关的成本。在此框架下,LLM被用作评估者,生成类人的自然语言评估或李克特评分(Bakker et al., 2022; Li et al., 2025),包括主观评估形式,如性别歧视检测(Aoyagui et al., 2025)。向自动化评估的转变...
相似文章
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。
评估 LLM 在受控实验中作为人类代理的可靠性
本论文通过比较 LLM 生成的数据与人类在准确性感知调查中的反应,评估现成 LLM 是否能可靠地模拟受控行为实验中的人类反应。研究发现,虽然 LLM 能捕捉方向性效应和聚合信念更新模式,但它们的效应大小与人类尺度不一致,这有助于澄清合成 LLM 数据何时可以作为行为代理。
LLM-as-Judge的几何学:为何LLM间共识并非人类对齐
本文从几何角度分析了为何作为裁判的LLM彼此之间高度一致,但与人类仅弱相关,发现LLM间共识在主观评分标准上反映的是坍塌子空间,而非真正的人类对齐。基于人类数据的后验校准提高了对齐,但即使经过校准的LLM也未达到人类的可靠性。
重新思考基于LLM的社会模拟评估与优化
本文引入了一个主观性系数来解决基于准确率评估LLM社会模拟的局限性,提出了适应主观性的软标签训练(SALT)进行优化,并构建了SubjSim基准测试以针对完整响应分布进行评估。
在位者优势:LLM推荐系统中的品牌偏见与认知操纵动态
本文研究LLM产品推荐中的品牌动态,发现知名品牌存在条件性垄断,但可通过微小的评分优势或权威式营销语言打破,并揭示了多品牌GEO竞争中的社会困境。