Re2A:基于评分标准的偏好推理与对齐的情境化对话推荐
摘要
本文介绍了Re2A,一个用于情境化对话推荐的框架,该框架使用基于评分标准的偏好推理和基于偏好的对齐来增强用户偏好满意度和情境一致性。
arXiv:2609.18249v1 宣布类型:新
摘要:真实世界的推荐场景通常基于用户与推荐者交互时的共享物理环境。这促使了情境化对话推荐(SCR),一个复杂的任务,要求推荐助手共同推理对话历史、共同观察的场景和场景内物品属性。然而,当前的方法由于两个相互交织的挑战而难以应对此设置:准确理解对话中的情境化用户偏好,以及生成同时满足用户需求和基于情境的响应。为此,我们提出了Re2A,一个将SCR构建为结构化推理然后对齐过程的框架。我们引入了基于评分标准的偏好推理,该推理使用自动评分标准来指导模型产生明确的偏好状态。基于这些状态,我们提出了一个基于偏好的优化,将响应生成与双重目标对齐:用户偏好满意度和情境一致性。在两个SCR数据集上的大量实验表明,Re2A始终优于最先进的方法,提供更精确、上下文感知的对话推荐。我们的代码可在https://github.com/DongdingLin/Re2A获取。
查看缓存全文
缓存时间: 2026/09/17 09:35
# Re2A:基于评分准则偏好推理与对齐的情境化对话推荐
来源:https://arxiv.org/html/2609.18249
作者:Jian Wang, Xiaoyan Zhao
隶属机构:香港中文大学
邮箱:dongding88\.lin@connect\.polyu\.hkwangjian51@scu\.edu\.cnxzhao@se\.cuhk\.edu\.hkcswjli@comp\.polyu\.edu\.hk
作者:Wenjie Li
隶属机构:香港理工大学计算机系 / 四川大学计算机学院
###### 摘要
真实世界的推荐场景通常建立在用户与推荐系统交互的共享物理环境中。这推动了情境化对话推荐(SCR)的发展——一项需要推荐助手协同推理对话历史、共视场景以及场景内物品属性的复杂任务。然而,现有方法因两大交织挑战而面临困境:准确理解对话中持续变化的情境化用户偏好,以及生成同时满足用户需求与场景约束的响应。为此,我们提出 **Re2A** 框架,将SCR构建为结构化“推理-对齐”流程。我们引入基于评分准则的偏好推理,利用自动化评分准则引导模型生成显式偏好状态;并基于这些状态提出偏好条件优化,使响应生成对齐双重目标:用户偏好满足与场景一致性。在两个SCR数据集上的大量实验表明,Re2A持续优于当前最优方法,提供更精准、情境感知的对话推荐。代码已在 https://github.com/DongdingLin/Re2A 开源。
---
## 1 引言
对话推荐(Li et al., 2018)旨在通过自然语言交互提供个性化推荐,近年来已成为关键研究领域。现有对话推荐系统大多仅在纯文本环境中运行(Zhou et al., 2022; Yang and Chen, 2024; Yoon et al., 2024),忽视用户所处的物理环境。然而,真实推荐场景(如服装或家具店的实景促销导航)本质上是“情境化的”,有效沟通依赖于对周围环境的共同观察(Moon et al., 2020; Kottur et al., 2021)。这推动了情境化对话推荐(SCR)的研究(Lin et al., 2024; Wang et al., 2025; Lin et al., 2026)。SCR聚焦于用户与对话智能体间的多模态交互,要求系统综合考虑对话历史、共视视觉场景及场景内物品属性进行推荐。从“纯文本”转向“场景感知”的范式,SCR将对话智能体从孤立推荐者转变为情境化助手(Mukande et al., 2024; Zhang et al., 2025; VanderHoeven et al., 2025)。
尽管潜力巨大,SCR存在区别于传统对话推荐的两大根本挑战,但这一方向仍未被充分探索。如图1所示,第一大挑战在于**推断用户的情境化偏好(或需求)**。与纯文本环境不同,SCR中的用户偏好与所处场景紧密耦合,可能依赖隐式需求、视觉相似物品甚至随环境动态变化。此类多模态上下文的复杂性使得模型难以准确推断用户潜在意图。第二大挑战涉及**如何有效利用情境化偏好与场景信息生成合适响应**。在SCR中,推荐响应需同时满足用户偏好并基于可见候选物品,这要求智能体实现与用户及环境的双重对齐,提供既相关又符合情境的推荐。
本文提出**基于评分准则的偏好推理与对齐(Re2A)**框架,将SCR构建为“推理-对齐”流程。我们并非引入新优化算法,而是通过结构化偏好状态作为情境推理与响应生成间的共享接口。Re2A执行基于评分准则的偏好推理,从对话历史与共视场景中显式推断中间用户偏好状态。受链式思维推理(Wei et al., 2022)启发,这些状态以结构化文本形式呈现,使推理过程可检验。与自由形式的思维链解释不同,偏好状态在推荐物品前明确记录推断的用户需求、属性约束及视觉目标。由于为此类推理收集可验证监督成本高昂,我们采用情境感知的多维评分准则获取奖励,并通过策略优化(Shao et al., 2024)优化模型,鼓励复杂情境下的稳健偏好推理。
基于推理的偏好状态,Re2A通过双重对齐响应生成解决第二大挑战。我们将响应生成构建为对比学习问题(Rafailov et al., 2023),引入用户偏好条件优化目标。通过构建专门违反用户偏好或场景约束的异质负响应,模型学习将输出与情境一致性和用户意图满足对齐。最终,Re2A生成符合情境的推荐。我们的贡献总结如下:
- 提出**Re2A**框架,将SCR重构为结构化“推理-对齐”流程,显式分离情境偏好推理与响应对齐。该框架以结构化偏好状态为核心接口,连接偏好推理、场景约束物品推荐与响应生成。
- 利用评分准则引导的策略优化推导显式用户偏好状态,并引入基于评分准则候选的用户偏好条件优化,实现用户意图与情境约束的双重对齐。通过自动化评分准则归纳与合成偏好构造,避免人工标注推理轨迹。
- 在两个SCR数据集上的实验表明,Re2A持续优于竞争方法,生成更精准捕捉用户情境需求且与场景事实对齐的推荐。
## 2 任务定义
我们将SCR定义为共享多模态环境中的序列决策过程。环境包含一组视觉场景 $\{\mathcal{S}_i\}_{i=1}^{M}$,每个场景 $\mathcal{S}_i$ 拥有自己的候选物品集 $\mathcal{I}_i=\{o_{i,j}\}_{j=1}^{N_i}$。关键的是,每个物品 $o_{i,j}$ 是多模态实体,由视觉外观(如颜色)、空间坐标及结构化元数据(如价格)共同表征。在第 $t$ 轮交互中,智能体接收情境上下文 $X_t=(\mathcal{S}_t,\mathcal{I}_t,\mathcal{C}_t)$,包含共视场景 $\mathcal{S}_t$、场景特定物品集 $\mathcal{I}_t$ 及对话上下文 $\mathcal{C}_t=\{u_1,Y_1,...,u_{t-1},Y_{t-1},u_t\}$(包括历史对话和当前用户话语 $u_t$)。SCR的目标是学习映射函数,利用该上下文同时:
(1) 识别满足用户需求的合适目标物品 $o_t^* \in \mathcal{I}_t$;
(2) 生成与用户偏好对齐且基于场景的自然语言响应 $Y_t$。
## 3 方法
本文提出基于评分准则的偏好推理与对齐(Re2A)用于情境化对话推荐。图2展示了Re2A概览,其遵循三阶段流程:评分准则引导的偏好推理(§3.1)、用户与情境双重对齐(§3.2)及级联推理(§3.3)。
### 3.1 评分准则引导的偏好推理
准确推断潜在用户需求是SCR的核心挑战。仅依赖物品标签监督偏好推理可能捕捉表面关联,却无法把握空间或视觉线索如何激发选择的根本逻辑。为此,我们将推理目标从预测“是什么”转向解释“为什么”。鉴于此中间推理缺乏自然监督,我们引入基于评分准则的框架,提供可验证且面向过程的指导。该设计在两方面区别于通用思维链与传统状态跟踪:
1. 智能体利用思维能力生成结构化偏好状态,记录可能的用户需求、属性约束及视觉目标;
2. 由于中间状态无直接标注,回合相关评分准则评估每个思考过程及其状态是否符合共视场景证据,而非监督单个推理步骤。
#### 自动化评分准则归纳
为无需人工标注偏好推理轨迹即可获得可扩展监督,我们通过多模态大语言模型(MLLM)驱动的归纳过程构建全局评分准则集 $\mathcal{R}$。给定小型精选种子数据集 $\mathcal{D}_{\text{seed}}=\{(\mathcal{S}_k,\mathcal{C}_k)\}_{k=1}^{K}$ 及宪法元指令 $\mathcal{I}_{\text{meta}}$(附录A.1),我们提示MLLM生成推理标准,形成评分准则集。该准则集结构化为以下四个维度:
$$\mathcal{R}=\mathcal{R}_{\text{sit}}\cup\mathcal{R}_{\text{rel}}\cup\mathcal{R}_{\text{con}}\cup\mathcal{R}_{\text{aux}}$$
其中 $\mathcal{R}_{\text{sit}}$(情境性)评估视觉定位(如空间引用),$\mathcal{R}_{\text{rel}}$(物品相关性)评估物品属性约束对齐度,$\mathcal{R}_{\text{con}}$(一致性)确保与对话历史的逻辑连贯性,$\mathcal{R}_{\text{aux}}$(辅助性)捕获MLLM识别的前三维度之外的领域特定标准。关键的是,每条准则 $r \in \mathcal{R}$ 表述为二元谓词函数 $r(\cdot) \to \{0,1\}$,通过冻结MLLM评判器实现标准化二元评估(附录A.2提供具体示例)。这四个维度遵循SCR的核心要求:视觉定位、约束满足与多轮连贯性;对50个采样对话回合的手动覆盖检查表明,所有回合级要求均映射至这些维度(附录I.1)。
#### 动态评分准则选择
在动态对话回合中统一应用全局评分准则集 $\mathcal{R}$ 会引入噪声监督,因为无关约束会模糊推理焦点。为此,我们采用由冻结MLLM($\pi_{\text{sel}}$)实例化的动态评分准则选择器,根据情境上下文 $X_t$ 选择相关子集 $\mathcal{R}_{\text{act}} \subset \mathcal{R}$。通过分析主要交流需求,$\pi_{\text{sel}}$ 过滤非活跃标准。例如,“左边那个”的纯空间查询主要激活情境性准则,而“左边那个红色的”混合查询则同时激活情境性与物品相关性准则。这种选择性激活提供更密集且噪声更少的监督。提示模板见附录B。
#### 基于评分准则奖励的偏好状态生成
为连接原始多模态上下文与结构化偏好推理,我们训练偏好推理模型 $\pi_{\theta}$ 显式生成用户偏好推理轨迹。给定情境上下文 $X$ 与结构化指令 $\mathcal{I}_{\text{reason}}$(附录B),$\pi_{{\theta}}$ 生成捕获偏好转变与空间约束中间推理的**偏好思维** $\mathcal{T}$,随后输出**偏好状态** $\mathcal{P}$——将推断的用户需求、属性约束及视觉目标形式化为结构化文本,用于基于提示的物品推荐与评分准则验证。
由于此类偏好状态隐式且缺乏直接监督,我们采用基于组的学习策略提供相对训练信号。每个训练步骤中,$\pi_{\theta}$ 采样一组 $G$ 个推理候选 $\{\mathcal{O}_1,...,\mathcal{O}_G\}$,其中每个 $\mathcal{O}_g=(\mathcal{T}_g,\mathcal{P}_g)$。在第 $t$ 轮交互中,动态选择的评分准则子集 $\mathcal{R}_{\text{act}}$ 作为评估标准。我们使用MLLM评判器评估每个候选是否满足活跃评分准则,产出二元验证结果集。具体而言,该评判器实例化为二元评估器 $f_{\text{judge}}:(\mathcal{O}_g,r,X_t)\to\{0,1\}$,采用冻结的 Qwen3-VL-8B-Instruct(Bai et al., 2025)模型。对每条活跃准则,评估器接收情境上下文、候选偏好思维、偏好状态、评分准则问题及其证据指示器,输出包含支持证据的结构化JSON判定;确定性解析器将“是”映射为1,“否”映射为0。具体评判提示见附录B。
---
(注:后续章节内容因输入文本截断未提供完整翻译,此处保留原始结构)相似文章
Co-ReAct:将评分标准作为 ReAct 代理的步骤级协作工具
Co-ReAct 引入了一种基于评分标准的动作选择框架,在推理过程中将评分标准作为 ReAct 代理的步骤级指导,提高了轨迹质量,并在 DeepResearchBench 和 SQA-CS-V2 上超越了基线模型。
自动评分标准作为奖励:从隐性偏好到显式多模态生成准则
本文介绍了自动评分标准作为奖励(ARR)框架,该框架将隐性偏好知识外显化为多模态对齐的显式评分标准。文章提出了评分标准策略优化(RPO)以稳定策略梯度,在文生图和图像编辑任务中取得了更佳的性能。
C2:基于二元偏好的可扩展评分增强奖励建模
C2 提出了一种可扩展的评分增强奖励建模框架,该框架仅通过二元偏好训练一个协作的评分生成器和一个批判性验证器,无需昂贵的评分标注,同时在 RM-Bench 上实现了最高 6.5 分的提升。
ARES:可扩展LLM强化学习的自动评估标准合成
ARES提出了一种框架,能够从预训练文档中自动构建基于评估标准的强化学习数据,生成问答对和加权评估标准,从而为开放式的LLM回答提供实例级别的奖励监督,在多维开放式任务上优于现有方法。
超越以相关性为中心的检索:基于评分标准的文档集选择与排序
本文提出了一种以评分标准为导向的框架,用于评估和优化面向大语言模型的文档集,包括一个新的基准测试和一个无需训练的方法,该方法能提升下游生成性能。