RouteRec:推荐智能体选择与聚合的严格评估

arXiv cs.CL 论文

摘要

RouteRec是一个用于在成本约束下评估请求级硬选择与项目级学习聚合异构推荐智能体(包括LLM重排序器)的框架。在MovieLens-1M上的实验表明,项目级聚合显著优于请求级选择。

arXiv:2607.09908v1 公告类型:新 摘要:推荐系统越来越多地面临异构智能体之间的选择——协同过滤、序列模型、基于内容的检索器以及基于LLM的重排序器——然而没有单一智能体是普遍最优的。我们使用RouteRec框架将这一选择视为在成本约束下的任务感知智能体排序,该框架比较了针对四个传统推荐智能体和一个LLM重排序智能体的请求级硬选择与项目级学习聚合。在MovieLens-1M上,全质量预言机具有显著的提升空间(HR@10 = 0.584),证实了存在有用的跨智能体信号。然而,在无泄漏的五折外折协议下,硬选择仍低于BM25(0.223对比0.254),且选择性LLM升级未能改善这一结果。同样的协议对学习聚合产生了不同结果:其仅廉价变体在HR上与BM25持平,且NDCG点估计更高(0.123对比0.114),而门控全智能体聚合达到了HR@10 = 0.295,使用了70.2%的LLM调用。由此得出的教训并非路由问题已解决,而是对于这种稀疏固定候选场景,请求级选择单个完整智能体列表过于粗糙;项目级聚合是更有前景的行动空间。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:20

# RouteRec:推荐智能体选择与聚合的严格评估
Source: https://arxiv.org/html/2607.09908
###### 摘要

推荐系统日益面临在异构智能体之间(协同过滤、序列模型、基于内容的检索器以及基于LLM的重排序器)进行选择的困境,然而没有单一智能体在所有情况下都是最优的。本文通过RouteRec框架将这一选择问题建模为任务感知的智能体排序,并在考虑成本约束的条件下,比较了请求级别的硬选择与物品级别的学习聚合,涵盖了四个传统推荐智能体和一个LLM重排序智能体。在MovieLens-1M数据集上,完全质量oracle具有显著提升空间(HR@10=0.584),证实了跨智能体信号的存在。然而,在无泄漏的5折交叉验证协议下,硬选择的表现仍低于BM25(0.223 vs 0.254),且选择性地使用LLM升级并未改善性能。同样的协议对学习聚合给出了不同结果:其仅使用廉价智能体的变体在HR上匹配BM25,且NDCG点估计更高(0.123 vs 0.114),而门控的全智能体聚合在70.2% LLM调用下达到了HR@10=0.295。由此得出的教训并非路由问题已解决,而是在这种稀疏的固定候选集设置中,请求级别选择单个完整智能体列表过于粗糙;物品级别聚合是更具潜力的动作空间。

††copyright:none
††conference:第一届AI智能体索引、检索与排序研讨会;2026年7月24日;澳大利亚墨尔本
††booktitle:AgentSearch 2026:第一届AI智能体索引、检索与排序研讨会

## 1. 引言

近期研究探索了LLM作为推荐智能体的应用——包括零样本排序器(Hou等,2024 (https://arxiv.org/html/2607.09908#bib.bib10))、指令跟随器(Zhang等,2025 (https://arxiv.org/html/2607.09908#bib.bib31))以及工具使用者(Zhao等,2024 (https://arxiv.org/html/2607.09908#bib.bib32))。然而,LLM推理可能比传统推荐推理昂贵得多(Chen等,2023 (https://arxiv.org/html/2607.09908#bib.bib4);Ong等,2024 (https://arxiv.org/html/2607.09908#bib.bib19)),且LLM并非在所有场景下都优于廉价替代方案。对于具有丰富交互历史的热用户,传统推荐方法仍然具有竞争力(Kim等,2024 (https://arxiv.org/html/2607.09908#bib.bib14)),而综述文章则讨论了LLM在稀疏、跨领域以及面向解释的场景中可能具有的优势(Wu等,2024 (https://arxiv.org/html/2607.09908#bib.bib29);Li等,2024 (https://arxiv.org/html/2607.09908#bib.bib15))。

这一观察促使研究重点从“哪种单一模型最优?”转向“*哪个模型应该处理这个请求?*”——这一框架与经典算法选择(Rice,1976 (https://arxiv.org/html/2607.09908#bib.bib22))、推荐领域的元学习(Collins等,2018 (https://arxiv.org/html/2607.09908#bib.bib5);Cunha等,2018 (https://arxiv.org/html/2607.09908#bib.bib7);Santana等,2020 (https://arxiv.org/html/2607.09908#bib.bib24))以及LLM路由(Ong等,2024 (https://arxiv.org/html/2607.09908#bib.bib19);Shnitzer等,2023 (https://arxiv.org/html/2607.09908#bib.bib26))高度一致。

我们将*推荐智能体*作为一个操作性总称,指代任何具有排序列表接口、成本概况以及任务相关适用性的可调用推荐服务。因此,我们的智能体池包含四个廉价的传统推荐智能体和一个昂贵的LLM重排序智能体。该定义与智能体搜索场景相匹配,在此场景中,系统需要发现、比较并调用异构的可调用服务;它并不要求每个服务都是自主对话智能体。

我们通过RouteRec研究这一路由问题,这是一个针对五个推荐智能体进行逐实例决策的轻量级框架。RouteRec-Select将请求上下文与*廉价探针分歧*(一种可部署的廉价智能体输出差异度量)相结合,以选择一个廉价智能体并决定是否升级到LLM(图1 (https://arxiv.org/html/2607.09908#S1.F1))。由于硬选择返回来自单个智能体的完整列表,因此可能丢弃来自其他智能体的有用证据。因此,我们还评估了RouteRec-Stack,该变体使用可部署的物品级别排名和分数证据对智能体top- k 列表的并集进行重排序。

本文做出三项贡献。首先,我们将推荐智能体搜索建模为成本约束下的任务感知效用最大化问题,并使用5折交叉验证预测评估了每个可训练策略(第3 (https://arxiv.org/html/2607.09908#S3)–5 (https://arxiv.org/html/2607.09908#S5)节)。其次,我们将可部署信号与oracle标签分离,并表明尽管oracle提升空间很大,但请求级别选择的表现仍低于BM25(第6 (https://arxiv.org/html/2607.09908#S6)节)。第三,我们表明学习性的候选列表聚合能够恢复部分硬选择遗漏的跨智能体信号,这表明路由决策的单位是一个核心瓶颈(第8 (https://arxiv.org/html/2607.09908#S8)节)。

参照图注
图1. RouteRec-Select架构。一个请求被编码,并与廉价探针分歧特征结合,以选择最佳廉价智能体(阶段1)并决定是否升级到LLM重排序器(阶段2)。
系统架构图展示了双阶段RouteRec-Select路由流水线:请求编码、廉价探针分歧提取、阶段1廉价智能体选择以及阶段2 LLM升级门控。

## 2. 相关工作

#### LLM用于推荐

LLM推荐已从提示重写发展为微调和工具增强的系统。早期的提示研究评估ChatGPT作为通用推荐器的能力(Liu等,2023 (https://arxiv.org/html/2607.09908#bib.bib16))。P5将推荐任务转化为语言处理任务(Geng等,2022 (https://arxiv.org/html/2607.09908#bib.bib8))。TALLRec和InstructRec通过监督指令对LLM进行微调(Bao等,2023 (https://arxiv.org/html/2607.09908#bib.bib2);Zhang等,2025 (https://arxiv.org/html/2607.09908#bib.bib31)),而LLM-Rec则使用提示和文本增强(Lyu等,2024 (https://arxiv.org/html/2607.09908#bib.bib18))。LLMRank表明零样本LLM可以重排序候选集,但也暴露了位置和流行度偏差(Hou等,2024 (https://arxiv.org/html/2607.09908#bib.bib10))。ToolRec利用LLM操作推荐工具(Zhao等,2024 (https://arxiv.org/html/2607.09908#bib.bib32))。A-LLMRec将LLM与协同过滤信号结合,并报告在热用户场景中语义LLM方法可能弱于协同方法(Kim等,2024 (https://arxiv.org/html/2607.09908#bib.bib14))。综述文章同样强调了LLM推荐器的前景、成本、基础以及评估挑战(Wu等,2024 (https://arxiv.org/html/2607.09908#bib.bib29);Li等,2024 (https://arxiv.org/html/2607.09908#bib.bib15))。这些发现促使我们采用选择性而非通用性的LLM部署策略。

#### 混合推荐与算法选择

混合推荐器长期以来结合了异构证据来源,例如协同、基于内容和基于知识的信号(Burke,2002 (https://arxiv.org/html/2607.09908#bib.bib3))。更广泛的算法选择问题(Rice,1976 (https://arxiv.org/html/2607.09908#bib.bib22))形式化了“没有单一算法是普遍最优”的事实。在推荐领域,元学习研究根据观察到的数据集或请求特征选择算法(Cunha等,2018 (https://arxiv.org/html/2607.09908#bib.bib7);Collins等,2018 (https://arxiv.org/html/2607.09908#bib.bib5)),近期工作将其扩展到隐式反馈排序任务(Wegmeth等,2024 (https://arxiv.org/html/2607.09908#bib.bib27)),而上下文元赌博机则学习推荐系统上的在线策略(Santana等,2020 (https://arxiv.org/html/2607.09908#bib.bib24))。RouteRec遵循这一实例级别选择路线,但在严格的无泄漏协议下,研究了一个包含传统推荐智能体和LLM重排序智能体的成本感知池。

#### LLM路由与条件计算

混合专家模型(Jacobs等,1991 (https://arxiv.org/html/2607.09908#bib.bib11);Shazeer等,2017 (https://arxiv.org/html/2607.09908#bib.bib25))为条件计算提供了通用模板。在LLM服务方面,FrugalGPT(Chen等,2023 (https://arxiv.org/html/2607.09908#bib.bib4))、基于基准的路由(Shnitzer等,2023 (https://arxiv.org/html/2607.09908#bib.bib26))和RouteLLM(Ong等,2024 (https://arxiv.org/html/2607.09908#bib.bib19))在廉价和更强LLM之间学习成本-质量权衡。LLM-Blender(Jiang等,2023 (https://arxiv.org/html/2607.09908#bib.bib12))进一步表明,不同LLM可能在不同输入上表现更优,学习到的成对排名/融合可以利用这种多样性。RouteRec的不同之处在于,它在*不同的推荐家族*之间进行路由,而非仅仅在不同模型大小之间,并且在调用任何LLM之前依赖廉价推荐探针。

#### 排名融合与学习聚合

简单的排名融合方法,如倒数排名融合(Cormack等,2009 (https://arxiv.org/html/2607.09908#bib.bib6)),无需训练即可组合多个排序列表,而堆叠泛化(Wolpert,1992 (https://arxiv.org/html/2607.09908#bib.bib28))和排序学习方法(Liu,2009 (https://arxiv.org/html/2607.09908#bib.bib17))则基于候选特征训练二级评分器。我们的学习性候选列表聚合变体正是运用了这一思想,仅使用可部署的排名、分数、成员和流行度特征对推荐器 top- k 列表的并集进行评分。这一区别促使我们进行实证区分:请求级别的硬选择与物品级别的聚合。

## 3. 问题形式化

根据上述操作性定义,设 A = A C ∪ A E 为一组推荐智能体,划分为*廉价*(A C )和*昂贵*(A E )子集。对于一个包含用户上下文、候选物品以及可选自然语言指令的推荐请求 x ,每个智能体 a ∈ A 生成一个排序列表 π a ( x ),其准确度为 q ( x , a ),成本为 c ( a )。

由于一个可部署策略可能先运行多个诊断探针再返回最终排序列表,因此效用是在策略级别而非仅在所选智能体级别定义的:

(1) U ( x , π , S ) = α ⋅ NDCG ( x , π ) + β ⋅ HR ( x , π ) − λ ⋅ lat ( S ) − μ ⋅ tok ( S )

其中 α=1, β=0.5 加权质量,λ=μ=0.01 分别惩罚延迟和令牌成本。这里 S 是策略实际调用的智能体集合,lat ( S ) 是缓存的墙钟执行时间总和(以秒为单位),tok ( S ) 是输出令牌总数除以1000。对于 RouteRec-Select,S 包含诊断探针 SASRec、BPR-MF 和 BM25,以及当返回的智能体不是上述探针之一时包含该智能体;如果门控决定升级,则 S 还包含 LLM 重排序器。对于 RouteRec-StackCheap,S 是廉价智能体列表集合,而 StackAll 和 StackGate 则仅在调用全智能体堆叠时包含 LLM。每个实例的 oracle 行选择具有最高质量分数(α⋅NDCG + β⋅HR)的智能体,而门控和堆叠阈值则通过在相关验证集划分上的平均效用进行选择。表格中同时报告了 HR、NDCG、MRR 和 LLM 调用比例以增强可解释性。

硬选择的目标是学习一个路由策略 φ ( x ) ∈ A,最大化期望策略效用:

(2) max φ E x [ U ( x , φ ( x ) , S φ ( x ) ) ]

实现过程将这一策略目标进行分解,而非直接预测精确指标或校准效用。廉价选择器根据仅质量标签学习相对分数,并以请求、探针和智能体特征为条件;而升级门控则预测 LLM 策略是否具有比最佳廉价策略更高的成本感知效用。第4.7 (https://arxiv.org/html/2607.09908#S4.SS7) 节还研究了物品级别的松弛方案,该方案对来自智能体候选列表并集的候选进行评分,而非整体选择一个智能体。

## 4. 方法

图1 (https://arxiv.org/html/2607.09908#S1.F1) 展示了硬选择架构。RouteRec 有两种评估形式:RouteRec-Select,即双阶段请求级别路由器;以及 RouteRec-Stack,即候选列表聚合松弛方案。两者使用相同的智能体池和可部署的候选列表证据。

### 4.1. 智能体池

我们在 MovieLens-1M(Harper 和 Konstan,2015 (https://arxiv.org/html/2607.09908#bib.bib9))上实例化 |A|=5 个推荐智能体。Popularity 根据全局频率对物品排序,作为最廉价基线。BPR-MF(Rendle 等,2009 (https://arxiv.org/html/2607.09908#bib.bib21))是一个使用贝叶斯个性化排序损失训练的矩阵分解模型,捕获协同信号。SASRec(Kang 和 McAuley,2018 (https://arxiv.org/html/2607.09908#bib.bib13))是一个自注意力序列模型,用于短期偏好动态。BM25(Robertson 和 Zaragoza,2009 (https://arxiv.org/html/2607.09908#bib.bib23))在物品元数据上检索,使用电影标题字符串(包括原始年份,如果存在)和类型作为文档文本。LLM 重排序器使用 Qwen-2.5-7B-Instruct(Qwen Team,2024 (https://arxiv.org/html/2607.09908#bib.bib20))对来自 SASRec 种子的候选池中的前20个物品进行重排序,是昂贵的 LLM 重排序智能体(A E )。前四个是传统推荐智能体,构成 A C 。作为补充比较,第7.4 (https://arxiv.org/html/2607.09908#S7.SS4) 节将 Qwen 重排序器替换为 grok-4-1-fast-reasoning(xAI,2025 (https://arxiv.org/html/2607.09908#bib.bib30)),一个闭源推理模型,使用完全相同的提示和候选池构建。该智能体池有意多样化,涵盖基于流行度、协同、序列、基于内容和语言模型的范式。

### 4.2. 请求编码器

每个请求 x 由四个组中的16个特征表示。用户组包含历史长度、近因加权活动、平均事件间隔时间、类别熵、头部物品比例以及兴趣漂移(以近期与长期类型分布之间的余弦距离衡量)。候选组包含池大小、平均流行度、长尾比例以及候选集的类型多样性。任务组记录是否存在自然语言指令、查询长度、显式约束数量以及比较性措辞。实现保留两个系统特征槽用于延迟惩罚 λ 和令牌成本惩罚 μ。在当前实验中,这些偏好对所有请求是固定的,因此归一化后它们不提供有意义的逐请求信号;偏好条件路由留待未来工作。

所有连续特征进行 z 归一化。拼接后的特征向量通过一个2层MLP(16→32→32)并采用 ReLU 激活,生成请求嵌入 h x ∈ R^32。

### 4.3. 智能体能力编码器

我们使用一个12维手工设计的*能力向量* c a 表示每个智能体。它涵盖信号类型、实例

相似文章

τ-Rec:面向智能推荐系统的可验证基准

Hugging Face Daily Papers

τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。

从早期经验中学习智能体路由

arXiv cs.CL

本文介绍了 BoundaryRouter,这是一个无需训练的框架,通过根据早期经验将查询路由至轻量级推理或完整智能体执行来优化大型语言模型(LLM)智能体的使用。此外,本文还提出了 RouteBench,这是一个用于评估路由性能的基准,显示出在速度和准确率方面的显著提升。