面向决策的推荐重排序:一项关于 Jev 的实证研究

Hugging Face Daily Papers 论文

摘要

本文对 Jev 这一面向决策的“系统一模型”(System One Model)在个性化推荐重排序中的表现进行了实证研究,发现与推荐专用模型以及逐点式(pointwise)和列表式(listwise)大语言模型重排序器相比,它在多个领域和候选集规模下占据了截然不同的质量—延迟运行区间。

大语言模型(LLMs)在推荐重排序方面展现出了良好的应用前景,但其引入也带来了推荐质量与服务效率之间的重要权衡。我们研究了当重排序任务本质上是在预定义候选项目之间进行结构化选择时,面向决策的模型能否提供一个有价值的替代方案。具体而言,我们对被 TypeSafe AI 描述为“系统一模型”(System One Model)的 Jev 在个性化推荐重排序中的表现进行了受控实证研究,并在多个 Amazon Reviews 领域和不同候选集规模下,将其与推荐专用模型以及逐点式(pointwise)和列表式(listwise)Qwen 重排序器进行了对比,同时评估了推荐效果和实测服务延迟。结果表明,相对于所评估的基线方法,Jev 保持了较强的推荐效果,并且其延迟增长远比逐点式 Qwen 重排序器平缓得多,尽管其实测服务延迟仍显著高于推荐专用模型。这些特性共同将 Jev 置于一个跨越不同候选规模和领域的独特质量—延迟运行区间。这些发现为进一步探索面向决策的模型在推荐及其他输出空间具有结构化特征的排序任务中的应用提供了依据。
查看原文
查看缓存全文

缓存时间: 2026/10/01 04:20

论文页面 - 面向决策的推荐重排序:Jev 的实证研究

来源:https://huggingface.co/papers/2609.40241

面向决策的模型能否比通用 LLM 更适合推荐重排序?

在这项工作中,我们研究了 Jev——一种面向决策的“系统一模型(System One Model)“——在个性化推荐重排序中的表现。在多个领域和候选集规模的实验中,我们发现与推荐专用模型以及 pointwise/listwise LLM 重排序器相比,Jev 占据了一个截然不同的质量-延迟运行区间。

我们希望这项研究能引发更多关于面向决策的模型在推荐及其他结构化排序任务中应用的讨论。期待听到你的想法!

相似文章

Jeeves:推理改进类Jev决策模型

Hacker News Top

Jeeves是一个9B参数的推理增强类Jev决策模型,采用扩散起草器,与先前的模型如Kev和Jev相比,在域外基准测试上实现了更高的准确性。