τ-Rec:面向智能推荐系统的可验证基准

Hugging Face Daily Papers 论文

摘要

τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。

随着推荐系统向智能化、多轮对话式界面演进,评估范式一直难以跟上步伐。当前的基准测试通常依赖于“LLM-as-a-judge”评估,这种方式会引入主观性、高成本和不一致性。我们提出了τ-Rec,这是一个用于智能推荐系统的基准,它用可验证奖励和一种称为“展示标签引导(RTE)”的机制取代了主观评估,该机制控制任务约束在对话中呈现的方式。通过使用结构化目录谓词测试智能体,并采用pass^k可靠性指标,τ-Rec提供了一种系统性的测试来检验一致推理能力。我们对五个模型家族(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash、DeepSeek V4 Flash、Qwen3-32B和GPT-5 mini)的九种配置进行了评估,揭示了一个陡峭的可靠性悬崖:即便是表现最佳的模型,其pass^1也只有约57%,pass^4约为38%,这凸显了当前对话型智能体部署中的关键差距。所有代码和数据均在https://github.com/nbharaths/tau-rec上公开提供。
查看原文
查看缓存全文

缓存时间: 2026/06/11 13:36

论文页面 - τ-Rec:面向智能推荐系统的可验证基准测试

来源:https://huggingface.co/papers/2606.10156

摘要

本文提出一个面向智能推荐系统(agentic recommender systems)的基准测试,利用可验证奖励和受控对话约束来评估对话智能体的可靠性,揭示了主流模型间存在显著性能差距。

随着推荐系统向智能化的多轮对话界面(https://huggingface.co/papers?q=conversational%20interfaces)转型,评估范式难以跟上步伐。当前基准测试常依赖“大模型作为评判者(https://huggingface.co/papers?q=LLM-as-a-judge)“的评估方式,这引入了主观性、高成本和不一致性。我们提出 τ-Rec,一个面向智能推荐系统(https://huggingface.co/papers?q=agentic%20recommender%20systems)的基准测试,它用可验证奖励替代主观评估,并引入一种带有揭示标签的诱导机制(https://huggingface.co/papers?q=reveal-tagged%20elicitation)(RTE),用于控制任务约束在对话中出现的方式。通过对智能体进行结构化目录谓词(https://huggingface.co/papers?q=structured%20catalog%20predicates)测试,并采用 pass^k 可靠性指标(https://huggingface.co/papers?q=pass%5Ek%20reliability%20metric),τ-Rec 为一致性推理提供了系统性测试。我们对来自五个模型族(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash、DeepSeek V4 Flash、Qwen3-32B 和 GPT-5 mini)的九种配置进行了评估,结果揭示了一个陡峭的可靠性悬崖:即使是最佳模型,在 pass^1 上也仅达到约57%,在 pass^4 上仅为约38%,这凸显了当前对话智能体部署中的关键差距。所有代码和数据均公开于 https://github.com/nbharaths/tau-rec。

查看 arXiv 页面(https://arxiv.org/abs/2606.10156)查看 PDF(https://arxiv.org/pdf/2606.10156)GitHub1(https://github.com/nbharaths/tau-rec)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10156)

在你的智能体中获取此论文:

hf papers read 2606.10156

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型0

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。

引用此论文的数据集1

nbharaths/tau-rec 查看器• 更新于约11小时前 • 120(https://huggingface.co/datasets/nbharaths/tau-rec)

引用此论文的 Space0

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。

相似文章

RouteRec:推荐智能体选择与聚合的严格评估

arXiv cs.CL

RouteRec是一个用于在成本约束下评估请求级硬选择与项目级学习聚合异构推荐智能体(包括LLM重排序器)的框架。在MovieLens-1M上的实验表明,项目级聚合显著优于请求级选择。

基于预测驱动推理的统计可靠LLM排名评估

arXiv cs.LG

本文介绍了PRECISE,它是预测驱动推理(Prediction-Powered Inference)的一种扩展,将少量人工标注与大量LLM判断结合,以生成无偏且方差减小的排名评估指标(如Precision@K)估计。该方法在ESCI基准测试和实际生产环境的A/B测试中进行了验证,仅使用100个人工标注就正确识别出了最佳系统变体,并通过+407 bps的销售改进得到了确认。