τ-Rec:面向智能推荐系统的可验证基准
摘要
τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。
查看缓存全文
缓存时间: 2026/06/11 13:36
论文页面 - τ-Rec:面向智能推荐系统的可验证基准测试
来源:https://huggingface.co/papers/2606.10156
摘要
本文提出一个面向智能推荐系统(agentic recommender systems)的基准测试,利用可验证奖励和受控对话约束来评估对话智能体的可靠性,揭示了主流模型间存在显著性能差距。
随着推荐系统向智能化的多轮对话界面(https://huggingface.co/papers?q=conversational%20interfaces)转型,评估范式难以跟上步伐。当前基准测试常依赖“大模型作为评判者(https://huggingface.co/papers?q=LLM-as-a-judge)“的评估方式,这引入了主观性、高成本和不一致性。我们提出 τ-Rec,一个面向智能推荐系统(https://huggingface.co/papers?q=agentic%20recommender%20systems)的基准测试,它用可验证奖励替代主观评估,并引入一种带有揭示标签的诱导机制(https://huggingface.co/papers?q=reveal-tagged%20elicitation)(RTE),用于控制任务约束在对话中出现的方式。通过对智能体进行结构化目录谓词(https://huggingface.co/papers?q=structured%20catalog%20predicates)测试,并采用 pass^k 可靠性指标(https://huggingface.co/papers?q=pass%5Ek%20reliability%20metric),τ-Rec 为一致性推理提供了系统性测试。我们对来自五个模型族(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash、DeepSeek V4 Flash、Qwen3-32B 和 GPT-5 mini)的九种配置进行了评估,结果揭示了一个陡峭的可靠性悬崖:即使是最佳模型,在 pass^1 上也仅达到约57%,在 pass^4 上仅为约38%,这凸显了当前对话智能体部署中的关键差距。所有代码和数据均公开于 https://github.com/nbharaths/tau-rec。
查看 arXiv 页面(https://arxiv.org/abs/2606.10156)查看 PDF(https://arxiv.org/pdf/2606.10156)GitHub1(https://github.com/nbharaths/tau-rec)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10156)
在你的智能体中获取此论文:
hf papers read 2606.10156
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。
引用此论文的数据集1
nbharaths/tau-rec 查看器• 更新于约11小时前 • 120(https://huggingface.co/datasets/nbharaths/tau-rec)
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
RouteRec:推荐智能体选择与聚合的严格评估
RouteRec是一个用于在成本约束下评估请求级硬选择与项目级学习聚合异构推荐智能体(包括LLM重排序器)的框架。在MovieLens-1M上的实验表明,项目级聚合显著优于请求级选择。
共识与异议:群体推荐系统中主观偏好的动态LLM建模
本研究在人类调查数据上微调LLM,使其作为群体推荐系统的判断模型,动态选择聚合策略以最大化满意度和共识。一项用户研究验证了该方法与人类对公平性和满意度的感知相一致。
对话推荐系统中用户模拟的提示优化:一个多目标框架
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
基于预测驱动推理的统计可靠LLM排名评估
本文介绍了PRECISE,它是预测驱动推理(Prediction-Powered Inference)的一种扩展,将少量人工标注与大量LLM判断结合,以生成无偏且方差减小的排名评估指标(如Precision@K)估计。该方法在ESCI基准测试和实际生产环境的A/B测试中进行了验证,仅使用100个人工标注就正确识别出了最佳系统变体,并通过+407 bps的销售改进得到了确认。
MTR-Suite:一个用于评估和合成对话检索基准的框架
介绍MTR-Suite,一个用于评估和合成对话检索基准的统一框架,具备基于LLM的审计器、用于成本效益对话生成的多智能体流水线,以及一个具有高区分度的基准。