τ-Rec:面向智能推荐系统的可验证基准
摘要
τ-Rec是一个用于智能推荐系统的可验证基准,它用可验证奖励和控制对话约束取代了主观的LLM-as-a-judge评估,揭示了主流模型存在陡峭的可靠性悬崖——即便是表现最佳的模型,其pass@1也仅有约57%。
查看缓存全文
缓存时间: 2026/06/11 13:36
论文页面 - τ-Rec:面向智能推荐系统的可验证基准测试
来源:https://huggingface.co/papers/2606.10156
摘要
本文提出一个面向智能推荐系统(agentic recommender systems)的基准测试,利用可验证奖励和受控对话约束来评估对话智能体的可靠性,揭示了主流模型间存在显著性能差距。
随着推荐系统向智能化的多轮对话界面(https://huggingface.co/papers?q=conversational%20interfaces)转型,评估范式难以跟上步伐。当前基准测试常依赖“大模型作为评判者(https://huggingface.co/papers?q=LLM-as-a-judge)“的评估方式,这引入了主观性、高成本和不一致性。我们提出 τ-Rec,一个面向智能推荐系统(https://huggingface.co/papers?q=agentic%20recommender%20systems)的基准测试,它用可验证奖励替代主观评估,并引入一种带有揭示标签的诱导机制(https://huggingface.co/papers?q=reveal-tagged%20elicitation)(RTE),用于控制任务约束在对话中出现的方式。通过对智能体进行结构化目录谓词(https://huggingface.co/papers?q=structured%20catalog%20predicates)测试,并采用 pass^k 可靠性指标(https://huggingface.co/papers?q=pass%5Ek%20reliability%20metric),τ-Rec 为一致性推理提供了系统性测试。我们对来自五个模型族(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash、DeepSeek V4 Flash、Qwen3-32B 和 GPT-5 mini)的九种配置进行了评估,结果揭示了一个陡峭的可靠性悬崖:即使是最佳模型,在 pass^1 上也仅达到约57%,在 pass^4 上仅为约38%,这凸显了当前对话智能体部署中的关键差距。所有代码和数据均公开于 https://github.com/nbharaths/tau-rec。
查看 arXiv 页面(https://arxiv.org/abs/2606.10156)查看 PDF(https://arxiv.org/pdf/2606.10156)GitHub1(https://github.com/nbharaths/tau-rec)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.10156)
在你的智能体中获取此论文:
hf papers read 2606.10156
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。
引用此论文的数据集1
nbharaths/tau-rec 查看器• 更新于约11小时前 • 120(https://huggingface.co/datasets/nbharaths/tau-rec)
引用此论文的 Space0
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.10156 即可从此页面链接。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到一个收藏集(https://huggingface.co/new-collection)即可从此页面链接。
相似文章
RouteRec:推荐智能体选择与聚合的严格评估
RouteRec是一个用于在成本约束下评估请求级硬选择与项目级学习聚合异构推荐智能体(包括LLM重排序器)的框架。在MovieLens-1M上的实验表明,项目级聚合显著优于请求级选择。
RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle
This paper presents RecSys Factory, an LLM-agent platform deployed at Tencent that confines agent autonomy to decision points rather than full pipelines, balancing autonomy, determinism, and efficiency across three industrial recommender business lines.
Auto-RecSys:利用自主研究代理实现工业级推荐系统
Auto-RecSys 是一个自主研究系统,用于自动化工业级推荐模型的长期实验,通过分布式执行、集中式记忆和认知程序分离来提高效率和可靠性。
RecHarness:面向自进化推荐系统的Bandit路由智能体框架
RecHarness是一个bandit路由的智能体框架,通过将方向选择与假设生成分离来自动化推荐模型优化,在在线A/B测试中实现了稳定的改进和显著收益。
从提示到行为对齐:用于推荐评估的个性化LLM评判器
本文介绍了用于推荐评估的个性化LLM评判器的行为对齐框架,解决了双向合理化问题——即现成的LLM对同一项目既能论证用户参与的正向结果,也能论证负向结果。通过微调和偏好优化,该方法相比零样本基线在Macro-F1上提升了32.19%,并达到了生产环境中基于特征工程的基线水平。