标签
本文认为,智能体应帮助用户构建偏好,而非假设用户已有完善偏好,并提出了CoPref模型和CoShop基准。评估显示,即使是前沿模型,由于偏好扩展不足,准确率也仅为56%。
ScaleToT提出了一种方法,旨在将结构化LLM推理泛化到十亿级低活跃用户建模中,通过思维树(ToT)精炼和训练学生模型来降低成本。在广告部署中的在线A/B测试显示,LT30提升了6.738%。
ThoughtTrace 引入了一个大规模数据集,将真实世界的多轮人机对话与用户的自我报告想法配对,通过想法引导的重写来改进用户行为预测和个性化助手训练。
IPQA引入了一个用于评估个性化问答中核心意图识别的基准,解决了现有指标仅关注响应质量而非意图理解的空白。论文提出了一种基于有界理性的数据集构建方法,并证明最先进的语言模型在从答案选择模式中识别用户优先意图时存在困难。