标签
本文提出了用于个性化设备端行程生成的计划-学习-适应(PLA)框架,该框架将保证可行性的组合规划与通过 Bradley-Terry 奖励模型进行的人类偏好学习相结合。在实际部署中,该框架实现了行程完成率提升 91%,且延迟低,在可行性方面超过了前沿大语言模型。