标签
本文介绍了偏好树优化(PTO)框架,该框架通过前瞻模拟生成偏好数据,以迭代改进目标导向对话代理。实验表明,在动机访谈场景中取得了性能提升。
本文提出UP-NRPA,一种在线框架,将用户画像与基于大语言模型的嵌套展开策略自适应相结合,无需离线训练即可动态定制对话策略,在多个对话任务上实现了100%的成功率。