标签
本文实证研究了使用非对话信号生成的合成数据自举对话推荐系统,证明了在低资源环境下,其性能优于零样本和稀缺真实数据方法。
LURE引入了一种用于LLM推理的零数据自我对弈框架,该框架使用追逐-逃避游戏来动态调整任务难度并提供密集奖励,在多种环境中超越基线。