Tag
This paper presents an empirical study on bootstrapping conversational recommender systems using synthetic data generated from non-conversational signals, demonstrating that it outperforms zero-shot and scarce real-data methods in low-resource settings.
LURE introduces a zero-data self-play framework for LLM reasoning that uses a pursuit-evasion game to dynamically adjust task difficulty and provide dense rewards, outperforming baselines across multiple environments.