标签
论文介绍了 Self-Play Search Distillation (SPSD),一个利用类似MuZero的网络进行自博弈的框架,用于生成超人类合成数据训练LLMs,显著提升了数学基准测试中的推理性能。
本文介绍了Self-Play Search Distillation(SPSD)框架,该框架利用棋盘游戏中的自我博弈生成合成数据,以改进大型语言模型的推理能力,并在数学基准测试中展示了改进。