用于大型语言模型推理的自我博弈搜索蒸馏
摘要
本文介绍了Self-Play Search Distillation(SPSD)框架,该框架利用棋盘游戏中的自我博弈生成合成数据,以改进大型语言模型的推理能力,并在数学基准测试中展示了改进。
查看缓存全文
缓存时间: 2026/09/30 04:23
论文页面 - 面向大语言模型推理的自博弈搜索蒸馏
来源:https://huggingface.co/papers/2609.30936
摘要
提升大语言模型(LLM)的推理能力需要能够揭示复杂决策、竞争性选项及其后果的高质量数据。数据稀缺性源于合成数据质量低下与人工标注的高昂成本。我们提出自博弈搜索蒸馏框架,通过在棋类游戏上训练类MuZero网络的自博弈过程,生成超人类水平的合成数据。该框架利用可执行环境将搜索过程转化为结构化推理问题:在每个状态下,专家网络会识别优选决策、合理备选方案、合理对手回应及价值评估。通过将自博弈搜索记录转化为超人类思维链,我们使用基于环境的真实监督来训练LLM。尽管仅在自博弈搜索记录上训练,SPSD仍能迁移到未见过的数学问题。在Qwen3-4B-Base模型上,该方法将六个数学基准的平均分从24.1提升至36.6,同时将预留游戏的胜率从15%提升至45%。SPSD为创建高质量合成数据提供了一种高效的标注方法,可用于提升LLM在推理任务中的表现。
查看 arXiv 页面 (https://arxiv.org/abs/2609.30936)
查看 PDF (https://arxiv.org/pdf/2609.30936)
项目页面 (https://lormolf.github.io/publications/spsd/)
添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.30936)
引用本文的模型 0
暂无模型链接本文
在模型 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。
引用本文的数据集 0
暂无数据集链接本文
在数据集 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。
引用本文的空间 0
暂无空间链接本文
在空间 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。
包含本文的收藏集 0
暂无收藏集包含本文
将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。
相似文章
用于大语言模型推理的 Self-Play Search Distillation
论文介绍了 Self-Play Search Distillation (SPSD),一个利用类似MuZero的网络进行自博弈的框架,用于生成超人类合成数据训练LLMs,显著提升了数学基准测试中的推理性能。
SPADE:自适应合成可执行环境中的自我博弈
SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。
dOPSD:扩散语言模型中的在线策略自蒸馏方法
本文介绍了 dOPSD,一种面向扩散语言模型的在线策略自蒸馏方法,该方法利用内部去噪轨迹来提升数学推理和代码生成能力。
SPARK:基于知识图谱的不对称奖励自博弈
本文介绍了 SPARK,这是一种自博弈强化学习框架,利用从科学文献中衍生出的知识图谱来提升视觉-语言模型的关系推理能力。
从强化学习角度看OPD:用于样本高效LLM推理的最小二乘策略蒸馏
介绍了最小二乘策略蒸馏(LSPD),一种基于强化学习的样本高效蒸馏方法,用于大语言模型,在数学推理基准测试中提升了性能。