用于大型语言模型推理的自我博弈搜索蒸馏

Hugging Face Daily Papers 论文

摘要

本文介绍了Self-Play Search Distillation(SPSD)框架,该框架利用棋盘游戏中的自我博弈生成合成数据,以改进大型语言模型的推理能力,并在数学基准测试中展示了改进。

提高大型语言模型(LLMs)的推理能力需要高质量的数据,这些数据应揭示困难的决策、竞争性的替代方案及其后果。数据稀缺是由合成数据质量低和人工标注成本高驱动的。我们引入了Self-Play Search Distillation(SPSD),这是一个通过训练在棋盘游戏上的类似MuZero的网络的自我博弈来生成超人类合成数据的框架。SPSD使用可执行环境将搜索转化为结构化推理问题。在每个状态下,专家识别出首选决策、合理的替代方案、合理的对手回应和价值估计。通过将自我博弈搜索记录转化为超人类的思维链,我们使用环境基础的监督来训练LLMs。尽管仅使用自我博弈搜索记录进行训练,SPSD能够转移到未见过的数学问题上。在Qwen3-4B-Base上,它将六个数学基准测试的平均分从24.1提高到36.6,同时将保留游戏的胜率从15%提高到45%。SPSD提供了一种标注高效的方式来创建高质量合成数据,以改进LLMs在推理任务中的性能。
查看原文
查看缓存全文

缓存时间: 2026/09/30 04:23

论文页面 - 面向大语言模型推理的自博弈搜索蒸馏

来源:https://huggingface.co/papers/2609.30936

摘要

提升大语言模型(LLM)的推理能力需要能够揭示复杂决策、竞争性选项及其后果的高质量数据。数据稀缺性源于合成数据质量低下与人工标注的高昂成本。我们提出自博弈搜索蒸馏框架,通过在棋类游戏上训练类MuZero网络的自博弈过程,生成超人类水平的合成数据。该框架利用可执行环境将搜索过程转化为结构化推理问题:在每个状态下,专家网络会识别优选决策、合理备选方案、合理对手回应及价值评估。通过将自博弈搜索记录转化为超人类思维链,我们使用基于环境的真实监督来训练LLM。尽管仅在自博弈搜索记录上训练,SPSD仍能迁移到未见过的数学问题。在Qwen3-4B-Base模型上,该方法将六个数学基准的平均分从24.1提升至36.6,同时将预留游戏的胜率从15%提升至45%。SPSD为创建高质量合成数据提供了一种高效的标注方法,可用于提升LLM在推理任务中的表现。

查看 arXiv 页面 (https://arxiv.org/abs/2609.30936)
查看 PDF (https://arxiv.org/pdf/2609.30936)
项目页面 (https://lormolf.github.io/publications/spsd/)
添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.30936)

引用本文的模型 0

暂无模型链接本文

在模型 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。

引用本文的数据集 0

暂无数据集链接本文

在数据集 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。

引用本文的空间 0

暂无空间链接本文

在空间 README.md 中引用 arxiv.org/abs/2609.30936 即可从本页链接。

包含本文的收藏集 0

暂无收藏集包含本文

将本文添加到收藏集 (https://huggingface.co/new-collection) 即可从本页链接。

相似文章

SPADE:自适应合成可执行环境中的自我博弈

Hugging Face Daily Papers

SPADE 引入了一种针对语言模型的自我博弈强化学习框架,该框架生成自适应的可执行训练环境,以增强推理和工具使用能力,并在多个基准测试中展示了显著的性能提升。