后训练语言模型在编程竞赛中实现金牌级表现
摘要
本文介绍了一种针对编程竞赛金牌表现的语言模型后训练专用化流程,通过监督微调和强化学习等技术,在IOI基准测试中取得高分。
查看缓存全文
缓存时间: 2026/09/03 03:50
论文页面 - 通过后训练实现编码竞赛金牌水平的语言模型
来源:https://huggingface.co/papers/2609.02849
摘要
一个结合精选题目、合成推理轨迹、监督微调与强化学习的专项训练流程,训练出的竞赛编程模型通过迭代式测试时优化,在IOI基准测试中超越了顶尖人类选手的分数。
竞赛编程已成为检验大语言模型推理能力的关键测试,其中IOI和ICPC等国际竞赛代表着最具挑战性的场景。我们提出一个端到端的专项训练流程,结合大规模题目筛选、合成推理轨迹(https://huggingface.co/papers?q=synthetic%20reasoning%20traces)、监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)与强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)。使用22,000道精选题目,我们通过SFT和RL训练了Nemotron-3-Nano-CC (30B-A3B),并通过仅SFT训练了Nemotron-3-Ultra-CC (550B-A55B)。我们进一步引入GenCorrect(https://huggingface.co/papers?q=GenCorrect)——一种反馈驱动的测试时计算(https://huggingface.co/papers?q=test-time%20compute)策略,能迭代生成、评估和优化多种解决方案。在IOI 2025中,Nano-CC在后训练后得分从130分提升至291分,使用GenCorrect(https://huggingface.co/papers?q=GenCorrect)后更达到468分,超越了438.3分的金牌线,而Ultra-CC则达到502分。基于这些成果,我们开发了竞赛专用的Ultra-CC系统,并在IOI 2026期间进行了前瞻性评估。在与人类选手相同的时间限制、网络访问权限和提交限制条件下,该系统在600分满分中获得535.4分,同时超越了361.12分的金牌线和498.27分的人类最高分。据我们所知,这是首个在IOI题目集上超越最高分人类选手的人工智能系统。
查看arXiv页面 (https://arxiv.org/abs/2609.02849) 查看PDF (https://arxiv.org/pdf/2609.02849) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.02849)
通过智能助手获取本文:
hf papers read 2609\.02849
未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型
无模型关联本文
在模型的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。
引用本文的数据集
无数据集关联本文
在数据集的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。
引用本文的Space
无Space关联本文
在Space的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。
包含本文的收藏
无收藏包含本文
将本文添加至收藏 (https://huggingface.co/new-collection) 以在此页面建立链接。
相似文章
解密语言模型的强化学习后训练
本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。
后训练能否使LLM成为优秀的医疗编码员?生成式ICD编码的实证研究
这项实证研究探讨了后训练(监督微调和强化学习)能否提升LLM在自动化ICD编码上的表现,引入了一种名为PHI的诊断课程,扩展了GRPO以改进遗漏编码案例。结果表明,仅使用提示评估低估了LLM的潜力,SFT提供了主要的能力跃升,而RL进一步提升了性能。
TALAN:面向大语言模型定向后训练的任务对齐潜在自适应网络
TALAN 引入了一种序列条件潜在侧路径,用于大语言模型的定向后训练,在 STEM/代码基准上以最小的开销实现了显著改进。
可检测性边缘的后训练:一种博弈论驱动的微调方法
本文介绍了一种博弈论的微调语言模型方法,该方法优化了奖励与偏离参考策略之间的权衡,并提供了一种设置KL正则化系数的原则性方法。
利用自生成数据的中期训练提升语言模型中的强化学习
本文提出在强化学习之前,对语言模型进行基于自生成多样化推理轨迹的中期训练,通过让模型接触多种有效的解题方法,展示了在数学基准测试上强化学习性能的提升。