后训练语言模型在编程竞赛中实现金牌级表现

Hugging Face Daily Papers 论文

摘要

本文介绍了一种针对编程竞赛金牌表现的语言模型后训练专用化流程,通过监督微调和强化学习等技术,在IOI基准测试中取得高分。

竞赛编程已成为测试大型语言模型推理能力的关键领域,国际竞赛如IOI和ICPC代表着最具挑战性的场景。我们提出了一种端到端的专用化流程,结合大规模问题筛选、合成推理轨迹、监督微调(SFT)和强化学习(RL)。使用22,000个筛选过的问题,我们采用SFT和RL训练Nemotron-3-Nano-CC(30B-A3B),并单独使用SFT训练Nemotron-3-Ultra-CC(550B-A55B)。我们进一步引入GenCorrect,一种反馈驱动的测试时计算策略,它迭代地生成、评估和优化多种解决方案。在IOI 2025上,Nano-CC在后训练后从130分提高到291分,加上GenCorrect后达到468分,超过金牌阈值438.3分,而Ultra-CC达到502分。在这些结果的指导下,我们开发了一个针对竞赛的Ultra-CC系统,并在IOI 2026期间前瞻性地评估它。在与人类参赛者相同的时间、网络访问和提交限制下,它得到535.4分(满分600分),超过金牌阈值361.12分和人类最高分498.27分。据我们所知,这是第一个在IOI问题集上得分超过最高分人类参赛者的AI系统。
查看原文
查看缓存全文

缓存时间: 2026/09/03 03:50

论文页面 - 通过后训练实现编码竞赛金牌水平的语言模型

来源:https://huggingface.co/papers/2609.02849

摘要

一个结合精选题目、合成推理轨迹、监督微调与强化学习的专项训练流程,训练出的竞赛编程模型通过迭代式测试时优化,在IOI基准测试中超越了顶尖人类选手的分数。

竞赛编程已成为检验大语言模型推理能力的关键测试,其中IOI和ICPC等国际竞赛代表着最具挑战性的场景。我们提出一个端到端的专项训练流程,结合大规模题目筛选、合成推理轨迹(https://huggingface.co/papers?q=synthetic%20reasoning%20traces)、监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)与强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)。使用22,000道精选题目,我们通过SFT和RL训练了Nemotron-3-Nano-CC (30B-A3B),并通过仅SFT训练了Nemotron-3-Ultra-CC (550B-A55B)。我们进一步引入GenCorrect(https://huggingface.co/papers?q=GenCorrect)——一种反馈驱动的测试时计算(https://huggingface.co/papers?q=test-time%20compute)策略,能迭代生成、评估和优化多种解决方案。在IOI 2025中,Nano-CC在后训练后得分从130分提升至291分,使用GenCorrect(https://huggingface.co/papers?q=GenCorrect)后更达到468分,超越了438.3分的金牌线,而Ultra-CC则达到502分。基于这些成果,我们开发了竞赛专用的Ultra-CC系统,并在IOI 2026期间进行了前瞻性评估。在与人类选手相同的时间限制、网络访问权限和提交限制条件下,该系统在600分满分中获得535.4分,同时超越了361.12分的金牌线和498.27分的人类最高分。据我们所知,这是首个在IOI题目集上超越最高分人类选手的人工智能系统。

查看arXiv页面 (https://arxiv.org/abs/2609.02849) 查看PDF (https://arxiv.org/pdf/2609.02849) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.02849)

通过智能助手获取本文:

hf papers read 2609\.02849

未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型

无模型关联本文

在模型的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。

引用本文的数据集

无数据集关联本文

在数据集的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。

引用本文的Space

无Space关联本文

在Space的README.md中引用 arxiv.org/abs/2609.02849 以在此页面建立链接。

包含本文的收藏

无收藏包含本文

将本文添加至收藏 (https://huggingface.co/new-collection) 以在此页面建立链接。

相似文章

解密语言模型的强化学习后训练

arXiv cs.LG

本文剖析了大型语言模型的强化学习后训练算法,探讨了基础模型分布、奖励信号粒度和提示多样性如何影响后训练结果。

后训练能否使LLM成为优秀的医疗编码员?生成式ICD编码的实证研究

arXiv cs.CL

这项实证研究探讨了后训练(监督微调和强化学习)能否提升LLM在自动化ICD编码上的表现,引入了一种名为PHI的诊断课程,扩展了GRPO以改进遗漏编码案例。结果表明,仅使用提示评估低估了LLM的潜力,SFT提供了主要的能力跃升,而RL进一步提升了性能。