PaperGym:以评分为中心的研究计划生成进化框架

Hugging Face Daily Papers 论文

摘要

PaperGym是一个框架,通过将研究问题与评估评分类分离,将科学论文转化为训练环境,使强化学习能够改进研究计划。它展示了优于现有方法的性能,训练后的模型在基准测试中优于更大的模型。

研究计划是AI科学家的决定性能力。然而,研究计划没有可验证的答案,因此强化学习缺乏其所需的环境:与评判者配对的任务。从科学论文中提取的评分标准可以提供评判者。然而,现有管道从相同内容中提取问题和标准,因此可以通过释义获得奖励。评分标准进一步被压缩为每次展开的单个标量。我们引入了PaperGym,一个统一的框架,将每篇研究论文转化为一个完整的训练环境。PaperGym利用论文的结构:问题从研究目标和背景中综合而来,而标准则来自方法和实验。标准涵盖方法论创新和实验设计,标准泄漏降至3.7%,而现有数据集为11.90%至34.10%。训练两次使用评分标准:首先作为OPSD自教师的特权上下文,然后作为GRPO的奖励。在Qwen3-1.7B/4B/8B上,该方案优于监督微调、单阶段或逆序,将五个基准平均分提高了+5.6、+5.0和+4.8分。在固定配方下,使用PaperGym-20k训练的模型在三方比较中赢得58.1%,而RubricHub Science为28.2%。训练后的Qwen3-8B在ResearchQA上达到73.48分,高于更大的Kimi K2.6。我们发布了管道、20,000个实例的语料库PaperGym-20k,以及基准测试PaperGym-Innov和PaperGym-Design。
查看原文
查看缓存全文

缓存时间: 2026/09/01 11:55

论文页面 - PaperGym:以评分为中心的科研计划生成进化

来源:https://huggingface.co/papers/2608.31119

摘要

PaperGym通过将科学论文转化为训练环境,实现研究问题与评估评分标准的分离,从而通过强化学习提升不同模型规模下的研究规划能力。

研究规划是AI科学家的决定性能力。然而,研究计划无法提供可验证的答案,因此强化学习(https://huggingface.co/papers?q=reinforcement%20learning)缺乏所需环境:即任务与评审机制的结合。从科学论文中提取的评分标准(Rubric)可以充当评审机制。但现有流程从相同内容中提取问题和标准,因此奖励可能通过简单复述获得。此外,评分标准(https://huggingface.co/papers?q=rubric)被压缩为每次实验的单一标量值。我们提出PaperGym(https://huggingface.co/papers?q=PaperGym),一个将每篇研究论文转化为完整训练环境的统一框架。PaperGym利用论文结构:问题由研究目标和背景综合生成,而标准则源自方法和实验部分。这些标准涵盖方法创新和实验设计,标准泄漏率(criterion leakage)降至3.7%,相比之下现有数据集为11.90%至34.10%。训练过程两次利用评分标准(https://huggingface.co/papers?q=rubric):首先作为OPSD(https://huggingface.co/papers?q=OPSD)自教师(self-teacher)的特权上下文,然后作为GRPO(https://huggingface.co/papers?q=GRPO)的奖励信号。在Qwen3-1.7B/4B/8B模型上,此训练方案优于监督微调、单独阶段训练及逆序训练,五项基准平均得分分别提升+5.6、+5.0和+4.8分。在固定实验设置下,使用PaperGym-20k(https://huggingface.co/papers?q=PaperGym-20k)训练的模型在三元对比中获胜率达58.1%,而RubricHub Science(https://huggingface.co/papers?q=Rubric)仅为28.2%。训练后的Qwen3-8B在ResearchQA(https://huggingface.co/papers?q=ResearchQA)上达到73.48分,超越规模远大的Kimi K2。我们开源了完整流程、包含20,000个实例的语料库PaperGym-20k(https://huggingface.co/papers?q=PaperGym-20k),以及基准测试PaperGym-Innov和PaperGym-Design。

查看arXiv页面 (https://arxiv.org/abs/2608.31119) 查看PDF (https://arxiv.org/pdf/2608.31119) 项目页面 (https://zju-real.github.io/PaperGym/) GitHub仓库 (https://github.com/ZJU-REAL/PaperGym) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31119)

获取此论文到您的智能体:

hf papers read 2608.31119

如未安装最新CLI:curl -LsSf https://hf.co/cli/install.sh | bash

引用本文的模型

CabbageWyh/PaperGym-Model 更新于约9小时前 • 2次引用 (https://huggingface.co/CabbageWyh/PaperGym-Model)

引用本文的数据集

CabbageWyh/PaperGym-Data 查看器 • 更新于约9小时前 • 22.4k • 38次引用 (https://huggingface.co/datasets/CabbageWyh/PaperGym-Data)

引用本文的Spaces

暂无链接到此论文的Space

在Space的README.md中引用arxiv.org/abs/2608.31119即可从本页面链接。

包含本文的收藏

暂无包含此论文的收藏

将本文添加至收藏 (https://huggingface.co/new-collection) 即可从本页面链接。

相似文章

RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习

Hugging Face Daily Papers

本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。

OpenAI Gym Beta

OpenAI Blog

OpenAI 发布了 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习算法的工具包,包含不断增长的环境套件和可复现研究的平台。该工具包旨在标准化强化学习基准,并为研究社区提供多样化、易于使用的环境。