PaperGym:以评分为中心的研究计划生成进化框架
摘要
PaperGym是一个框架,通过将研究问题与评估评分类分离,将科学论文转化为训练环境,使强化学习能够改进研究计划。它展示了优于现有方法的性能,训练后的模型在基准测试中优于更大的模型。
查看缓存全文
缓存时间: 2026/09/01 11:55
论文页面 - PaperGym:以评分为中心的科研计划生成进化
来源:https://huggingface.co/papers/2608.31119
摘要
PaperGym通过将科学论文转化为训练环境,实现研究问题与评估评分标准的分离,从而通过强化学习提升不同模型规模下的研究规划能力。
研究规划是AI科学家的决定性能力。然而,研究计划无法提供可验证的答案,因此强化学习(https://huggingface.co/papers?q=reinforcement%20learning)缺乏所需环境:即任务与评审机制的结合。从科学论文中提取的评分标准(Rubric)可以充当评审机制。但现有流程从相同内容中提取问题和标准,因此奖励可能通过简单复述获得。此外,评分标准(https://huggingface.co/papers?q=rubric)被压缩为每次实验的单一标量值。我们提出PaperGym(https://huggingface.co/papers?q=PaperGym),一个将每篇研究论文转化为完整训练环境的统一框架。PaperGym利用论文结构:问题由研究目标和背景综合生成,而标准则源自方法和实验部分。这些标准涵盖方法创新和实验设计,标准泄漏率(criterion leakage)降至3.7%,相比之下现有数据集为11.90%至34.10%。训练过程两次利用评分标准(https://huggingface.co/papers?q=rubric):首先作为OPSD(https://huggingface.co/papers?q=OPSD)自教师(self-teacher)的特权上下文,然后作为GRPO(https://huggingface.co/papers?q=GRPO)的奖励信号。在Qwen3-1.7B/4B/8B模型上,此训练方案优于监督微调、单独阶段训练及逆序训练,五项基准平均得分分别提升+5.6、+5.0和+4.8分。在固定实验设置下,使用PaperGym-20k(https://huggingface.co/papers?q=PaperGym-20k)训练的模型在三元对比中获胜率达58.1%,而RubricHub Science(https://huggingface.co/papers?q=Rubric)仅为28.2%。训练后的Qwen3-8B在ResearchQA(https://huggingface.co/papers?q=ResearchQA)上达到73.48分,超越规模远大的Kimi K2。我们开源了完整流程、包含20,000个实例的语料库PaperGym-20k(https://huggingface.co/papers?q=PaperGym-20k),以及基准测试PaperGym-Innov和PaperGym-Design。
查看arXiv页面 (https://arxiv.org/abs/2608.31119) 查看PDF (https://arxiv.org/pdf/2608.31119) 项目页面 (https://zju-real.github.io/PaperGym/) GitHub仓库 (https://github.com/ZJU-REAL/PaperGym) 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.31119)
获取此论文到您的智能体:
hf papers read 2608.31119
如未安装最新CLI:curl -LsSf https://hf.co/cli/install.sh | bash
引用本文的模型
CabbageWyh/PaperGym-Model 更新于约9小时前 • 2次引用 (https://huggingface.co/CabbageWyh/PaperGym-Model)
引用本文的数据集
CabbageWyh/PaperGym-Data 查看器 • 更新于约9小时前 • 22.4k • 38次引用 (https://huggingface.co/datasets/CabbageWyh/PaperGym-Data)
引用本文的Spaces
暂无链接到此论文的Space
在Space的README.md中引用arxiv.org/abs/2608.31119即可从本页面链接。
包含本文的收藏
暂无包含此论文的收藏
将本文添加至收藏 (https://huggingface.co/new-collection) 即可从本页面链接。
相似文章
RubricEM:基于量规引导策略分解,超越可验证奖励的元强化学习
本文介绍了 RubricEM,这是一个强化学习框架,它利用量规引导的策略分解和基于反思的元策略进化,为长篇任务训练深度研究智能体。所得到的 RubricEM-8B 模型通过利用阶段感知规划和更密集的语义反馈,在长篇研究基准测试中表现出强劲的性能。
RubricsTree:跨健康记忆与医疗技能的个人健康智能体可扩展且不断演进的开放式评估
RubricsTree 提出了一种可扩展且与专家对齐的个人健康智能体评估框架,使用超过100个原子布尔规则,在Gemini、GPT和Qwen模型系列的HealthBench上实现了高达66%的相对提升。
在改进之前学习评估:自动研究代理的自动评分标准归纳
AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。
EvoPolicyGym:在交互环境中评估自主策略进化
EvoPolicyGym 是一个基准测试,用于评估自主智能体如何通过交互环境中的反馈迭代改进策略,其中 GPT-5.5 取得了最佳性能。
OpenAI Gym Beta
OpenAI 发布了 OpenAI Gym 公开测试版,这是一个用于开发和比较强化学习算法的工具包,包含不断增长的环境套件和可复现研究的平台。该工具包旨在标准化强化学习基准,并为研究社区提供多样化、易于使用的环境。