后训练如何塑造生物学推理模型
摘要
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。
查看缓存全文
缓存时间: 2026/06/26 06:05
论文页面 - 后训练如何塑造生物推理模型
来源:https://huggingface.co/papers/2606.16517
摘要
生物推理模型中的后训练阶段对泛化能力产生不同影响:持续预训练使模型与生物语言对齐,监督微调提升域内性能但降低域外泛化能力,而强化学习应用于良好对齐的检查点时能恢复域外性能。
生物科学推理模型结合了语言模型(https://huggingface.co/papers?q=language%20models)和在多模态生物数据(https://huggingface.co/papers?q=multimodal%20biological%20data)(包括DNA、RNA和蛋白质)上训练的基础模型(https://huggingface.co/papers?q=foundation%20models)。这些模型通过后训练(https://huggingface.co/papers?q=post-training)构建,但每个阶段如何影响推理和泛化(https://huggingface.co/papers?q=generalization)仍不清楚。我们研究了后训练(https://huggingface.co/papers?q=post-training)何时提升性能、何时导致过度特化。在基因组学、转录组学和蛋白质领域,我们训练并评估了超过100个生物推理模型,在控制主干网络、持续预训练(https://huggingface.co/papers?q=continued%20pre-training)(CPT)、监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)等变量下,测量域内(ID)和域外(OOD)性能。我们发现每个后训练(https://huggingface.co/papers?q=post-training)阶段都以不同方式重塑泛化(https://huggingface.co/papers?q=generalization),而非带来统一增益。CPT通过使模型与生物语言对齐来提升下游性能。SFT持续提高域内性能,但导致域外性能早期达到峰值后随模型拟合训练分布而下降。RL应用于具有对齐奖励的强SFT检查点时,能提升域外性能并部分恢复泛化(https://huggingface.co/papers?q=generalization)。这些结果表明,生物推理不会随着更多监督或计算量的增加而单调提升。相反,性能取决于训练阶段如何组合。在固定后训练(https://huggingface.co/papers?q=post-training)预算下,最佳的域内-域外权衡来自短时SFT、更大的RL分配,以及各阶段间不对称的适应能力。
查看arXiv页面(https://arxiv.org/abs/2606.16517)查看PDF(https://arxiv.org/pdf/2606.16517)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16517)
在您的智能体中获取此论文:
hf papers read 2606.16517
没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型1
ankur0050/nucleotide-transformer-v2-50m-genomicbenchmarks-ft 文本分类• 2天前更新 • 1 (https://huggingface.co/ankur0050/nucleotide-transformer-v2-50m-genomicbenchmarks-ft)
引用本论文的数据集0
暂无关联本论文的数据集
将arxiv.org/abs/2606.16517引用到数据集的README.md中以从本页面链接。
引用本论文的Space0
暂无关联本论文的Space
将arxiv.org/abs/2606.16517引用到Space的README.md中以从本页面链接。
包含本论文的收藏集0
暂无包含本论文的收藏集
将本论文添加到收藏集(https://huggingface.co/new-collection)中以从本页面链接。
相似文章
理解从预训练到后训练的推理
本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。
重新审视后训练中的完整推理轨迹
本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。
从预训练到后训练的推理理解
本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。
@rohanpaul_ai: 一篇关于推理模型训练后如何改进的入门论文 表明更好的推理模型较少依赖原始……
这篇入门论文探讨了推理模型在训练后如何改进,认为有效的推理数据更多地依赖于可检查的训练证据而非原始数据量。它根据验证方法对推理数据进行分类,并强调保留混乱的智能体数据以获取学习信号。
RL后训练构建组合推理策略
本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。