后训练如何塑造生物学推理模型

Hugging Face Daily Papers 论文

摘要

本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。

用于生物学的科学推理模型将语言模型与在多模态生物数据(包括DNA、RNA和蛋白质)上训练的基础模型相结合。这些模型通过后训练构建,但每个阶段如何塑造推理和泛化能力仍知之甚少。我们研究后训练何时能提升性能以及何时会导致过度专业化。在基因组学、转录组学和蛋白质组学中,我们在控制主干网络、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)变化的情况下,训练并评估了超过100个生物推理模型,测量了域内(ID)和域外(OOD)性能。我们发现,每个后训练阶段以独特的方式重塑泛化,而非贡献均匀的提升。CPT通过将模型与生物语言对齐来改善下游性能。SFT持续提升域内性能,但导致域外性能过早达到峰值并随模型拟合训练分布而下降。当将RL应用于具有对齐奖励的强SFT检查点时,RL能提升域外性能并部分恢复泛化能力。这些结果表明,生物推理不会随着额外的监督或计算而单调提升。相反,性能取决于训练阶段的组合方式。在固定的后训练预算下,最强的ID-OOD权衡来自短暂的SFT、较大的RL分配以及各阶段的不对称适应能力。
查看原文
查看缓存全文

缓存时间: 2026/06/26 06:05

论文页面 - 后训练如何塑造生物推理模型

来源:https://huggingface.co/papers/2606.16517

摘要

生物推理模型中的后训练阶段对泛化能力产生不同影响:持续预训练使模型与生物语言对齐,监督微调提升域内性能但降低域外泛化能力,而强化学习应用于良好对齐的检查点时能恢复域外性能。

生物科学推理模型结合了语言模型(https://huggingface.co/papers?q=language%20models)和在多模态生物数据(https://huggingface.co/papers?q=multimodal%20biological%20data)(包括DNA、RNA和蛋白质)上训练的基础模型(https://huggingface.co/papers?q=foundation%20models)。这些模型通过后训练(https://huggingface.co/papers?q=post-training)构建,但每个阶段如何影响推理和泛化(https://huggingface.co/papers?q=generalization)仍不清楚。我们研究了后训练(https://huggingface.co/papers?q=post-training)何时提升性能、何时导致过度特化。在基因组学、转录组学和蛋白质领域,我们训练并评估了超过100个生物推理模型,在控制主干网络、持续预训练(https://huggingface.co/papers?q=continued%20pre-training)(CPT)、监督微调(https://huggingface.co/papers?q=supervised%20fine-tuning)(SFT)和强化学习(https://huggingface.co/papers?q=reinforcement%20learning)(RL)等变量下,测量域内(ID)和域外(OOD)性能。我们发现每个后训练(https://huggingface.co/papers?q=post-training)阶段都以不同方式重塑泛化(https://huggingface.co/papers?q=generalization),而非带来统一增益。CPT通过使模型与生物语言对齐来提升下游性能。SFT持续提高域内性能,但导致域外性能早期达到峰值后随模型拟合训练分布而下降。RL应用于具有对齐奖励的强SFT检查点时,能提升域外性能并部分恢复泛化(https://huggingface.co/papers?q=generalization)。这些结果表明,生物推理不会随着更多监督或计算量的增加而单调提升。相反,性能取决于训练阶段如何组合。在固定后训练(https://huggingface.co/papers?q=post-training)预算下,最佳的域内-域外权衡来自短时SFT、更大的RL分配,以及各阶段间不对称的适应能力。

查看arXiv页面(https://arxiv.org/abs/2606.16517)查看PDF(https://arxiv.org/pdf/2606.16517)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.16517)

在您的智能体中获取此论文:

hf papers read 2606.16517

没有最新的CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型1

ankur0050/nucleotide-transformer-v2-50m-genomicbenchmarks-ft 文本分类• 2天前更新 • 1 (https://huggingface.co/ankur0050/nucleotide-transformer-v2-50m-genomicbenchmarks-ft)

引用本论文的数据集0

暂无关联本论文的数据集

将arxiv.org/abs/2606.16517引用到数据集的README.md中以从本页面链接。

引用本论文的Space0

暂无关联本论文的Space

将arxiv.org/abs/2606.16517引用到Space的README.md中以从本页面链接。

包含本论文的收藏集0

暂无包含本论文的收藏集

将本论文添加到收藏集(https://huggingface.co/new-collection)中以从本页面链接。

相似文章

理解从预训练到后训练的推理

Hugging Face Daily Papers

本文研究了预训练选择(模型大小、数据)如何影响在推理任务上通过强化学习后训练的回报,使用国际象棋作为受控测试平台。研究发现,后训练性能可由预训练损失很好地预测,并且强化学习在简单谜题上放大正确走法,在困难谜题上揭示出正确走法,这些发现也迁移到数学领域。

重新审视后训练中的完整推理轨迹

Hugging Face Daily Papers

本文发现,在后训练期间,大型语言模型可以从截断的推理轨迹而非完整轨迹中获得推理改进,减少冗余的同时,有利于监督微调和强化学习等方法。

从预训练到后训练的推理理解

arXiv cs.CL

本文以国际象棋作为受控测试平台,研究了预训练与强化学习(RL)后训练之间的关系。它建立了连接预训练损失与后RL性能的缩放定律,并表明RL在简单谜题上放大了正确的走法,同时在困难谜题上浮现出新的正确走法。

RL后训练构建组合推理策略

arXiv cs.CL

本文研究强化学习后训练是否能够将原始技能组合成更高层次的组合策略,使用一个完全可观测的重写语法环境。作者发现,RL通过分阶段的组合机制重新组织原始能力,而拒绝微调则因产生大量无效的捷径式重写而停滞不前。