标签
Arcee AI、Loka、AWS 和 Prime Intellect 使用强化学习对开放模型进行后训练,以提升科学工具使用和生物推理能力,在药物工具和 Gene Ontology 基准测试上取得了显著进展。
本文研究持续预训练、监督微调和强化学习等后训练阶段如何影响生物推理模型的泛化能力,发现这些阶段对域内和域外性能具有不同的影响。