data-strategy

标签

Cards List
#data-strategy

学习该学什么:面向小语言模型SFT-then-RL推理的分阶段专属数据集

arXiv cs.CL · 2026-06-04 缓存

本文提出了一种难度感知的SFT-then-RL框架,用于在推理任务上训练小语言模型(参数量≤3B),核心观点是数据难度应与SFT(学习新技能)和RL(巩固已有技能)各自的不同角色相匹配。作者为困难SFT样本引入了Bridge机制,并针对RL失败案例提出了Critique Fine-Tuning方法,在五个推理基准测试上均取得了一致性提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈