reinforcement-fine-tuning

标签

Cards List
#reinforcement-fine-tuning

ReliableTableQA:可靠性标注需要多少监督?

arXiv cs.LG · 2026-07-24 缓存

介绍 ReliableTableQA,一个用于训练大语言模型标注表格问答结果统计可靠性的框架,展示了小规模 SFT 数据集就足够,且 GRPO 仅在 SFT 训练不足时有帮助。

0 人收藏 0 人点赞
#reinforcement-fine-tuning

利用强化微调克服视觉连续学习中的灾难性遗忘

Hugging Face Daily Papers · 2026-05-10 缓存

本文提出保留感知策略优化(RaPO),通过强化微调缓解视觉连续学习中的灾难性遗忘。RaPO采用轨迹级奖励塑形和跨任务优势归一化,缩小了类增量学习和域增量学习中强化微调与监督微调之间的差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈