retention-aware-policy-optimization

标签

Cards List
#retention-aware-policy-optimization

利用强化微调克服视觉连续学习中的灾难性遗忘

Hugging Face Daily Papers · 2026-05-10 缓存

本文提出保留感知策略优化(RaPO),通过强化微调缓解视觉连续学习中的灾难性遗忘。RaPO采用轨迹级奖励塑形和跨任务优势归一化,缩小了类增量学习和域增量学习中强化微调与监督微调之间的差距。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈