BitTide
首页
最新
模型
工具
新闻
产品
论文
事件
今日日报
搜索
订阅
English
登录
retention-aware-policy-optimization
标签
Cards
List
#retention-aware-policy-optimization
利用强化微调克服视觉连续学习中的灾难性遗忘
Hugging Face Daily Papers
↗
· 2026-05-10
缓存
本文提出保留感知策略优化(RaPO),通过强化微调缓解视觉连续学习中的灾难性遗忘。RaPO采用轨迹级奖励塑形和跨任务优势归一化,缩小了类增量学习和域增量学习中强化微调与监督微调之间的差距。
0 人收藏
0 人点赞
← 返回首页
意见反馈
×
提交意见反馈
感谢您的反馈!
提交