reward-sparsity

标签

Cards List
#reward-sparsity

AdaKP:面向推理的强化学习的在线自适应知识点选择

arXiv cs.AI · 2026-07-29 缓存

介绍了AdaKP,一种在线自适应知识点选择器,能够在强化学习训练过程中动态重新选择注入哪些原子提示,以缓解推理任务中的奖励稀疏问题,在竞赛级数学基准上取得了改进,且开销可忽略不计。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈