reward-prediction

标签

Cards List
#reward-prediction

DMRL:用于广告推荐中技能优化的文档介导强化学习

arXiv cs.LG · 2026-09-03 缓存

DMRL 是一种文档介导强化学习框架,通过结构化编辑动作、策略优化和长期奖励预测来优化广告推荐中的技能文档,并在大规模部署中展示了优于基线的性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈