simulation-based-training

标签

Cards List
#simulation-based-training

TRACE:通过合成奖励训练用于因果探索的推理代理

arXiv cs.AI ↗ · 2026-09-11 缓存

TRACE提出一种基于模拟的方法,利用合成奖励训练用于因果探索的推理代理,提升诊断任务中的强化学习效果。实验表明,在数字广告诊断环境中,该方法优于提示基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈