strategic-dialogue

标签

Cards List
#strategic-dialogue

IB-RL:面向策略性对话智能体的隔离式双边强化学习

arXiv cs.AI · 2026-08-10 缓存

本文提出隔离双边强化学习(IB-RL),该方法让两个对话角色通过联合采样轨迹共同演化,同时各自独立优化自身奖励。该方法解决了策略性对话中强化学习的静态对手不匹配问题,并在 Vehicle TeleSales 和 Deal-or-No-Deal 基准上展现了对未见对手更强的泛化能力。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈