标签
本文研究了一个包含自动聊天机器人和人工坐席的人-AI服务系统,提出了一种UCB-DPP策略,该策略学习未知参数,在稳定队列的同时实现了Õ(K√T)的遗憾值。
OpenAI提出了一种针对深度强化学习的新型探索策略,使用具有上置信界(UCB)的Q函数集合,在Atari基准上展现了显著的性能提升。