标签
蒙特利尔高等商学院(HEC Montréal)与MILA的一篇论文提出了针对主-次弱耦合马尔可夫决策过程的公平策略优化方法,以单调凹公平函数取代功利主义目标,并引入一种基于计数比例的深度强化学习方法,其中包含基于优先级的采样器,该方法在机器置换任务以及纽约市出租车定价与调度任务上得到了验证。
本文开发了用于连续时间跳跃马尔可夫决策过程强化学习的无模型Q学习算法,并应用于网络动态定价,展示了优于基准方法的性能。
This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.
This paper presents a certificate-carrying sub-quadratic method for computing bisimulation metrics in Markov decision processes using approximate nearest neighbors, with coverage-augmented guarantees and two-sided bounds. Experiments show improved scaling and accurate metric recovery compared to baselines.
本文研究了鲁棒平均奖励马尔可夫决策过程的样本复杂度,在总变差不确定集下通过插入式归约导出了极小极大最优学习率。
本文形式化了在概率非确定性因果模型下马尔可夫决策过程的反事实策略优化,该模型将潜在混杂因素与固有随机性分开,并提出了一种实用的优化程序来推导鲁棒的反事实策略。该方法在脓毒症治疗模拟器上得到验证,其中糖尿病状态作为未观测的全局混杂因素。
This paper introduces a property-driven causal abstraction technique for factored Markov Decision Processes (MDPs), grouping states based on causal relations over state variable predicates to reduce model size while preserving property-relevant behavior. The approach is evaluated on standard benchmarks, yielding small abstractions that support near-optimal policy computation and often generalize to larger MDPs.
本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。
斯坦福大学计算机科学教授提供了一场免费的83分钟讲座,讲解如何掌握马尔可夫决策过程,涵盖策略评估、价值迭代和收敛极限。
本文提出了一种用于强化学习的性能驱动的状态抽象方法,直接优化决策质量,采用多时间尺度框架共同调整策略和树状结构抽象。该算法基于Q值差异细化或聚合状态空间,相比基线实现了更好的样本效率和更快的重新规划。
本文研究了平均奖励弱耦合MDP和休止臂赌博机学习中的样本复杂度,利用一种新颖的基于Lyapunov的分析框架,确立了具有多项式复杂度的有限样本PAC保证。
本文介绍了Bellman-Taylor Score Decoding,一种用于处理马尔可夫决策过程中状态依赖可行动作集的方法,解决了将深度强化学习应用于运筹学问题的一个关键挑战。
本文正式定义了强化学习中的精确遗忘问题,提出了一种用于表格型MDP的ρ-TV-稳定强化学习算法,该算法能以重训练成本的一小部分高效移除用户数据影响,并实现了接近最小最大最优的遗憾界。该工作已被ICML接收,并建立了ρ-TV-稳定强化学习算法的上下界。
本文介绍了一种基于回答集编程(ASP)的CARCASS框架实现,用于在强化学习中构建抽象,并在Blocks World和Minigrid领域展示了其有效性。
本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。
文章推荐斯坦福大学关于马尔可夫决策过程的讲座作为理解系统化交易数学基础的宝贵资源,声称其提供的洞察力胜过在主要金融机构进行的短期实习。