markov-decision-processes

标签

Cards List
#markov-decision-processes

主-次弱耦合马尔可夫决策过程中的公平策略优化

arXiv cs.LG ↗ · 17小时前 缓存

蒙特利尔高等商学院(HEC Montréal)与MILA的一篇论文提出了针对主-次弱耦合马尔可夫决策过程的公平策略优化方法,以单调凹公平函数取代功利主义目标,并引入一种基于计数比例的深度强化学习方法,其中包含基于优先级的采样器,该方法在机器置换任务以及纽约市出租车定价与调度任务上得到了验证。

0 人收藏 0 人点赞
#markov-decision-processes

连续时间跳跃马尔可夫决策过程中的强化学习及其在网络动态定价中的应用

arXiv cs.LG ↗ · 2026-08-24 缓存

本文开发了用于连续时间跳跃马尔可夫决策过程强化学习的无模型Q学习算法,并应用于网络动态定价,展示了优于基准方法的性能。

0 人收藏 0 人点赞
#markov-decision-processes

Decentralized Multi-Player Q-Learning in Episodic Markov Decision Processes with Information Asymmetry

arXiv cs.LG ↗ · 2026-08-14 缓存

This paper studies decentralized multi-player Q-learning in episodic Markov decision processes under three forms of information asymmetry, proposing algorithms that achieve regret bounds matching the single-agent Q-learning rate up to logarithmic factors.

0 人收藏 0 人点赞
#markov-decision-processes

Sub-Quadratic Bisimulation Metrics via Approximate Nearest Neighbors: Coverage-Augmented Guarantees and Computable Two-Sided Certificates

arXiv cs.LG ↗ · 2026-08-10 缓存

This paper presents a certificate-carrying sub-quadratic method for computing bisimulation metrics in Markov decision processes using approximate nearest neighbors, with coverage-augmented guarantees and two-sided bounds. Experiments show improved scaling and accurate metric recovery compared to baselines.

0 人收藏 0 人点赞
#markov-decision-processes

鲁棒平均奖励马尔可夫决策过程:通过插入式归约实现极小极大最优学习

arXiv cs.LG ↗ · 2026-08-10 缓存

本文研究了鲁棒平均奖励马尔可夫决策过程的样本复杂度,在总变差不确定集下通过插入式归约导出了极小极大最优学习率。

0 人收藏 0 人点赞
#markov-decision-processes

基于非确定性因果模型的鲁棒反事实策略优化

arXiv cs.LG ↗ · 2026-08-05 缓存

本文形式化了在概率非确定性因果模型下马尔可夫决策过程的反事实策略优化,该模型将潜在混杂因素与固有随机性分开,并提出了一种实用的优化程序来推导鲁棒的反事实策略。该方法在脓毒症治疗模拟器上得到验证,其中糖尿病状态作为未观测的全局混杂因素。

0 人收藏 0 人点赞
#markov-decision-processes

Property-driven Causal Abstractions for Markov Decision Processes

arXiv cs.AI ↗ · 2026-07-31 缓存

This paper introduces a property-driven causal abstraction technique for factored Markov Decision Processes (MDPs), grouping states based on causal relations over state variable predicates to reduce model size while preserving property-relevant behavior. The approach is evaluated on standard benchmarks, yielding small abstractions that support near-optimal policy computation and often generalize to larger MDPs.

0 人收藏 0 人点赞
#markov-decision-processes

面向动态UBSR度量的MDPs在线策略评估

arXiv cs.LG ↗ · 2026-07-28 缓存

本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。

0 人收藏 0 人点赞
#markov-decision-processes

@RitOnchain: 斯坦福大学计算机科学教授刚刚揭秘如何掌握马尔可夫决策过程。83分钟免费。来自斯坦福…

X AI KOLs Timeline ↗ · 2026-07-11 缓存

斯坦福大学计算机科学教授提供了一场免费的83分钟讲座,讲解如何掌握马尔可夫决策过程,涵盖策略评估、价值迭代和收敛极限。

0 人收藏 0 人点赞
#markov-decision-processes

性能驱动的多时间尺度学习环境抽象

arXiv cs.LG ↗ · 2026-06-17 缓存

本文提出了一种用于强化学习的性能驱动的状态抽象方法,直接优化决策质量,采用多时间尺度框架共同调整策略和树状结构抽象。该算法基于Q值差异细化或聚合状态空间,相比基线实现了更好的样本效率和更快的重新规划。

0 人收藏 0 人点赞
#markov-decision-processes

基于Lyapunov的弱耦合MDP样本复杂度分析

arXiv cs.LG ↗ · 2026-06-15 缓存

本文研究了平均奖励弱耦合MDP和休止臂赌博机学习中的样本复杂度,利用一种新颖的基于Lyapunov的分析框架,确立了具有多项式复杂度的有限样本PAC保证。

0 人收藏 0 人点赞
#markov-decision-processes

面向状态依赖可行动作集的马尔可夫决策过程的Bellman-Taylor Score Decoding

arXiv cs.AI ↗ · 2026-06-10 缓存

本文介绍了Bellman-Taylor Score Decoding,一种用于处理马尔可夫决策过程中状态依赖可行动作集的方法,解决了将深度强化学习应用于运筹学问题的一个关键挑战。

0 人收藏 0 人点赞
#markov-decision-processes

强化学习中的精确遗忘

arXiv cs.LG ↗ · 2026-06-04 缓存

本文正式定义了强化学习中的精确遗忘问题,提出了一种用于表格型MDP的ρ-TV-稳定强化学习算法,该算法能以重训练成本的一小部分高效移除用户数据影响,并实现了接近最小最大最优的遗憾界。该工作已被ICML接收,并建立了ρ-TV-稳定强化学习算法的上下界。

0 人收藏 0 人点赞
#markov-decision-processes

基于回答集编程的强化学习抽象

arXiv cs.AI ↗ · 2026-06-01 缓存

本文介绍了一种基于回答集编程(ASP)的CARCASS框架实现,用于在强化学习中构建抽象,并在Blocks World和Minigrid领域展示了其有效性。

0 人收藏 0 人点赞
#markov-decision-processes

通过分位数贝叶斯风险MDP实现在线强化学习中鲁棒性与探索的动态权衡

arXiv cs.LG ↗ · 2026-05-26 缓存

本文提出了一种用于在线强化学习的分位数贝叶斯风险感知MDP框架,该框架能够随时间自适应地平衡鲁棒性与探索,提供了理论遗憾界并展示了强大的实证性能。

0 人收藏 0 人点赞
#markov-decision-processes

@RohOnChain: 这堂关于马尔可夫决策过程的斯坦福一小时讲座将让你更深入地了解系统化交易背后的数学原理……

X AI KOLs Timeline ↗ · 2026-05-12 缓存

文章推荐斯坦福大学关于马尔可夫决策过程的讲座作为理解系统化交易数学基础的宝贵资源,声称其提供的洞察力胜过在主要金融机构进行的短期实习。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈