action-interface

标签

Cards List
#action-interface

面向状态依赖可行动作集的马尔可夫决策过程的Bellman-Taylor Score Decoding

arXiv cs.AI · 2026-06-10 缓存

本文介绍了Bellman-Taylor Score Decoding,一种用于处理马尔可夫决策过程中状态依赖可行动作集的方法,解决了将深度强化学习应用于运筹学问题的一个关键挑战。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈