markov-decision-process

标签

Cards List
#markov-decision-process

Windowed A-K-MDP

arXiv cs.AI · 4天前 缓存

Windowed A-K-MDP算法通过生成窗口内的可行分区来改进用于保护的MDP状态抽象,在33个测试案例中的25个中,与二分搜索方法相比减少了决策损失。

0 人收藏 0 人点赞
#markov-decision-process

Progressive Point Matching (8分钟阅读)

TLDR AI · 2026-09-09 缓存

Progressive Point Matching (PPM) 是一个提出的框架,用于在强化学习中为 LLMs 的长期任务分配部分信用,通过将推理视为马尔可夫状态空间中的路径来解决稀疏结果奖励的低效性。

0 人收藏 0 人点赞
#markov-decision-process

随机需求时序下多产品产能受限批量生产的离散时间MDP建模

arXiv cs.AI · 2026-09-02 缓存

本文将随机需求时序下的多产品产能受限批量生产问题表述为离散时间MDP,并提出一种遗传算法进行求解,在基准实例上展示了其效率。

0 人收藏 0 人点赞
#markov-decision-process

通过建议渠道的个体失能:当影响内生时的控制权丧失

arXiv cs.AI · 2026-08-18 缓存

本文建模了AI仅提供建议的人机交互,展示了依赖性如何增加并导致失能,并分析了像影响界限这样的安全约束的有效性。

0 人收藏 0 人点赞
#markov-decision-process

基于Unified Sequential Composition Models的时尚服装生成

arXiv cs.LG · 2026-08-17 缓存

本文提出了Unified Sequential Composition Model(USCM)和Latent Expansion Monte Carlo Tree Search(LE-MCTS),用于时尚服装生成,在多个数据集上实现了最先进的性能。

0 人收藏 0 人点赞
#markov-decision-process

对抗不确定性下的态势与维持优化

arXiv cs.AI · 2026-08-07 缓存

本文提出了一种面向军事资产分配的场景加权对抗鲁棒态势优化引擎,提出了CEV和RobustCEV优化器,在对抗性威胁不确定性下优于贪婪基线方法。

0 人收藏 0 人点赞
#markov-decision-process

从被动生成到主动调查:一种主动的学术同行评审智能体

arXiv cs.CL · 2026-06-12 缓存

本文提出ProReviewer,一种基于大语言模型的学术同行评审智能体,其被形式化为马尔可夫决策过程。该智能体通过维护结构化的评审日志主动探究论文,在多个质量维度上优于现有方法。

0 人收藏 0 人点赞
#markov-decision-process

长期决策问题中基于成对偏好的强化学习

arXiv cs.LG · 2026-06-02 缓存

本文介绍了Markov decision contest,这是一种用于基于成对偏好的强化学习的新问题模型。它证明了平稳策略的最优性保证、在P中的精确可解性,并提出了一种高效学习的近似算法。

0 人收藏 0 人点赞
#markov-decision-process

小型RL控制器与大型语言模型:RL引导的测试时自适应采样

Hugging Face Daily Papers · 2026-06-02 缓存

本文将大型语言模型的自适应采样建模为马尔可夫决策过程,并训练一个轻量级强化学习控制器来平衡正确性、延迟和计算成本,从而实现了更好的权衡。

0 人收藏 0 人点赞
#markov-decision-process

面向异构大语言模型多智能体系统的迭代式批评与路由控制器

arXiv cs.AI · 2026-05-12 缓存

本文介绍了一种用于多智能体大语言模型系统的批评与路由控制器,将协调过程建模为序贯决策问题。该方法利用策略梯度优化控制器以实现迭代优化,在表现优于基线方法的同时,降低了对顶级模型的依赖。

0 人收藏 0 人点赞
#markov-decision-process

什么是 MDP?我们该如何求解?

ML at Berkeley · 2021-02-23 缓存

本文通过一个关于大学生日常决策的教学示例,解释了马尔可夫决策过程(MDP)的基础知识,这是深度强化学习中的核心框架。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈