deep-reinforcement-learning

标签

Cards List
#deep-reinforcement-learning

基于近体学奖励建模的深度强化学习社交合规导航

arXiv cs.LG · 昨天 缓存

本文提出了一种基于近体学的奖励公式,用于深度强化学习社交导航,将人类个人空间建模为高斯混合场,以提高社交合规性,同时保持导航效率。

0 人收藏 0 人点赞
#deep-reinforcement-learning

基于深度强化学习的车辆路径问题:工业卡车规划案例研究

arXiv cs.AI · 5天前 缓存

本文提出了一种基于深度强化学习的车辆路径问题求解方法,并通过三个工业卡车规划案例进行了演示。与基线结果相比,该方法实现了超过10%的成本降低,并讨论了对更多VRP变体的泛化。

0 人收藏 0 人点赞
#deep-reinforcement-learning

PLAN:面向柔性作业车间调度高效表示学习的并行类液体近似网络

arXiv cs.LG · 2026-08-05 缓存

本文提出PLAN,一种轻量级并行类液体近似网络,用于柔性作业车间调度中的高效表示学习,与最先进的基线相比,以更少的参数实现了更优的完工时间和更低的推理延迟。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习中冻结随机CNN特征提取器的涌现稀疏性

arXiv cs.LG · 2026-07-30 缓存

本文报告发现:使用冻结的随机初始化CNN特征提取器的深度强化学习智能体,在没有任何稀疏性诱导目标的情况下,自发地产生极端稀疏的全连接表示,通过极少数神经元压缩任务相关信息。

0 人收藏 0 人点赞
#deep-reinforcement-learning

面向机器人学习的进度奖励建模:综合综述

arXiv cs.CL · 2026-07-27 缓存

本综述为机器人学习的进度奖励建模提供了统一视角,将领域组织为三个步骤:接口、方法和数据/基准。

0 人收藏 0 人点赞
#deep-reinforcement-learning

通过相对位置编码对距离进行编码以增强基于Transformer的路由

arXiv cs.AI · 2026-07-22 缓存

本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习掌握Baghchal的不对称策略

arXiv cs.AI · 2026-07-22 缓存

本文系统地探索了四种深度强化学习解决方案(DQN、REINFORCE、PPO和MuZero)用于尼泊尔不对称棋盘游戏Baghchal,发现MuZero由于通过蒙特卡洛树搜索进行基于模型的规划,获得了最佳胜率。

0 人收藏 0 人点赞
#deep-reinforcement-learning

多时间尺度隐式动作深度强化学习在边缘-云网络中的联合优化

arXiv cs.LG · 2026-07-22 缓存

提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习评估与设计范式的原则性分析

arXiv cs.LG · 2026-07-10 缓存

本文分析了深度强化学习中的评估与设计范式,揭示了性能排名在不同数据范围下并非单调递增,且常见的低数据范围基准可能导致错误结论。

0 人收藏 0 人点赞
#deep-reinforcement-learning

基于可靠性的双目标投资组合优化的深度强化学习

arXiv cs.LG · 2026-07-09 缓存

本文提出了一种深度强化学习框架(MORP-DRL),用于多目标基于可靠性的投资组合优化,在实践约束下使用CVaR和EVaR联合优化期望收益和下行风险,并在不同市场体制下的全球股票指数上展示了性能。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习用于自主订单拣选机器人的动态电池管理

arXiv cs.LG · 2026-07-08 缓存

本文提出了一种基于近端策略优化(PPO)的深度强化学习框架,用于仓库中自主移动机器人的动态电池充电,与基线方法相比,最高可实现6%的订单完成率提升。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习评估与设计范式的原则性分析

Hugging Face Daily Papers · 2026-07-08 缓存

本文分析了深度强化学习中的评估与设计范式,展示了经典范式可能导致错误结论,并提供了关于扩展性、容量和复杂性的见解。

0 人收藏 0 人点赞
#deep-reinforcement-learning

物理信息神经网络在单自由度直升机系统安全强化学习中的应用

arXiv cs.LG · 2026-07-07 缓存

本文作为一项进展中研究,提出将可微物理模型嵌入PPO策略损失函数,以惩罚强化学习中预期的安全违规行为,并在模拟的单自由度直升机系统上进行评估。物理信息软正则化在保持可靠目标跟踪的同时,显著减少了约束违反。

0 人收藏 0 人点赞
#deep-reinforcement-learning

安全自适应的云修复:使用神经符号世界模型验证LLM生成的恢复计划

arXiv cs.AI · 2026-07-03 缓存

本文介绍了PASE,一个神经符号框架,利用LLM为云系统生成结构化的恢复计划,并通过神经符号世界模型进行验证,可减少超过40%的恢复时间。

0 人收藏 0 人点赞
#deep-reinforcement-learning

面向税务感知的个性化投资组合管理的三阶段基础模型

arXiv cs.AI · 2026-07-01 缓存

一个三阶段深度强化学习系统,用于个性化投资组合管理,解决了股票代码锁定、单一目标和静态用户模型的问题,使用了通过自监督学习预训练的跨资产编码器以及Chronos时间序列基础模型,通过混合专家模型和PPO进行微调,并通过LoRA实现个性化。

0 人收藏 0 人点赞
#deep-reinforcement-learning

流体控制的离线强化学习:基于数据的多观测策略提取

arXiv cs.LG · 2026-07-01 缓存

本文提出了一种用于主动流动控制的新型离线强化学习框架,采用带有点注意力层的传感器位置条件架构来处理变化的传感器配置,从而无需昂贵的在线交互即可实现数据驱动的策略提取。

0 人收藏 0 人点赞
#deep-reinforcement-learning

A3M: 自适应、对抗性与多目标学习用于重复拍卖中的战略投标

arXiv cs.CL · 2026-06-30 缓存

介绍了A3M,一个结合自适应深度强化学习、对抗性推理和多目标奖励设计的框架,用于重复拍卖中的战略投标,实现了30-40%的遗憾降低。

0 人收藏 0 人点赞
#deep-reinforcement-learning

通过深度强化学习的连续时间最优停止

arXiv cs.LG · 2026-06-17 缓存

本文介绍了CARLOS,一种深度强化学习算法,它利用聚合深度神经网络学习美式期权的连续时间最优停止规则,有效缩小了百慕大与美国期权之间的价值差距,并具有较高的计算效率。

0 人收藏 0 人点赞
#deep-reinforcement-learning

一种基于深度强化学习(DRL)的Transformer方法用于解决开放车间调度问题

arXiv cs.AI · 2026-06-15 缓存

介绍了一种基于Transformer的调度策略,该策略通过强化学习训练,用于开放车间调度问题,展示了在小规模实例上训练的模型能够泛化到更大规模的问题,并与经典调度启发式算法竞争。

0 人收藏 0 人点赞
#deep-reinforcement-learning

深度强化学习中的性能变异

arXiv cs.LG · 2026-06-08 缓存

本文指出了深度强化学习中传统不确定性估计的局限性,并提出基于百分位数的统计量和可视化方法,以更好地评估运行间性能变异。案例研究展示了该方法在PPO、SAC、TD-MPC、DQN和Rainbow算法上的应用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈