标签
论文提出PX-UAP方法,该方法结合概率鲁棒性与可解释人工智能,生成针对基于深度强化学习的入侵检测系统的通用对抗性扰动,并在实验中展示了攻击有效性的提升。
本文提出了一种用于一维装箱问题的基于图的深度强化学习框架,与现有方法相比减少了最优性差距,并实现了跨实例规模的零样本泛化。
RefinePPO 引入迭代动作细化以改进连续控制策略,在基准任务中达到与标准PPO相当或更优的性能,并且收敛更快。
本文提出了一种复合梯度学习方法,该方法整合了深度强化学习和模型预测控制,用于自主系统中的共享控制权限,并在交通网络上进行评估,显示在强交互下有适度效益。
本文提出了一种基于Decision Transformer的方法,用于优化无人机搭载RIS辅助的动态D2D通信,展示了跨场景泛化能力和高效的零样本迁移学习。
本文系统回顾了用于数据中心能源优化的AI研究,识别了现有研究空白,并提出了CLEAR-DC框架——通过整合能源、碳排放与水资源指标来打通优化器-负载的闭环。
本文探讨了网络拓扑和对手信息对多智能体强化学习系统中合作涌现的影响,特别是在重复囚徒困境(IPD)中,发现图结构和信息可用性对合作策略有显著影响。
本研究论文提出了一种使用深度强化学习的模拟框架,用于控制混合交通中联网自动驾驶车辆的车队汇入,表明PPO实现了高成功率,同时强调了安全与效率之间的权衡。
本文提出了一种改进的JAMPR深度强化学习模型,用于求解带容量与时间窗约束的取货配送问题(CPDPTW)。该模型可为中小规模实例提供快速最优解,并为大规模实例提供次优解。
本文介绍了带无人机的旅行小偷问题 (TTP-D),该问题使用混合整数规划、元启发式算法和基于注意力的深度强化学习联合优化地面路径规划、无人机同步和物品选择。
正如 Sergey Levine 所宣布的,Berkeley 的深度强化学习课程现已在 YouTube 上免费全面提供。
UC伯克利的深度强化学习课程CS185/285的讲座现已在网上公开观看。
本文提出了一种基于近体学的奖励公式,用于深度强化学习社交导航,将人类个人空间建模为高斯混合场,以提高社交合规性,同时保持导航效率。
本文提出了一种基于深度强化学习的车辆路径问题求解方法,并通过三个工业卡车规划案例进行了演示。与基线结果相比,该方法实现了超过10%的成本降低,并讨论了对更多VRP变体的泛化。
本文提出PLAN,一种轻量级并行类液体近似网络,用于柔性作业车间调度中的高效表示学习,与最先进的基线相比,以更少的参数实现了更优的完工时间和更低的推理延迟。
本文报告发现:使用冻结的随机初始化CNN特征提取器的深度强化学习智能体,在没有任何稀疏性诱导目标的情况下,自发地产生极端稀疏的全连接表示,通过极少数神经元压缩任务相关信息。
本综述为机器人学习的进度奖励建模提供了统一视角,将领域组织为三个步骤:接口、方法和数据/基准。
本文探讨了在Transformer架构中使用相对位置编码(RPE)作为加性偏置来解决团队定向问题,与原始Transformer架构相比,在收集奖励和最优性差距方面展示了一致的改进。
本文系统地探索了四种深度强化学习解决方案(DQN、REINFORCE、PPO和MuZero)用于尼泊尔不对称棋盘游戏Baghchal,发现MuZero由于通过蒙特卡洛树搜索进行基于模型的规划,获得了最佳胜率。
提出了一种具有隐式动作空间的双时间尺度多层深度强化学习框架,用于分层边缘-云计算中的联合服务放置、计算委托和功率控制,实现高达20.8%的延迟降低和13%的资源利用率提升。