标签
本文比较了住宅光伏社区中点对点电力交易的基于规则和强化学习的定价机制,结果显示基于规则的方法具有竞争力,且电池储能提升了强化学习的性能。
本文提出SADQ,一种对Q学习的改进,利用动力学模型的一步轨迹预测来正则化TD目标聚合,减少自举引起的过估计,并在多个基准上提高训练稳定性。
本文提出了一种基于深度Q网络的多智能体强化学习框架,用于在降级监视条件下运行的异构小型无人机和电动垂直起降飞机之间进行分散式冲突解决,并在90种交通密度和间隔阈值组合中评估策略。
QSplitFL提出了一种基于DQN的框架,用于在分割联邦学习中选择最优分割点,利用客户端硬件指标适应异构设备。实验表明,在多个数据集和架构上,该方法提高了收敛速度和准确率。