解构Actor-Critic:面向实践者的设计组件大规模实证研究

arXiv cs.LG 论文

摘要

本文分析了超过33,000次关于Actor-Critic算法设计组件的实验,发现诸如高斯动作分布等常见默认配置并不可靠,而具有自适应更新计划的有界分布则表现出鲁棒性,为实践者提供了实用指导。

arXiv:2607.13274v1 公告类型:新 摘要:强化学习正越来越多地被用于控制真实世界系统,从聚变等离子体和自动驾驶汽车到药物发现和饮用水处理,在这些场景中可靠性至关重要且调优预算有限。Actor-Critic算法共享一组设计决策,例如如何更新策略、如何表示动作分布、如何估计梯度以及相对于价值估计器的更新频率。基于从真实水处理厂导出的控制任务,我们分析了超过33,000次实验,以确定这些组件如何影响跨运行的变异性和对超参数的敏感性。常见默认配置,如带有路径梯度估计器的高斯动作分布,是最不可靠的配置之一,而具有自适应更新计划的有界分布则在广泛设置中保持鲁棒性。这些发现为科学和工程领域的实践者提供了经验性指导,帮助他们在将Actor-Critic方法应用于新的真实世界控制设置时理解和做出组件级决策。
查看原文
查看缓存全文

缓存时间: 2026/07/16 04:21

# 解构Actor-Critic:面向从业者的设计组件大规模实证研究
来源:https://arxiv.org/abs/2607.13274
查看PDF (https://arxiv.org/pdf/2607.13274)

> 摘要:强化学习正越来越多地被考虑用于控制现实世界系统——从聚变等离子体和自动驾驶汽车,到药物发现和饮用水处理——在这些场景中,可靠性至关重要且调参预算有限。Actor-critic算法共享一组设计决策,例如策略如何更新、如何表示动作分布、梯度如何估计、以及相对于值估计器策略更新的频率如何。基于一个取自真实水处理厂的控制任务,我们分析了超过33,000个实验,以确定这些组件如何影响不同运行之间的变异性以及对超参数的敏感性。常见的默认设置(例如使用路径梯度估计器的高斯动作分布)是最不可靠的配置之一,而带自适应更新调度的有界分布则在广泛设置下保持鲁棒。这些发现为科学和工程领域的从业者提供了经验指导,帮助他们在将actor-critic方法应用于新的现实世界控制场景时,理解并做出组件级别的决策。

## 提交历史

来自:Haseeb Shah [查看邮箱](https://arxiv.org/show-email/f890a0e7/2607.13274)  
**[v1]** 2026年7月14日 星期二 21:20:42 UTC (3,761 KB)

相似文章

熵正则化演员-评论家方法的精细分析

arXiv cs.LG

本文对熵正则化演员-评论家方法进行了精细的理论分析,表明精确的评论家能起到强大的方差缩减作用,使样本复杂度可与确定性策略梯度相媲美,并且当学到的评论家足够准确时,这些优势得以保留。