标签
本文提出了一种鲁棒的基于梯度的算法,用于学习行为策略,以降低在线强化学习策略评估中的方差,通过理论保证和数值验证来处理转移函数中的不确定性。
本文评估了无监督子组方法与因果发现和政策评估相结合,用于观察性数据中的预算约束健康干预,发现在留出评估中没有单一方法始终优于其他方法。
本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。
介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。
本文介绍了一个具有透明语义的、基于形式化基础的ODRL评估器,支持所有规则类型,并将其性能与现有评估器进行比较,解决了数据访问和AI治理策略建模中的互操作性问题。
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。
StressDream通过优化噪声初始化结合语义目标与合理性目标,将基于扩散的想象引导至具有高影响力且合理的结果,从而增强视频世界模型,实现鲁棒的策略评估与改进。
本文通过逆概率加权(IPW)和增广逆概率加权(AIPW)等离策略方法,展示了难民匹配影响评估的鲁棒性,从而证实了此前关于算法分配难民的研究成果。
# 论文页面 - RoboLab:用于任务通用策略分析的高保真仿真基准 来源:[https://huggingface.co/papers/2604.09860](https://huggingface.co/papers/2604.09860) ## 摘要 RoboLab 是一个仿真基准框架,通过可扩展的真实任务生成和对策略在受控扰动下行为的系统分析,解决机器人策略评估中的局限。