policy-evaluation

标签

Cards List
#policy-evaluation

面向低方差在线策略评估的鲁棒数据收集策略学习

arXiv cs.LG · 2026-08-26 缓存

本文提出了一种鲁棒的基于梯度的算法,用于学习行为策略,以降低在线强化学习策略评估中的方差,通过理论保证和数值验证来处理转移函数中的不确定性。

0 人收藏 0 人点赞
#policy-evaluation

从无监督子组到假设状态干预策略:观察性健康数据中选定子组方法的评估

arXiv cs.LG · 2026-07-30 缓存

本文评估了无监督子组方法与因果发现和政策评估相结合,用于观察性数据中的预算约束健康干预,发现在留出评估中没有单一方法始终优于其他方法。

0 人收藏 0 人点赞
#policy-evaluation

面向动态UBSR度量的MDPs在线策略评估

arXiv cs.LG · 2026-07-28 缓存

本文提出了在线学习算法,用于在线性函数近似下、具有动态效用型短缺风险(UBSR)度量的MDPs中进行高效的策略评估。引入了UBSR-TD算法,并证明了其收敛性和实际有效性。

0 人收藏 0 人点赞
#policy-evaluation

Masked Visual Actions:统一世界建模

Hugging Face Daily Papers · 2026-07-21 缓存

介绍了Masked Visual Actions,一种像素空间控制接口,将动作表示为部分揭示的轨迹,使得单个模型能够充当前向动力学模型、恢复机器人行为,并仅用15小时的训练数据支持基于模型的规划和逆向建模。

0 人收藏 0 人点赞
#policy-evaluation

一个基于形式化基础的ODRL评估器:实现与比较

arXiv cs.AI · 2026-07-20 缓存

本文介绍了一个具有透明语义的、基于形式化基础的ODRL评估器,支持所有规则类型,并将其性能与现有评估器进行比较,解决了数据访问和AI治理策略建模中的互操作性问题。

0 人收藏 0 人点赞
#policy-evaluation

GigaWorld-1: 构建用于机器人策略评估的世界模型路线图

Hugging Face Daily Papers · 2026-07-02 缓存

本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。

0 人收藏 0 人点赞
#policy-evaluation

WEAVER:更好、更快、更长 —— 一种有效的机器人操作世界模型

Hugging Face Daily Papers · 2026-06-11 缓存

WEAVER是一种用于机器人操作的多视角世界模型,通过流匹配损失实现了高保真度、一致性和效率,在策略评估、策略改进和测试时规划中表现出色,并在真实世界中取得了显著改进。

0 人收藏 0 人点赞
#policy-evaluation

StressDream:引导视频世界模型实现鲁棒的策略评估与改进

Hugging Face Daily Papers · 2026-05-29 缓存

StressDream通过优化噪声初始化结合语义目标与合理性目标,将基于扩散的想象引导至具有高影响力且合理的结果,从而增强视频世界模型,实现鲁棒的策略评估与改进。

0 人收藏 0 人点赞
#policy-evaluation

难民匹配收益对离策略评估选择的鲁棒性

arXiv cs.LG · 2026-05-11 缓存

本文通过逆概率加权(IPW)和增广逆概率加权(AIPW)等离策略方法,展示了难民匹配影响评估的鲁棒性,从而证实了此前关于算法分配难民的研究成果。

0 人收藏 0 人点赞
#policy-evaluation

RoboLab:用于任务通用策略分析的高保真仿真基准

Hugging Face Daily Papers · 2026-04-14 缓存

# 论文页面 - RoboLab:用于任务通用策略分析的高保真仿真基准 来源:[https://huggingface.co/papers/2604.09860](https://huggingface.co/papers/2604.09860) ## 摘要 RoboLab 是一个仿真基准框架,通过可扩展的真实任务生成和对策略在受控扰动下行为的系统分析,解决机器人策略评估中的局限。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈