QQWorld:世界模型正则化的分位数-分位数匹配

Hugging Face Daily Papers 论文

摘要

本文提出QQWorld,一种分位数-分位数匹配目标,替代LeWorldModel中的Epps-Pulley目标,以更好地正则化潜在分布,提升控制环境中的规划成功率。

潜在世界模型通过预测紧凑表示空间中的未来状态,实现了高效规划,但其性能关键取决于所学潜在分布的质量。LeWorldModel(LeWM)使用Epps-Pulley(EP)目标将其潜在表示正则化为各向同性高斯分布。我们发现,EP的修正梯度对孤立尾部样本会迅速消失,导致重尾偏差得不到充分控制。为解决这一局限性,我们提出QQWorld,用分位数-分位数匹配目标替代EP,该目标直接将投影后的潜在样本与秩匹配的高斯分位数对齐,从而在尾部保持有效的修正梯度。我们进一步开发了跨批次QQ,利用先前批次的分离样本来扩大有效排名池,并刻画了其偏差-方差权衡。在四个控制环境中,QQWorld有效提升了LeWM的平均规划成功率,同时始终获得更好的高斯对齐和更薄的潜在尾部。
查看原文
查看缓存全文

缓存时间: 2026/08/03 05:30

论文页面 - QQWorld:用于世界模型正则化的分位数-分位数匹配

来源:https://huggingface.co/papers/2607.28415

摘要

潜在世界模型通过在紧凑的表示空间中预测未来状态来实现高效规划,但其性能在很大程度上取决于学习到的潜在分布的质量。LeWorld Model (LeWM) 使用 Epps-Pulley (EP) 目标将其潜在变量正则化为各向同性高斯分布。我们证明,对于孤立的尾部样本,EP 的校正梯度会迅速消失,导致重尾偏差得不到充分控制。为了解决这一局限性,我们提出了 QQWorld,用分位数-分位数匹配目标取代 EP,该目标直接将投影后的潜在样本与按秩匹配的高斯分位数对齐,从而在尾部保持有效的校正梯度。我们进一步开发了跨批次 QQ(cross-batch QQ),利用先前批次中分离的样本扩大有效排序池,并刻画了其偏差-方差权衡。在四个控制环境中,QQWorld 有效提高了 LeWM 的平均规划成功率,同时持续获得更好的高斯对齐和更薄的潜在尾部。

查看 arXiv 页面 (https://arxiv.org/abs/2607.28415) 查看 PDF (https://arxiv.org/pdf/2607.28415) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.28415)

引用该论文的模型0

没有模型引用该论文

在模型 README.md 中引用 arxiv.org/abs/2607.28415,即可从本页链接到该模型。

引用该论文的数据集0

没有数据集引用该论文

在数据集 README.md 中引用 arxiv.org/abs/2607.28415,即可从本页链接到该数据集。

引用该论文的 Space0

没有 Space 引用该论文

在 Space README.md 中引用 arxiv.org/abs/2607.28415,即可从本页链接到该 Space。

包含该论文的收藏集0

没有包含该论文的收藏集

将此论文添加到收藏集,即可从本页链接到它。

相似文章

基于世界模型的Q学习

arXiv cs.LG

本文介绍了QWM,一个将世界模型与Q学习相结合的框架,通过使用想象轨迹进行动作选择来增强强化学习中的样本效率,而不影响在真实数据上的训练。在操作基准测试上,它展示了相比最先进方法的显著改进。

面向分布强化学习的分位数几何正则化

arXiv cs.LG

本文介绍了 RQIQN,这是一种基于分位数的分布强化学习鲁棒方法,利用 Wasserstein 几何正则化来防止分布退化,并提升在风险敏感任务中的性能。

PROWL: 面向世界模型学习的优先遗憾驱动优化

arXiv cs.LG

介绍了一种优先遗憾驱动优化框架PROWL,该框架利用对抗性课程通过聚焦高误差轨迹来提升基于扩散的世界模型的鲁棒性,在MineRL中的分布外场景上取得了更好的性能。