深度强化学习评估与设计范式的原则性分析

Hugging Face Daily Papers 论文

摘要

本文分析了深度强化学习中的评估与设计范式,展示了经典范式可能导致错误结论,并提供了关于扩展性、容量和复杂性的见解。

从利用深度神经网络近似状态-动作价值函数从而赢得最具挑战性游戏之一,到无需明确陈述问题规则即可解决问题的算法进步,强化学习研究在过去十年中一直是卓越科学进步的核心。本文聚焦于这一研究进展的关键要素,分析了强化学习中的经典评估与设计范式。我们引入了强化学习中规模定律的理论基础,并证明强化学习算法的渐近性能在性能排名与数据规模之间并非单调关系。我们进行了大规模实验,结果表明,在经典设计与评估范式下的一系列强化学习研究得出了错误结论。我们的分析与结果为深度强化学习的扩展性、容量和复杂性提供了核心分析。
查看原文
查看缓存全文

缓存时间: 2026/07/15 12:21

论文页面 - 深度强化学习评估与设计范式的原则性分析

来源:https://huggingface.co/papers/2607.07769

摘要

从利用深度神经网络逼近状态-动作价值函数从而赢得最具挑战性的游戏之一,到算法进步使得无需明确陈述当前挑战规则就能解决问题,过去十年间,强化学习研究一直是卓越科学进步的核心。本文聚焦于这一研究进展的关键要素,并分析了强化学习中的经典评估与设计范式。我们介绍了强化学习中缩放定律的理论基础,并证明了强化学习算法的渐近性能在性能排名与数据体制之间并不存在单调关系。我们进行了大规模实验,结果表明,在经典设计与评估范式下的一系列强化学习研究得出了错误的结论。我们的分析和结果为深度强化学习的缩放、容量和复杂性提供了核心分析。

查看 arXiv 页面 (https://arxiv.org/abs/2607.07769)查看 PDF (https://arxiv.org/pdf/2607.07769)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.07769)

在你的代理中获取此论文:

hf papers read 2607.07769

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型

0

在模型的 README.md 中引用 arxiv.org/abs/2607.07769 以将其从此页面关联。

引用此论文的数据集

0

在数据集的 README.md 中引用 arxiv.org/abs/2607.07769 以将其从此页面关联。

引用此论文的 Spaces

0

在 Space 的 README.md 中引用 arxiv.org/abs/2607.07769 以将其从此页面关联。

包含此论文的收藏

0

将此论文添加到收藏 (https://huggingface.co/new-collection) 以将其从此页面关联。

相似文章

当LLM奖励设计失败:稀疏结构化强化学习的诊断驱动细化

arXiv cs.LG

本文将LLM生成的奖励塑形视为稀疏结构化强化学习中的调试问题,识别出奖励泛滥和语义误解等失败模式。作者提出诊断驱动的迭代细化,与一次性生成相比,取得了显著的成功率提升(例如,DoorKey-8×8从2.3%提升至97.6%)。

交互式评估需要设计科学

Hugging Face Daily Papers

本立场论文认为,交互式AI评估应被视为一种设计科学范式,提出了用于通过轨迹评估动态系统行为的双轴分类法和报告标准。

强化学习策略验证综述

arXiv cs.AI

本综述为强化学习策略的验证方法提供了统一视角,提出了一个按三个维度(验证范式、时间范围和保证强度)分类的方法,并指出了新兴研究方向。