信念空间动力学中可容许学习率步长的闭式上界
摘要
本文提出了信念空间动力学中可容许学习率步长的闭式上界,为机器人或控制领域的优化提供了理论结果。
查看缓存全文
缓存时间: 2026/05/12 14:52
论文页面 - 信念空间动力学中可容许学习率步长的闭式上界
来源: https://huggingface.co/papers/2605.06741 在您的智能体中获取此论文:
hf papers read 2605\.06741
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
暂无模型关联此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.06741 以链接到此页面。
引用此论文的数据集0
暂无数据集关联此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.06741 以链接到此页面。
引用此论文的 Space0
暂无 Space 关联此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.06741 以链接到此页面。
包含此论文的收藏集0
暂无收藏集包含此论文
请将本论文添加到一个收藏集 (https://huggingface.co/new-collection) 中以在此页面链接。
相似文章
信念空间动力学中允许的学习率步长的闭式上界
本文利用KL散度和Bregman几何,推导了信念空间动力学中允许的学习率步长的闭式上界,重点关注交叉熵分类任务。
学习何时行动:通过运行时保证的通信高效强化学习
本文提出了一种框架(CARE),该框架在逐点李雅普诺夫安全护罩下联合学习控制输入和通信高效的定时决策,在倒立摆、小车-杆系统和平面四旋翼飞行器上实现了比经典方法更高的采样间隔。
调整速度作为非平稳强化学习的安全约束
本文提出将调整速度作为非平稳强化学习的安全约束,从适应可行性角度定义安全性,并利用表示学习与上下文预测,在预测的适应需求超过系统可达容量时主动调节行为。
使用控制障碍函数层的高维安全最优反馈控制的端到端学习
本文提出了一种可扩展的方法,用于在高维系统中端到端学习安全反馈控制器,通过将基于控制障碍函数的安全滤波器嵌入为优化层,并利用算子分裂和无雅可比反向传播来克服计算瓶颈。
跨层学习率平衡:线性神经网络中的精确两步动力学与最优缩放
本文推导了两层和三层线性神经网络在一步和两步梯度下降后梯度和测试损失的精确闭式表达式,刻画了最优学习率选择,并揭示了一个独特的早期训练阶段:在该阶段中,初始时不等层学习率是最优的。