robust-rl

标签

Cards List
#robust-rl

ASGARD:基于强化学习的无人机动作空间防护

arXiv cs.LG · 2天前 缓存

ASGARD提出了一种两阶段的教师-学生流程,利用强化学习来增强无人机对动作空间攻击的韧性,通过纠正命令确保任务完成,并具备对未见攻击的泛化能力。

0 人收藏 0 人点赞
#robust-rl

面向小规模语言模型智能体的鲁棒强化学习

Hugging Face Daily Papers · 2026-07-27 缓存

本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈