标签
ASGARD提出了一种两阶段的教师-学生流程,利用强化学习来增强无人机对动作空间攻击的韧性,通过纠正命令确保任务完成,并具备对未见攻击的泛化能力。
本文系统性地研究了使用PPO对小型语言模型(7000万至5亿参数)进行强化学习时的失败模式,识别出静默LoRA参数冻结、数值溢出和灾难性策略崩溃等问题,并提出了一种鲁棒系统,采用合并并重新初始化适配器、float32精度和安全机制。该方法收敛稳定,且使用更少的数据即超越基线。