标签
介绍了NOML,一种用于连续飞行控制的自定义强化学习算法,它采用分层actor、锚定策略和镜像学习来防止振荡并提高稳定性。该代码已在GitHub上开源。
Lighthouse Attention是一种基于选择的分层注意力机制,通过在前向+反向传播中实现约17倍的速度提升(在512K上下文下),并在98K上下文中实现1.4–1.7倍的端到端加速,从而加速长上下文预训练。该机制使用Llama-3 530M模型在50B token上进行了验证。