标签
介绍了PROPEL,一种求解器摊销框架,通过训练轻量级激活探针来预测求解器通过率,从而无需昂贵的求解器运行即可高效训练RL任务生成器。该方法在数学、代码和软件工程任务中改善了可学习前沿上的生成质量。
介绍了PRIG,一种梯度归因方法,通过训练线性探针区分清晰提示和模糊提示,并将探针得分归因于残差流中的标记表示,从而定位大型语言模型中的提示模糊性,在合成和人工编写的基准测试上取得了强劲性能。
本文认为,LLM中的遗忘应依赖于目标,提出了一种基于余弦的元学习RMU变体用于危险知识遗忘,以及一种结合探针方向的多层目标用于毒性遗忘,在四个7-8B模型上取得了显著效果。