标签
谷歌DeepMind推出SkillSmith,将模型权重视为LLM可以原生推理的额外模态,从而实现指令引导的参数化合成,在推理时组合技能。该方法优于仅文本和仅权重的基线方法。
本文介绍了SkillSmith,这是一种增强型LLM,能够对前缀权重和文本知识进行推理,从而实现指令引导的新参数化技能合成,其性能优于仅文本和仅权重的基线方法。
本文介绍了AdaPrefix-GRPO,一种在GRPO训练期间自适应控制提供给模型的正确解决方案前缀长度的方法,保持50%的成功率以最大化梯度信号。它在显著提高困难数学推理问题准确率的同时降低了计算成本。