标签
本文提出LEAF,一种基于回顾树的强化学习方法,用于语音感知大语言模型后训练,无需在线分支即可改进信用分配。在语音问答和语音翻译基准测试中,LEAF优于GRPO。
SALSA提出了一种轻量级自适应方法,用于语音感知的大语言模型,通过监督目标学习逐层引导向量,在域外语音基准上取得了显著改进(相对提升高达46.8%),并表明引导编码器层(尤其是较深层)比修改LLM主干更有效。