标签
该论文发现,在语言模型中,事实回忆期间,关系类型信息比实体特定信息更早地成为控制生成的因素,表明存在一种时间不对称性,且在多种模型和提示系列中均表现稳健。
本文介绍了Switch Distillation,这是一种新颖的中期训练目标,基于教师置信度选择性地应用知识蒸馏,以在较小的语言模型中改善推理并保留事实回忆。
本文识别了大语言模型在监督微调后出现的事实访问失败现象,并介绍了回忆锚定蒸馏(RAD),无需标注数据即可保留分布外事实回忆能力。
本文介绍了PolyFact,一个大规模多语言事实问答数据集,并展示了通过GRPO的强化学习相比监督微调能显著提升LLM的跨语言事实一致性,通过重组多语言表示。
本文研究了在文本语言模型中学到的事实回忆机制是否会迁移到多模态语音语言模型中的语音模态。通过对SpiritLM进行因果中介分析,发现这些机制仅部分迁移,凸显了文本与语音处理之间的差异。
本文介绍了 Transformer 中几何事实记忆的理论框架,证明了嵌入可以通过线性叠加来编码关系结构,而 MLP 则充当选择器。文章提供了理论和实证证据,表明这种机制能够高效地记忆事实和进行多跳查询。
本文探讨了强化学习能否在推理任务之外,进一步提升大型语言模型(LLM)对参数化知识的直接回忆能力。研究表明,通过二元奖励进行强化学习,可以通过重新分配概率质量来激活潜在知识,而非习得新事实,从而在事实性问答基准测试中取得显著提升。