标签
KItCAT 介绍了一种轻量级的自回归大型语言模型训练策略,该策略通过输入损坏生成多样化的训练输入,无需昂贵的改写即可改善从专业文档的知识注入。
本文提出Golden-GRPO Injection (GRIN),一种用于大语言模型持续知识注入的混合策略强化学习框架,克服了监督微调的局限性。实验表明,在知识吸收基准上表现卓越。
本文介绍了RoCo-ACE,一种用于多模态大语言模型知识注入的基于Rollout条件的在线蒸馏目标。它在限制未更新行为漂移的同时,提高了注入知识的准确性。
TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。
提出一种用于零样本ICU谵妄预测的轻量化知识注入框架,该框架在推理时用外部临床知识增强结构化电子健康记录数据摘要,在无需微调的LLaMA模型上,AUROC提升高达8.57个百分点。
本文研究了混合专家(MoE)模型中是否存在层间差异,并提出了EAACD,一种专家感知的自适应对比解码方法,利用高层中的专家激活模式来减少LLMs在问答任务中的幻觉。
来自NaceAI的一篇新论文提出了一种基于超网络的方法,用于在不修改核心参数的情况下向大型语言模型注入知识,可能实现高效的持续学习。该方法使用生成的低秩适配器来编码新事实,同时保持基础模型冻结。
本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。
Decoupled Mixture-of-Experts (DMoE) 提出了一种用于参数化知识注入的模块化架构,将专家和路由器从基础模型中解耦,以实现高效的自回归推理并缓解灾难性遗忘。
MixSD 提出了一种面向语言模型知识注入的自蒸馏方法,该方法将监督信号与模型自身的原生分布对齐,从而减少微调过程中的灾难性遗忘。它能够实现近乎完美的记忆,同时保留高达 100% 的基础能力,远超标准 SFT。