标签
本文提出了GrocLM,一种通过两阶段LoRA训练策略和基于字典树的约束解码进行微调的语言模型,用于杂货品类推荐。在实时生产补货任务中,其每次展示的加购次数相对提升了7.5%。
本文识别了个性化多模态大语言模型中的群体偏好坍塌问题,并提出了 PrefMoE,一种以偏好为中心的框架,该框架将个人资料信息与偏好分离,以改进个性化并减少坍塌。
LC-SEPLM 通过 LoRA 和长程残基对接触监督对 ESM2 进行适配,将结构信息融入蛋白质序列表示,在包括远程同源性识别在内的八项蛋白质层面任务上取得了显著改进。
Ramp Labs 开源了 PorTAL,这是一个用于共享任务表示和跨模型 LoRA 适配的框架,支持混合注意力模型以及包括 Gemma 4、Mistral 7B 和 Inkling 在内的多模态系统。
Macaron V1 发布两个变体:Venti(748B 旗舰,配备 4×1B LoRA 专家)和 Tall(50B 本地部署,配备 4×3.7B LoRA 专家),分别基于 GLM-5.2 和 Qwen 3.6 进行后训练。
本文对面向低资源阿拉伯字母语言的生物医学机器翻译中的跨语言迁移进行了系统研究,以阿拉伯语和波斯语作为枢轴语言。作者评估了LoRA适配器融合作为一种零数据迁移策略,并表明该策略对于达里语等亲缘关系较近的语言效果出乎意料地好。
MoE2-LoRA 引入了一种双通道路由条件投影(Routing-Conditioned Projection)和一个全局 LoRA 专家池,以实现用于微调 MoE 模型的 MoE 风格低秩适配,在保留通用能力的同时取得了最先进的准确率。
本文研究了将文档内化到LoRA适配器用于闭卷问答,发现一旦适配器容量足够,训练数据质量(尤其是答案简洁性)成为主导因素,其效果超过架构更改,并比BM25-RAG实现更高的准确率。
一位社区成员询问关于Qwen3.6-27B上预训练、SFT/LoRA和强化后训练的直接比较,引用了最近关于灾难性遗忘及缓解策略的研究。
该论文揭示,基于偏好的后训练会诱导出具有频谱头-尾组织的参数更新,其中紧凑的头部承载主要的行为偏移,而微弱的尾部对于完整解恢复是必要的,从而将对齐重新定义为结构化的更新重组,而非单一的整体修正。
本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。
本文提出了一种模式约束的文档级事件论元提取方法,使用经过LoRA微调的中型开源LLM,结合角色集注入和确定性解码,在MAVEN-ARG上取得了最先进的结果。
本文研究了基于超网络将知识注入大语言模型的缩放定律,发现了可预测的幂律缩放和可靠的分布外泛化,确立了超网络作为LoRA和全参数微调的可扩展替代方案。
LoRA Speedrun 是一个微调技术的实际耗时公开排行榜,通过自动化验证,在单块 L40S GPU 上使用 Qwen2.5-1.5B 和 SmolLM2-1.7B 模型,测量 LoRA 适配器在 GSM8K 和 SQuAD 任务上达到目标准确度的速度。
提出 Token-Level Off-Policy Labeling (TOPL),一种用于忠实生成的离策略训练范式,将后训练重新定义为词元级正确性预测,在摘要和机器翻译任务上实现了强大的分布外泛化能力。
一位谷歌工程师分享了在手机上用21分钟将Gemma 270M模型从46%准确率微调至90%的方法,使用合成数据、LoRA、int4量化,离线可达每秒2000 tokens。
一位 LLM 课程背后的前摩根大通工程师提供了一份18分钟的指南,关于使用 LoRA、QLoRA、DPO、KTO 和 mergekit 微调与合并模型,声称其效果优于昂贵的训练营。
描述了一种工作流程,可以在一天之内使用25个手写示例、合成数据扩展、LoRA微调和量化以在CPU上推理,构建一个任务特定的本地模型。
本文提出了一种方法,将LLaMA 3 8B微调为高效的检索增强生成重排序器,利用知识蒸馏和4位量化,在检索指标上比交叉编码器基线提升14-21%,同时降低了推理成本。
本文介绍了PFAdapter,一种用于多模态大语言模型(MLLMs)个性化联邦微调的通信高效框架。它采用分层LoRA分解,将适配器参数分离为全局共享和本地私有组件,通过正交正则化实现通信成本降低近50%,同时提升个性化性能。