标签
本文提出了 CABS+,一种增强的模型合并方法,利用冲突感知稀疏化和自适应权重分配来提高多任务模型合并的效率和性能,在 27 个数据集上相较于先前方法取得了显著提升。
HyperFix 提出了一种轻量级超网络,用于预测不同任务子集上任务向量合并的非线性校正,降低了每个子集的调参成本,并优于现有方法。
本文介绍了 Capek 0.5,一个以执行能力分类法为核心的具身视觉-语言模型,通过强化学习进行专家训练,随后采用权重空间融合和路由策略空间蒸馏。它提出了一个新的状态验证基准,并在2B和35B-A3B规模上展示了在具身和通用能力上的强劲性能。
介绍了AgentPatch,一种无需训练的从粗到精修复框架,用于合并智能体多模态大语言模型,解决了非对称能力保持和行为关键遗忘问题。
一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。
介绍了B1ade,一种极简RAG架构,包含一个335M零训练嵌入模型和一个通过GRPO在723M tokens上训练的1B小型语言模型,展示了涌现归因行为,无需大规模预训练即可获得具有竞争力的问答性能。
本文介绍了SkillSmith,这是一种增强型LLM,能够对前缀权重和文本知识进行推理,从而实现指令引导的新参数化技能合成,其性能优于仅文本和仅权重的基线方法。
Liquid AI的后训练主管解释了如何使用LFM2.5、on-policy偏好对齐、智能体RL、课程训练和迭代模型合并,在20分钟内构建一个小于1GB的设备端模型,其工具调用可靠性超越了更大的模型。
本文提出Merge-Adversarial Training,使开源大语言模型中的文本水印在模型合并后仍能幸存,在保持下游能力的同时,性能优于基线方法。
本文挑战了关于模型合并中领域专家应训练至最优验证损失的常见假设,表明最优训练时长在很大程度上取决于合并方法。简单平均法会因过拟合而性能下降,而基于稀疏化的方法则能从超出最优点的训练中获益。研究建议训练时长与合并方法应联合选择。
本文提出将持续学习中的遗忘建模为任务间的干扰,并引入了干扰门控功能分配(IGFA),这是一种无需回放、无需Fisher信息的方法,根据任务几何结构共享或保护方向,当任务可分离时实现无损保留。
论文介绍了子空间对齐重连(SAR),这是一种事后编辑方法,能够保留强化学习更新的频谱核心,从而保持推理增益、消除干扰,并实现跨专家模型融合,以极少的参数实现强大性能。
本文提出使用模型合并技术,特别是Iso-C聚合,来改进DiLoCo分布式训练中的聚合步骤,从而产生一种名为IsoLoCo的新方法,该方法在语言模型预训练上优于DiLoCo。
论文提出了DMVM,一个去中心化多任务数据集估值框架,利用任务算术和模型合并来估计数据集贡献,无需重新训练或数据共享,为数据市场实现可扩展且保护隐私的估值。
本文将模型合并视为在专家乘积场景下的概率推断,表明现有方法是其特例,并提出一种重尾柯西专家设计,能更准确地捕捉实际残差行为,在多个任务和架构上相对于现有最优基线取得了显著改进。
本文提出SAR,一种无需训练的方法,将强化学习更新投影到谱空间中的紧凑推理核心上,从而实现净化、改进探索和更强的模型合并。
本文提出一种用于视觉生成模型的强化学习框架,该框架使用分布级奖励,并采用子集替换策略以提高效率,在改善图像多样性和质量的同时,解决模式崩溃和奖励破解问题。
本文提出ST-Merge,一种可操控的模型合并框架,利用门控交叉注意力机制自适应地调节多语言模型和推理模型的贡献,在涵盖21种语言的多语言推理基准测试中优于固定合并方法。
本文识别了预训练模型中的“承重墙”维度,这些维度保留了模型合并中任务向量未完全捕获的任务特定知识,并提出了PACT(PreserveAnchoredCores)来保留这些核心,在多个基准测试中实现了最先进的性能。