标签
MiMo-V2.6-Flash-MOPD 是对 MiMo-V2.6-Flash-RL 模型的升级,它采用来自领域专用教师的策略内蒸馏,以提升性能并缓解智能体任务中的工具调用重复问题。
MemSFT是一篇研究论文,提出通过使用外部参数化记忆来缓解大语言模型微调中的对齐税,该记忆将领域专业化与骨干网络参数更新解耦,从而能够跨不同规模的LLM重用,同时保持通用性能。
DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。