标签
MemSFT是一篇研究论文,提出通过使用外部参数化记忆来缓解大语言模型微调中的对齐税,该记忆将领域专业化与骨干网络参数更新解耦,从而能够跨不同规模的LLM重用,同时保持通用性能。
DharmaOCR,一个专门用于巴西葡萄牙语OCR的模型,通过领域特定的微调和直接偏好优化,优于Mistral OCR4等较新的模型。文章解释了训练流程并展示了基准测试结果。