标签
论文评估了LLM作为计算机科学考试评分器的表现,发现提示设计对评分准确性有显著影响,并表明LoRA微调能够缓解问题,使其性能匹配人类评分者。
本文研究了针对客户支持大语言模型的微调策略,比较了在多个模型家族中的多任务训练、顺序更新和模型合并。研究得出结论,多任务全量微调是最稳健的默认选择,而专业模型在任务外性能下降,并且需要可靠的路由。
本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。
论文表明,在选择性在策略蒸馏实验中使用共享学习率作为对照并非中性,会导致性能和结论的差异,并倡导报告完整的学习率矩阵比较以进行公平评估。
本文介绍了Stiefel-AdamW,一种用于深度学习中线性分解模块的几何感知优化器,它增强了稳定性和性能,并在GPT2、ViT和Mistral 7B等模型上得到验证。
HyperFlow 推出了一个新的 MiniMax-H3 变体,该变体使用开放权重 LoRA,通过无数据自蒸馏实现 3 倍速推理,同时保持视频和立体声输出。
该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。
HyperFlow 是一个开源的 8 步 LoRA,它使用无数据流自蒸馏在 MiniMax-H3 中将视频生成步数从 49 步减少到 8 步,在保持质量的同时实现了显著的加速。
关于在消融的基础模型上进行微调如何继承安全行为的讨论,评估结果显示混合结果,并与 Claude 模型进行比较,强调了审计的必要性。
在一个abliterated Qwen 3.8-27B模型上训练了LoRA适配器,以增强内部代码库召回,在评估中展示了在针对私有仓库的任务上优于Claude模型的性能。
这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。
本文介绍了一种用于通信高效联邦LoRA微调的自适应相位切换方法,在保持大型语言模型性能的同时,实现了高达40.5%的通信成本往返节省。
这是一个用于YuE2-3B模型的音频分词器和LoRA工具,使用户能够对真实音频录音进行分词并生成新歌曲或翻唱。
CodeFinetuner 是一个完整的流程,用于使用 LoRA 在个人代码库上微调像 Qwen2.5-Coder-3B 这样的小型代码自动补全模型,支持通过 llama.vim 和 llama.vscode 等工具进行本地推理,并提供评估指标。
本文介绍了 Qwen3.8-27B-Humanlike-Chat,这是一个经过微调的模型,旨在减少类似AI的对话习惯并模拟真实的人际对话。它基于真实对话数据集训练,旨在使回复更自然,更不像助手。
本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。
MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。
ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。
本文提出了一种用于LoRA微调的自适应各向异性学习率模型,以解决模块内异质性问题,提升性能并在各基准测试中提高秩容量利用率。