lora

标签

Cards List
#lora

LLM评分器的成功与失败之处:来自两场计算机科学考试的证据

arXiv cs.CL ↗ · 7小时前 缓存

论文评估了LLM作为计算机科学考试评分器的表现,发现提示设计对评分准确性有显著影响,并表明LoRA微调能够缓解问题,使其性能匹配人类评分者。

0 人收藏 0 人点赞
#lora

一个适配模型能胜任一切吗?客户支持大语言模型的微调策略选择

arXiv cs.CL ↗ · 昨天 缓存

本文研究了针对客户支持大语言模型的微调策略,比较了在多个模型家族中的多任务训练、顺序更新和模型合并。研究得出结论,多任务全量微调是最稳健的默认选择,而专业模型在任务外性能下降,并且需要可靠的路由。

0 人收藏 0 人点赞
#lora

一域多语:无需配对数据构建跨语言遥感MLLM的领域与语言LoRA组合

arXiv cs.CL ↗ · 2天前 缓存

本文介绍了Modl技术,该技术通过组合领域与语言LoRA并实现互正交性,创建跨语言遥感多模态大语言模型(MLLM),在无需配对多语言数据的情况下实现卓越性能。

0 人收藏 0 人点赞
#lora

共享学习率在选择性在策略蒸馏中并非中性对照

arXiv cs.LG ↗ · 3天前 缓存

论文表明,在选择性在策略蒸馏实验中使用共享学习率作为对照并非中性,会导致性能和结论的差异,并倡导报告完整的学习率矩阵比较以进行公平评估。

0 人收藏 0 人点赞
#lora

Stiefel-AdamW:一种面向线性分解模块的几何感知优化器

arXiv cs.LG ↗ · 4天前 缓存

本文介绍了Stiefel-AdamW,一种用于深度学习中线性分解模块的几何感知优化器,它增强了稳定性和性能,并在GPT2、ViT和Mistral 7B等模型上得到验证。

0 人收藏 0 人点赞
#lora

@AdinaYakup: HyperFlowNew MiniMax-H3 变体来自 @video_rebirth - 开放权重 8步 LoRA - 3倍速,无数据自蒸馏…

X AI KOLs Timeline ↗ · 5天前 缓存

HyperFlow 推出了一个新的 MiniMax-H3 变体,该变体使用开放权重 LoRA,通过无数据自蒸馏实现 3 倍速推理,同时保持视频和立体声输出。

0 人收藏 0 人点赞
#lora

@iamtrask: AI归属比你想象的要好。推理用Shapley,后训练用LoRA,预训练用层次结构……

X AI KOLs Timeline ↗ · 6天前 缓存

该推文讨论了有效的AI归属方法:推理中使用Shapley值,后训练中使用LoRA,预训练中使用层次方法,并提出了路由通用智能的未来。

0 人收藏 0 人点赞
#lora

无数据流自蒸馏用于少步视频生成 —— 在 MiniMax-H3 上开源了经过验证的实现 [P]

Reddit r/MachineLearning ↗ · 6天前

HyperFlow 是一个开源的 8 步 LoRA,它使用无数据流自蒸馏在 MiniMax-H3 中将视频生成步数从 49 步减少到 8 步,在保持质量的同时实现了显著的加速。

0 人收藏 0 人点赞
#lora

[讨论] 微调与继承基础模型行为——以消融后的 Qwen 基础模型为例

Reddit r/artificial ↗ · 6天前

关于在消融的基础模型上进行微调如何继承安全行为的讨论,评估结果显示混合结果,并与 Claude 模型进行比较,强调了审计的必要性。

0 人收藏 0 人点赞
#lora

在abliterated Qwen 3.8-27B上进行LoRA训练以实现内部代码库召回[P]

Reddit r/MachineLearning ↗ · 2026-09-18

在一个abliterated Qwen 3.8-27B模型上训练了LoRA适配器,以增强内部代码库召回,在评估中展示了在针对私有仓库的任务上优于Claude模型的性能。

0 人收藏 0 人点赞
#lora

SFT 还是 RL 用于工具调用代理?一项跨数据、方法和规模的对照研究

arXiv cs.CL ↗ · 2026-09-17 缓存

这项对照研究比较了监督微调和强化学习方法在不同数据集和模型规模下训练工具调用代理的表现,发现SFT结合LoRA在分布内表现最强,而RL在跨数据集迁移中略有优势。

0 人收藏 0 人点赞
#lora

用于通信高效联邦LoRA微调的自适应相位切换

arXiv cs.LG ↗ · 2026-09-15 缓存

本文介绍了一种用于通信高效联邦LoRA微调的自适应相位切换方法,在保持大型语言模型性能的同时,实现了高达40.5%的通信成本往返节省。

0 人收藏 0 人点赞
#lora

Mothersuperior/yue2-mothersuperior-realaudio-tokenizer-v4

Hugging Face Models Trending ↗ · 2026-09-13 缓存

这是一个用于YuE2-3B模型的音频分词器和LoRA工具,使用户能够对真实音频录音进行分词并生成新歌曲或翻唱。

0 人收藏 0 人点赞
#lora

扩散模型微调中的LoRA秩权衡解析

arXiv cs.AI ↗ · 2026-09-12 缓存

本文研究了在扩散模型微调中LoRA秩选择的权衡问题,表明中等较小的秩(如4和8)通过平衡FID分数与计算成本,能优化微调效率。

0 人收藏 0 人点赞
#lora

CodeFinetuner:在您自己的代码库上微调本地代码自动补全模型

Reddit r/LocalLLaMA ↗ · 2026-09-11

CodeFinetuner 是一个完整的流程,用于使用 LoRA 在个人代码库上微调像 Qwen2.5-Coder-3B 这样的小型代码自动补全模型,支持通过 llama.vim 和 llama.vscode 等工具进行本地推理,并提供评估指标。

0 人收藏 0 人点赞
#lora

Qwen3.8-27B-Humanlike-Chat:我调优的模型,旨在模拟真实的人际对话

Reddit r/LocalLLaMA ↗ · 2026-09-11

本文介绍了 Qwen3.8-27B-Humanlike-Chat,这是一个经过微调的模型,旨在减少类似AI的对话习惯并模拟真实的人际对话。它基于真实对话数据集训练,旨在使回复更自然,更不像助手。

0 人收藏 0 人点赞
#lora

联邦多语言语音LLMs的组件感知差分隐私

arXiv cs.CL ↗ · 2026-09-11 缓存

本文提出α-split,一种用于联邦学习中差分隐私的双池分配方法。该方法解决了语音大语言模型中的跨组件预算崩溃问题,提升了模型效用并增强了对各类攻击的安全性。

0 人收藏 0 人点赞
#lora

Show HN: MultiMatte,一个可提示的图像背景移除模型

Hacker News Top ↗ · 2026-09-10 缓存

MultiMatte 是一个可提示的图像背景移除模型,基于 SAM 3 使用 LoRA 进行微调,通过输出 alpha 遮罩来更好地处理模糊边界,在基准测试中实现了更高的准确性。

0 人收藏 0 人点赞
#lora

ACE:MoE大语言模型参数高效微调的跨专家适配器整合

arXiv cs.LG ↗ · 2026-09-10 缓存

ACE提出了一种方法,用于整合MoE大语言模型中跨专家的冗余适配器,以实现更高效的参数高效微调,训练速度提升最高可达1.48倍,且不增加峰值内存。

0 人收藏 0 人点赞
#lora

单一学习率不够:LoRA微调的自适应各向异性学习率

arXiv cs.LG ↗ · 2026-09-10 缓存

本文提出了一种用于LoRA微调的自适应各向异性学习率模型,以解决模块内异质性问题,提升性能并在各基准测试中提高秩容量利用率。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈