标签
本文介绍了对 NVIDIA 的 Nemotron 检索栈进行的端到端适配,使其适用于现代希腊语,包括新基准 HERA,以及在专业领域针对检索、重排序和有依据的生成进行微调的模型。
本文介绍了递归合成终端任务(RST),一种递归验证的合成框架,用于大规模生成长时程终端智能体训练数据,共生成37,484个任务,并在终端基准上提升了Qwen3.5模型的表现。
Soup 是一个开源命令行工具,通过单条命令简化 LLM 的微调和后训练,支持基于 QLoRA 的训练,通过逐层流式传输仅需 4 GB 显存即可在消费级 GPU 上运行。最新版本新增了 DPO、ORPO、SimPO 和 KTO 等偏好损失,且不会使内存需求翻倍。
Amit Shekhar 发布了一个全面的开源 AI 工程面试题与答案仓库,涵盖 LLM 基础、提示工程、RAG、AI 智能体、微调、向量数据库、LLMOps 等内容。
本文提出了HEIMAT,一种针对语言模型的启发式自动去偏框架,利用启发式提示揭示偏见,并通过微调模型来减少偏见,同时保持自然语言理解(NLU)性能。
介绍了OSCD,一种后训练算法,用于改进低资源东南亚语言中的原生多语言思维链推理,在数学基准上实现了高达3.2倍的提升。
本文探讨了LLM在阿拉伯语医学任务中表现不佳的原因,通过机制分析表明知识存在于模型内部但未能浮现,随后提出了TLoRA,一种定向低秩适配方法,在医学问答上优于全网络LoRA,并引入了一个新的阿拉伯语临床对话基准。
一项系统的跨架构实证研究,衡量小语言模型领域适配的可信度成本,发现安全保持的微调策略并不能可靠地迁移对齐性。
本文提出通过渐进式监督微调和强化学习训练小语言模型作为多智能体路由器,相比仅基于意图路由的LLM基线方法,实现了更好的检索相关性和更低的延迟。
MiniMax发布了开放权重的H3视频模型,这是首个登顶AI视频排名的开放模型,在视频编辑中排名第一,在文本生成视频中排名第二。该33B参数模型可处理文本、图像、视频和音频,但部分组件如2K分辨率和H3-Context-IR仍未开放。
Promotes pre-ordering of a new book 'LLM Customization and Fine-Tuning' covering LLM adaptation, distillation, and alignment techniques.
This paper proposes FedSLM, a parameter-centric framework for federated fine-tuning of foundation models with heterogeneous compressed clients, using SVD-based decomposition and a weak-to-strong elicitation step to handle resource asymmetry. Experiments show it outperforms existing federated baselines while reducing client GPU memory by ~50%.
本文介绍了InMyStyle,一个隐私优先的系统,它在小型语言模型(0.5B–7B)上使用LoRA适配器,无需显式提示即可将AI编辑过的文本重写为符合个人用户写作风格的文本。评估显示,不同模型规模下质量趋于平稳,表明紧凑型模型足以胜任此任务。
本文研究了联邦预训练模型的评估协议,表明下游微调并不能可靠地保持预训练质量排名,而直接的下一个词元预测与预训练困惑度高度一致。
MMShopBench 引入了一个面向多模态、多轮购物代理的真实日志基准,要求从用户图像和对话中进行联合推断,并配备离线沙盒和训练集以提升开源模型性能。
本文介绍了Wnuan,一种用于企业问答的三阶段后训练流水线,结合了任务导向监督、带通用数据回放的监督微调,以及对残余错误的强化学习,在WnuanBench基准上取得了显著提升,同时衡量了通用能力的成本。
介绍了SKT,一个用于语言模型智能体技能使用训练的验证数据合成流水线,从2,000个公开技能中生成4,000个任务包和27,164条经验证的轨迹。在SKT生成的轨迹上进行监督微调,能够持续提升不同模型和智能体框架的技能使用性能。
谷歌DeepMind的新论文SkillSmith将前缀键值缓存视为一种输入模态,在推理时把文本知识与现有权重组合成冻结的Gemma 3 4B模型的新前缀缓存,从而无需针对特定目标的训练运行即可改进适应能力。
约翰·舒尔曼讨论了开放权重AI模型的平衡方法,承认滥用风险是真实存在的,同时承诺继续发布模型,并呼吁对安全访问进行协作研究。
Kroma v0.1 是 Krea 2 的 LoRA 微调版本,以兼容 ComfyUI 的 safetensors 文件形式发布,秩为 256,包含 RMSNorm/调制张量的权重增量,采用 MIT 许可。