标签
一篇博客文章的公告,解释了 BarunLM(一个 35M 参数的语言模型)的设计,涵盖其架构、训练方案和数据集准备,重点介绍了相对于其他 sub-100M 模型的效率和性能提升。
OpenResearcher是来自TIGER-AI-Lab的一个开源项目,它提供了96,000条深度研究轨迹以及一套无需外部API即可训练代理型语言模型进行长周期网络研究的方案。它包含数据集、模型和演示,并已被NVIDIA的Nemotron模型采用。
一个小团队在学术预算下,仅使用32块H100和8K个合成样本,训练了一个前沿级别的深度研究智能体,并完全公开了从2B到35B模型的权重、代码和论文,这些模型在关键基准测试中匹配或超越了封闭的前沿智能体。
本文识别了LLM预训练中非均匀FP4量化格式的一个根本限制(收缩偏差),并提出了UFP4,一种优于现有基于E2M1方法的统一4位训练方案。
本文介绍了AdaMame,一种两阶段训练方案(SFT + GRPO),用于在多语言数学推理中自适应地将推理语言与查询语言对齐,在不牺牲准确性的情况下缓解语言崩溃。
OdysSim对人类行为模拟的行为基础模型进行了系统研究,引入了Soul分类法、一个包含2140万次交互的语料库以及一种训练方法,该方法在23个基准任务中的8个上达到了最先进水平,同时生成更类人的输出。
NVIDIA发布了Nemotron仓库,其中包含开放的训练配方、流水线和模型权重,用于他们的Nemotron模型,包括新的Nemotron 3 Ultra和Nemotron 3 Nano Omni,支持智能体AI和多模态能力。
本文研究了视觉生成模型的少步蒸馏训练策略,以Qwen-Image-2.0为例。它揭示了非直观行为,并提出了Qwen-Image-Flash。
MiniCPM5-1B 是 OpenBMB 推出的一个拥有 10 亿参数的模型,在 AIME 2025 和 τ2-Bench Telecom 上取得了令人瞩目的成绩,超越了更大的模型。它从单个检查点同时提供快速模式和推理模式,这得益于包括监督微调、强化学习和在线策略蒸馏在内的三阶段后训练过程。