MinT:用于训练和服务数百万LLM的托管基础设施

Hugging Face Daily Papers 论文

摘要

MinT 是一种托管基础设施系统,通过保持基础模型常驻并移动轻量级 LoRA 适配器,实现数百万个 LLM 的高效训练和服务,可跨模型架构、存储和策略管理进行扩展。

我们提出了 MindLab Toolkit (MinT),这是一个用于低秩自适应(LoRA)后训练和在线服务的托管基础设施系统。MinT 针对这样一种场景:在少量昂贵的基础模型部署上产生许多训练好的策略。与将每个策略具体化为合并的完整检查点不同,MinT 保持基础模型常驻,并通过推出、更新、导出、评估、服务和回滚来移动导出的 LoRA 适配器修订版,将分布式训练、服务、调度和数据移动隐藏在服务接口之后。 MinT 沿着三个轴扩展这条路径。Scale Up 将 LoRA RL 扩展到前沿规模的密集型和 MoE 架构,包括 MLA 和 DSA 注意力路径,训练和服务已验证超过 1T 总参数。Scale Down 仅移动导出的 LoRA 适配器,在 rank-1 设置下其大小可低于基础模型大小的 1%;仅适配器交接在 4B 密集模型上测量步骤减少了 18.3 倍,在 30B MoE 上减少了 2.85 倍,而并发多策略 GRPO 将挂墙时间缩短了 1.77 倍和 1.45 倍,且不提高峰值内存。Scale Out 将持久策略可寻址性与 CPU/GPU 工作集分离:张量并行部署支持 10^6 规模的可寻址目录(测量单引擎扫描通过 100K)和集群级别的千适配器活跃波,冷加载被视为调度服务工作,打包的 MoE LoRA 张量将实时引擎加载速度提升 8.5-8.7 倍。因此,MinT 管理百万规模的 LoRA 策略目录,同时在共享的 1T 级基础模型上训练和服务选定的适配器修订版。
查看原文
查看缓存全文

缓存时间: 2026/05/14 04:16

论文页面 - MinT:面向数百万大语言模型训练与推理的托管基础设施

来源:https://huggingface.co/papers/2605.13779
发布时间:5月13日

#2 今日论文 (https://huggingface.co/papers/date/2026-05-14)
作者:

,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,

摘要

MinT 是一个托管基础设施系统,通过将基座模型常驻内存并移动轻量级适配器版本,实现高效的低秩适配(LoRA)训练与推理。该系统在多个维度上具备可扩展性,包括支持大规模模型架构、降低存储需求以及分布式策略管理。

我们提出了 MindLab Toolkit(MinT),一个用于低秩适配(LoRA)后训练和在线推理的托管基础设施系统。MinT 针对这样一种场景:大量训练的策略基于少量昂贵的基座模型部署而生成。MinT 不将每个策略物化为合并后的完整检查点,而是将基座模型常驻内存,并移动导出的 LoRA 适配器版本,覆盖从部署、更新、导出、评估、推理到回滚的完整流程,同时将分布式训练、推理、调度和数据移动隐藏在服务接口之后。MinT 从三个维度扩展这一路径:

  • Scale Up(向上扩展):将 LoRA 强化学习扩展到前沿规模的密集架构和 MoE 架构(包括 MLA 和 DSA 注意力路径),训练和推理已验证可支持超过 1T 总参数。
  • Scale Down(向下扩展):仅移动导出的 LoRA 适配器,在 rank-1 设置下其大小可低于基座模型的 1%;仅适配器交接将测量步骤时间在 4B 密集模型上缩短 18.3 倍,在 30B MoE 模型上缩短 2.85 倍,同时多策略并发 GRPO 在不提高峰值内存的情况下将墙钟时间缩短 1.77 倍和 1.45 倍。
  • Scale Out(横向扩展):将持久策略可寻址性与 CPU/GPU 工作集分离;张量并行部署支持 10^6 量级的可寻址目录(实测单引擎扫描超过 100K),以及集群级别千适配器的活跃波次,其中冷加载作为计划性服务工作处理,打包的 MoE LoRA 张量将实时引擎加载速度提升 8.5–8.7 倍。因此,MinT 在训练和推理选定的适配器版本同时,管理百万量级的 LoRA 策略目录,并共享 1T 级别的基座模型。

查看 arXiv 页面 (https://arxiv.org/abs/2605.13779) · 查看 PDF (https://arxiv.org/pdf/2605.13779) · 项目页面 (https://macaron.im/mindlab/mint) · GitHub (https://github.com/MindLab-Research/mindlab-toolkit) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13779)

引用该论文的模型

0 个

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。

引用该论文的数据集

0 个

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。

引用该论文的 Space

0 个

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。

包含该论文的合集

0 个

没有包含此论文的合集

请将此论文添加到合集 (https://huggingface.co/new-collection) 中以在此页面创建链接。

相似文章