MinT:用于训练和服务数百万LLM的托管基础设施
摘要
MinT 是一种托管基础设施系统,通过保持基础模型常驻并移动轻量级 LoRA 适配器,实现数百万个 LLM 的高效训练和服务,可跨模型架构、存储和策略管理进行扩展。
查看缓存全文
缓存时间: 2026/05/14 04:16
论文页面 - MinT:面向数百万大语言模型训练与推理的托管基础设施
来源:https://huggingface.co/papers/2605.13779
发布时间:5月13日
#2 今日论文 (https://huggingface.co/papers/date/2026-05-14)
作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
MinT 是一个托管基础设施系统,通过将基座模型常驻内存并移动轻量级适配器版本,实现高效的低秩适配(LoRA)训练与推理。该系统在多个维度上具备可扩展性,包括支持大规模模型架构、降低存储需求以及分布式策略管理。
我们提出了 MindLab Toolkit(MinT),一个用于低秩适配(LoRA)后训练和在线推理的托管基础设施系统。MinT 针对这样一种场景:大量训练的策略基于少量昂贵的基座模型部署而生成。MinT 不将每个策略物化为合并后的完整检查点,而是将基座模型常驻内存,并移动导出的 LoRA 适配器版本,覆盖从部署、更新、导出、评估、推理到回滚的完整流程,同时将分布式训练、推理、调度和数据移动隐藏在服务接口之后。MinT 从三个维度扩展这一路径:
- Scale Up(向上扩展):将 LoRA 强化学习扩展到前沿规模的密集架构和 MoE 架构(包括 MLA 和 DSA 注意力路径),训练和推理已验证可支持超过 1T 总参数。
- Scale Down(向下扩展):仅移动导出的 LoRA 适配器,在 rank-1 设置下其大小可低于基座模型的 1%;仅适配器交接将测量步骤时间在 4B 密集模型上缩短 18.3 倍,在 30B MoE 模型上缩短 2.85 倍,同时多策略并发 GRPO 在不提高峰值内存的情况下将墙钟时间缩短 1.77 倍和 1.45 倍。
- Scale Out(横向扩展):将持久策略可寻址性与 CPU/GPU 工作集分离;张量并行部署支持 10^6 量级的可寻址目录(实测单引擎扫描超过 100K),以及集群级别千适配器的活跃波次,其中冷加载作为计划性服务工作处理,打包的 MoE LoRA 张量将实时引擎加载速度提升 8.5–8.7 倍。因此,MinT 在训练和推理选定的适配器版本同时,管理百万量级的 LoRA 策略目录,并共享 1T 级别的基座模型。
查看 arXiv 页面 (https://arxiv.org/abs/2605.13779) · 查看 PDF (https://arxiv.org/pdf/2605.13779) · 项目页面 (https://macaron.im/mindlab/mint) · GitHub (https://github.com/MindLab-Research/mindlab-toolkit) · 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2605.13779)
引用该论文的模型
0 个
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。
引用该论文的数据集
0 个
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。
引用该论文的 Space
0 个
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.13779 以在此页面创建链接。
包含该论文的合集
0 个
没有包含此论文的合集
请将此论文添加到合集 (https://huggingface.co/new-collection) 中以在此页面创建链接。
相似文章
释放大型语言模型的潜力:实现实时、企业级部署的蓝图
这篇arXiv论文提出了一种统一的LLMOps架构,用于实时、企业级LLM部署,集成了数据摄入、持续学习、RAG和反馈循环。它引入了AIPO、STAR+FAR和SAGE等组件,以解决受监管行业中知识过时、幻觉和延迟-成本权衡的问题。
@keigohtr: 来自Netflix。他们的内部LLM服务方法。In-House LLM Serving at Netflix https://netflixtechblog.com/in-house-l…
Netflix分享了他们的内部LLM服务方法,使用vLLM和Triton推理服务器,提供兼容OpenAI的API,并详细介绍了部署策略和生产权衡。
领域自适应大语言模型中的训练数据审计:LoRA-MINT
LoRA-MINT 是一种用于对经 LoRA 微调的大语言模型进行成员推理测试的方法,在判断数据是否用于训练方面实现了高精度,并超越了基线方法。
深入vLLM:高吞吐量LLM推理系统剖析(2025)
深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。
FL-MAESTRO: 面向资源受限联邦学习的多智能体LLM编排
FL-MAESTRO引入了一个多智能体LLM编排器,以联合优化联邦学习中的通信拓扑、资源分配和聚合规则,显著减少浪费的能源,并提高资源受限边缘设备的效率。