@StasBekman: 我向您呈现一本2026年8月大幅修订的机器学习工程开放书籍 https://github.com/stas00/ml-engi…

X AI KOLs Following 工具

摘要

这是一本大幅修订的机器学习工程开放书籍,已更新至最新的硬件规格和示例,为训练和微调大语言模型及多模态模型提供实用指南。

我向您呈现一本2026年8月大幅修订的机器学习工程开放书籍 https://github.com/stas00/ml-engineering… 如果您偏好PDF版本,现在长达498页 https://github.com/stas00/ml-engineering#ebook-versions-of-the-book… 这本书进行了大规模更新,将所有高端硬件规格更新至最新状态,并更新了许多示例和研究以反映最新的torch/cuda和其他ML关键组件。 许多错误和不准确之处已得到修复。如果您阅读本书并发现任何遗漏,请善意地向我指出。
查看原文
查看缓存全文

缓存时间: 2026/08/29 11:53

我向大家呈现一本于2026年8月进行重大修订的《机器学习工程》开源手册

https://github.com/stas00/ml-engineering…

若您偏好PDF版本,目前该版本已达498页

https://github.com/stas00/ml-engineering#ebook-versions-of-the-book…

本书经历了全面更新,使所有高端硬件规格保持最新状态,并针对近期的PyTorch/CUDA及其他关键机器学习组件更新了大量示例与案例研究。

已修正诸多错误与不准确之处。若各位在阅读中发现任何遗留问题,请不吝向我反馈。


stas00/ml-engineering

来源:https://github.com/stas00/ml-engineering

机器学习工程开源手册

这是一套方法论、工具及分步指南的开源合集,旨在助力大型语言模型与多模态模型的成功训练、微调及其推理部署。

本书面向LLM/VLM训练工程师与运维人员的技术资料,其中包含大量脚本与可直接复制使用的命令,助您快速解决实际需求。

本仓库持续记录我在训练大型语言模型(LLM)及视觉语言模型(VLM)过程中的实践经验;这些知识主要源于:2022年参与开源模型BLOOM-176B(https://huggingface.co/bigscience/bloom)训练、2023年IDEFICS-80B(https://huggingface.co/HuggingFaceM4/idefics-80b-instruct)多模态模型训练,以及2024年在Contextual.AI(https://contextual.ai/)从事RAG模型开发期间所积累。

我整理这些资料主要是为了便于自身快速检索已验证有效的解决方案,但一如既往,我很乐意与更广泛的机器学习社区分享这些笔记。

目录

第一部分:洞见

  1. AI战场工程学 - 成功所需的关键认知
  2. 如何选择云服务商 - 助您获得优质云计算体验的核心考量
  3. 何时值得升级GPU? - 基于真实H200→B200基准测试的GPU换代成本效益分析框架

第二部分:硬件

  1. 计算资源 - 加速器、CPU、CPU内存
  2. 存储系统 - 本地/分布式/共享文件系统
  3. 网络架构 - 节点内与节点间网络

第三部分:调度管理

  1. 调度系统 - 容器与资源管理
  2. SLURM - 简易Linux资源管理工具

第四部分:训练

  1. 训练指南 - 模型训练相关实践方案

第五部分:推理

  1. 推理部署 - 模型推理实践洞见

第六部分:开发

  1. 调试与故障排除 - 简易与复杂问题的调试方法
  2. 更多调试技巧
  3. 测试实践 - 提升测试编写效率的技巧与工具

第七部分:其他资源

  1. 资源汇编 - LLM/VLM发展年鉴

更新动态

重大更新均会发布于我的推特频道 https://twitter.com/StasBekman。

电子书版本

您可下载本书的多种电子书格式:

我计划每隔几周重新生成电子书版本,若需最新版本可按此处指引自行构建。

感谢HuggingFace允许我在HF集线站(https://huggingface.co/stas/ml-engineering-book)托管本书电子版本。

面向AI代理的SKILL.md

我维护着一份SKILL.md文件,可用于训练AI代理更好地执行大规模机器学习模型的训练与运维。

配套技能资源:

  • 调试艺术(https://github.com/stas00/the-art-of-debugging/blob/master/SKILL.md)
  • Python实用手册(https://github.com/stas00/python-cookbook/blob/master/SKILL.md)

课程

讲座/演讲

  • 构建强健的ML工程技能体系(2026年1月10日为GPU Mode社区举办) 涵盖加速器性能实况、网络/存储对集群整体性能的关键影响。特别感谢Mark Saroufim(https://github.com/msaroufim)的组织与技术支持。

讨论社区

如需探讨机器学习工程相关议题,本仓库设有社区讨论区,欢迎分享经验或发起您关注的话题讨论。

关键对比表格

高端加速器:

网络性能:

快捷导航

常用快速访问资源:

工具:

指南:

致谢

若未获准参与特定LLM/VLM训练项目,这些知识积累将无从实现。由于超算集群租用成本高昂,此等机会仅少数人能享有。希望广大ML社区能通过这些笔记间接获益。

特别感谢Thom Wolf(https://github.com/thomwolf)在尚无大规模训练经验时邀请我主导BLOOM-176B训练项目,此经历引领我进入深度学习历程。同时感谢HuggingFace提供全职参与BLOOM-176B及后续IDEFICS-80B训练的机会。

近期通过在Contextual.AI(https://contextual.ai/)开展模型训练与可扩展训练/推理系统构建工作,持续拓展了技术视野,谨此感谢Aman与Douwe给予的机会。

同时感谢众多贡献者对本文档完善的持续支持。

贡献指南

如发现错误、笔误或改进建议,欢迎提交Issue或发起PR贡献。

相关开源手册

  • 调试艺术(https://github.com/stas00/the-art-of-debugging)— Unix/Python/PyTorch调试方法论与实践方案
  • Python实用手册(https://github.com/stas00/python-cookbook)— 日常Python与标准库应用范例

许可协议

本站内容采用署名-相同方式共享 4.0 国际协议发布

引用格式

@misc{bekman2024mlengineering,
  author = {Bekman, Stas},
  title = {Machine Learning Engineering Open Book},
  year = {2023-2026},
  publisher = {Stasosphere Online Inc.},
  journal = {GitHub repository},
  url = {https://github.com/stas00/ml-engineering}
}

我的仓库导航图

技术手册: 机器学习工程(https://github.com/stas00/ml-engineering) | 调试艺术(https://github.com/stas00/the-art-of-debugging) | Python实用手册(https://github.com/stas00/python-cookbook)

应用程序: ipyexperiments(https://github.com/stas00/ipyexperiments)

工具与速查表: bash(https://github.com/stas00/bash-tools) | conda(https://github.com/stas00/conda-tools) | git(https://github.com/stas00/git-tools) | jupyter-notebook(https://github.com/stas00/jupyter-notebook-tools) | make(https://github.com/stas00/make-tools) | python(https://github.com/stas00/python-tools) | tensorboard(https://github.com/stas00/tensorboard-tools) | unix(https://github.com/stas00/unix-tools)

其他机器学习资源: ML方法集(https://github.com/stas00/ml-ways) | 代码移植指南(https://github.com/stas00/porting)

相似文章