如何在 AMD Strix Halo 及其他非主流 AMD 硬件上微调大语言模型 (LLMs)
摘要
本文提供了在 AMD Strix Halo 硬件上使用监督微调 (SFT) 和 LoRA 方法微调大语言模型 (LLMs) 的教程,涵盖 Linux 及原生 Windows 环境。
我之前在这里发布的第一篇通用微调教程(https://www.promptinjection.net/p/the-ultimate-llm-ai-fine-tuning-guide-tutorial)收到了很多好评,有些人问我能否为 AMD Strix Halo 制作类似的教程。由于 ROCm 的存在,这里的处理方式确实大不相同。https://preview.redd.it/sz5zy2w6gh0h1.jpg?width=1456&format=pjpg&auto=webp&s=122f7834ea5501bd654085b9629120ef8d90eab9 我听取了大家的建议,教程现已发布:[https://www.promptinjection.net/p/how-to-fine-tune-llms-on-amd-strix-halo-ryzen-ai-max-395-sft-lora](https://www.promptinjection.net/p/how-to-fine-tune-llms-on-amd-strix-halo-ryzen-ai-max-395-sft-lora) \- Linux 和纯净版 Windows(无需 WSL!) \- 完整的 SFT 和 LoRA 支持
相似文章
为最大化StrixHalo性能而折腾(+NVLink双eGPU 3090改造)
用户详细介绍了对配备双RTX 3090 eGPU和NVLink的AMD Strix Halo系统进行改造和基准测试的过程,发现对密集模型的LLM推理速度有所提升,尤其是使用vLLM时,并讨论了能效权衡。
GLM 和我创建了一个针对 AMD GFX906(Mi50、Mi60、Radeon VII、GCN HIP)优化的 llama.cpp 分支 - 机器学习、大语言模型和 AI
已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。
本地LLM推理优化:完整指南
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。
AMD Strix Halo RDMA 集群搭建指南
一份使用自定义 Docker/Podman 工具箱,借助 ROCm/RCCL RDMA 支持,将两个 AMD Strix Halo 节点集群化,以在 256GB 统一内存上通过张量并行启用 vLLM 的搭建指南。
MLX微调示例指南
一份关于在 Apple Silicon 上使用 MLX 和 LoRA 微调 7B 指令模型的详细指南,附有显示风格适应高奇幻文学语域的示例输出。