llama-3-1-405b

标签

Cards List
#llama-3-1-405b

在单个8xA100节点上运行405B模型,热加载多达30个微调专家,切换时间低于200毫秒,这种场景有实际用途吗?

Reddit r/LocalLLaMA · 2026-06-29

一位开发者分享了他们在单个8xA100节点上运行Llama 3.1 405B(AWQ int4)的经验,可热加载多达30个微调LoRA适配器,切换时间低于200毫秒,在超过60天的无重启运行中,为敏感的健康和法律任务实现了稳定的推理。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈