@eternityspring: https://x.com/eternityspring/status/2084666970558074971

X AI KOLs Timeline 工具

摘要

详解如何在 RTX 4080 16GB 上通过 ComfyUI 原生工作流本地运行 MiniMax H3 视频生成模型,包含模型下载、目录配置、参数调优及常见坑点。

https://t.co/3eVOQewh5l
查看原文
查看缓存全文

缓存时间: 2026/08/04 20:16

无保留分享 RTX 4080 本地跑 MiniMax H3,省下API的钱买冰棍不香吗?

先把结论摆在最前面,省得划半天:

  • MiniMax H3 现在已经支持 ComfyUI 原生工作流,本地能跑;

  • 我这台 RTX 4080 16GB,靠 pruned + int8 低显存版跑通,10 秒视频大约 10 分钟出片;

  • 但对模型版本、目录结构、ComfyUI 版本要求很严——文件下错、版本不对,基本直接报错,或者根本起不来;

  • 唯一还没搞定的坑:中文口播不稳,提示词里反复强调用中文,生成出来偏偏不一定是中文。

说明学中文这件事,不仅对老外有难度,对大模型也有难度。记得GPT image 早期的时候也是遇到中文就乱码。

一、硬件

我自己的实测配置:

  • 显卡:NVIDIA GeForce RTX 4080 16GB

  • 内存:32GB

  • 系统:Windows

  • ComfyUI:0.30.0

  • 运行方式:ComfyUI 原生 MiniMax H3 工作流

二、装好 / 更新 ComfyUI(版本必须 ≥ 0.30.0)

这里先钉死一个关键前提:MiniMax H3 要走原生工作流,ComfyUI 版本必须至少是 0.30.0(H3 原生支持就是从这版开始的)。低于这个版本,后面的原生节点根本不会出现,怎么折腾都白搭。

  • 全新安装:官方下载 comfy.org/download,或 GitHub 上的 Comfy-Org/ComfyUI;

  • 已经装了:用 ComfyUI Manager 一键更新到最新,省事。

三、下对模型文件(最容易翻车的一步)

MiniMax H3 这个名字底下挂着好几套文件——旧版、社区插件、官方原生工作流,长得都差不多,但不能混用。要走原生工作流,就只认官方那一组。

模型托管在 Hugging Face 官方仓库 Comfy-Org/MiniMax-H3。我这次用的是下面这套 pruned 低显存组合

用途 文件名 大约大小 放置目录 扩散模型(T2V / I2V) minimax_h3_fl2va_pruned_int8_convrot.safetensors ~19.5 GB models/diffusion_models/ 扩散模型(R2V,可选) minimax_h3_ref2va_pruned_int8_convrot.safetensors ~19.5 GB models/diffusion_models/ 文本编码器 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ~14.6 GB models/text_encoders/ 视频 VAE minimax_h3_video_vae_fp16.safetensors ~4.9 GB models/vae/ 音频 VAE minimax_h3_audio_vae_fp32.safetensors ~0.6 GB models/vae/

几个要点:

  • 扩散模型走的是 pruned + int8 的低显存版本,这也是 4080 16GB 能上车的关键——满血 bf16 / 非 pruned 版本更大,显存吃不下,别下。

  • 我这次做的是图生视频,扩散模型只用到 T2V/I2V 那个(fl2va);只有要做参考生视频(R2V)时,才需要再补上 ref2va 那个,否则可以省下 19.5G。

  • 一套下来光模型就 40–60 G,硬盘得留够空间。

下载方式:

  • 网页直接下:huggingface.co/Comfy-Org/MiniMax-H3

  • 命令行(推荐,稳):

安装 huggingface_hub

pip install -U huggingface_hub hf download Comfy-Org/MiniMax-H3 –local-dir ./models_temp

然后手动把文件挪到对应目录

国内用户用镜像加速:设置环境变量 HF_ENDPOINT=https://hf-mirror.com 后再跑上面的 hf 命令;或者上 ModelScope 搜 MiniMax-H3 / Comfy-Org 相关内容。

四、模型放到哪个目录

下好之后按用途放进 ComfyUI 对应目录即可,目录不存在就自己建一个:

ComfyUI/models/diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors ComfyUI/models/diffusion_models/minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V,可选 ComfyUI/models/text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors ComfyUI/models/vae/minimax_h3_video_vae_fp16.safetensors ComfyUI/models/vae/minimax_h3_audio_vae_fp32.safetensors

两个 VAE(视频 + 音频)都放在 vae/ 目录下,别拆开。

五、加载模板,先跑通一条 5 秒

模型放好后,打开 ComfyUI,按这个流程走:

  • 左侧 Template Library(模板库)→ Video,选 MiniMax H3 相关模板:T2V(文生视频)、I2V(图生视频)、R2V(参考生视频),按需求挑一个;

  • 模板可能弹提示引导下载缺失模型——如果已经手动放好,直接跳过

  • 顺手验证一下原生节点在不在,应该能搜到这三个:MiniMaxH3ImageToVideo、MiniMaxH3ReferenceToVideo、MiniMaxH3SigmaShift,加载器下拉里也能看到刚下的那几个文件。看不到,就回去查两件事:ComfyUI 是不是 0.30.0+、模型是不是放进了官方要求的目录(九成的「节点/文件找不到」都出在这两条);

  • Resolution Selector 节点里,先把 Megapixels 调低(0.4–0.5) 测速,时长选 5 秒起步

  • 写提示词 → Queue Prompt 运行。输出是一段带原生立体声的 MP4

关键是从小开始,别一把梭。MiniMax H3 本地推理能跑,但它不是「想怎么堆参数就怎么堆」的模型,分辨率、时长、分镜复杂度一上去,耗时会显著增长。本地实测:

  • 5 秒 832×480 预览:大约几分钟;

  • 10 秒:约 10 分钟出片,明显更慢;

  • 1024×576 + 10 秒 + 多分镜:本地会非常吃时间。

建议的爬坡顺序:先 5 秒 → 先 832×480 → 先用首帧图生视频 → 角色场景稳了再拉到 1024×576 或更高 → 最后才上长时长和复杂分镜。一句话定位:把它当成「短片段反复试错」的工具,而不是「一把梭哈成片」的工具。

六、最稳的用法:先做首帧,再生成

想要角色一致性更高的视频,最稳的做法不是纯文生视频,而是先把首帧钉死:

  • 先生成角色立绘;

  • 再做一张横版首帧图

  • 拿这张首帧去做 Image-to-Video。

这次效果最稳的一次,就是这么走的:先固定一个小学生角色形象,再做一张「小卖部门口骑自行车」的横版首帧,最后送进 MiniMax H3 生成视频。比纯提示词生成稳得多,尤其体现在:

  • 角色服装一致性;

  • 自行车不乱变形;

  • 场景风格统一;

  • 镜头起始画面可控。

一句话:首帧图就是给模型的锚点,锚点越稳,视频越不飘。

七、我踩过的几个坑(这段可能比教程本身更有用)

1. 模型文件别混用。 最容易翻车的不是参数,而是「看起来都叫 H3,实际上不是一套文件」。旧版 / 社区 / 官方原生混在一起,很容易出现「文本编码器结构不匹配」「模型能识别但跑不通」「VAE 对得上但 CLIP 对不上」,最典型的症状就是文本编码器一加载就报 shape mismatch。

2. Windows 页面文件要给够。 页面文件(虚拟内存)太小,有可能直接报错。这次能稳定跑下去,和把页面文件调大有直接关系。只有 32GB 内存又想跑长一点的视频,千万别把虚拟内存关掉。

3. 中文口播不稳(目前最大的遗留问题)。 提示词里明确写了中文口播、还指定了那句台词,但本地实测:有时后台提示词直接显示乱码,有时中文口播并不完全按要求来——画面能出来,不代表中文一定稳。 所以如果目标是「角色演戏 + 指定中文台词」,我现在更推荐拆开做:先让 MiniMax H3 负责画面和动作,中文台词后期再补配音,可控性高得多。

4. 竖图首帧会把视频比例带歪。 如果首帧是竖图,就算输出参数写了 16:9,结果也可能被首帧构图强行带偏。后来专门先做一张真正的 16:9 横版首帧才修正过来——这一点非常重要,别偷懒。

八、跑完之后,我的真实评价

说实话,本地能把这套东西跑起来,我已经觉得挺能打了。

优点:

  • 原生带音频的视频生成,体验很新鲜;

  • 角色和场景氛围做得出来;

  • 小短片测试已经有可玩性;

  • 用首帧图做控制时,稳定性肉眼可见地提升。

缺点也很实:

  • 本地推理速度不算快;

  • 中文语音不够稳;

  • 长时长、多分镜、高分辨率更吃机器;

  • 想做成一套「可复用的动画生产流程」,工作流还得继续打磨。

所以我现在的判断是:它已经不是「只能看 Demo」的阶段了,可以拿来做简短动画测试;但距离「稳定批量生产完整短片」,还有一段路。 能玩,但先别神话。

九、如果也想本地部署,建议这么开始

别一上来就做复杂项目。最推荐的起步顺序:

  • 装 / 更新 ComfyUI 到 0.30.0+

  • 下官方那套 pruned 低显存文件(别下满血 bf16);

  • 放进官方要求的目录;

  • Template Library 加载 MiniMax H3 模板,Megapixels 0.4–0.5、5 秒、832×480 先跑通一条

  • 先做首帧图,先验证角色一致性和镜头感觉;

  • 最后才挑战长时长、复杂分镜和口播。

这条路,会比「直接 10 秒、15 秒、强口播、强剧情」稳定太多。

结尾

总之这次本地把 MiniMax H3 跑通之后,感受很明确:它已经不是只能看 Demo 的玩具了,是真的可以开始在本地搭工作流、做简短动画片的阶段。

接下来我准备继续测这几件事:双角色一致性、更稳的分镜控制、本地工作流复用,以及中文口播的替代方案。后面整理得更完整了,我会把提示词和工作流一起分享出来。

最后留个问题——中文口播那个坑,如果有人已经在本地稳定实现了「指定中文台词」,欢迎评论区点我一下:到底是提示词姿势不对,还是模型对中文本就偏弱?这条要是能解,本地做完整中文短片的最后一块拼图就补上了。

相似文章