@DeRonin_: 这些人搭建了一个无限电影生成机器... @fal 的经过后训练的 Minimax H3 Max 比原版快50倍…
摘要
FastVideo 发布了一款开源的、经过后训练的 Minimax H3 模型,它能以50倍的速度生成视频,仅需3秒计算时间即可输出5秒的视频内容,适用于文本到音频视频的生成。
查看缓存全文
缓存时间: 2026/08/29 20:08
这些家伙造出了一台无限电影生成机… @fal 微调的 Minimax H3 Max 速度提升50倍:仅需3秒计算就能生成5秒视频,其生成速度甚至快过播放速度。我找到了开源版本:https://huggingface.co/FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree…
FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree · Hugging Face
来源:https://huggingface.co/FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree FastVideo (https://github.com/hao-ai-lab/FastVideo)
FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree
FastVideo (https://github.com/hao-ai-lab/FastVideo) 推荐的 FastH3 Preview v1 检查点。它能通过四次 Transformer 前向传播,从文本生成同步的视频与音频。这个 step-1300 模型采用了无数据 DMD2 与 90% 稀疏度的 VSA-H3 进行训练。
博客 (https://haoailab.com/blogs/fasth3-preview/)·匹配 LoRA (https://huggingface.co/FastVideo/FastVideo-FastH3-4-step-Preview-v1-LoRA/tree/main/vsa-datafree)·FastH3 合集 (https://huggingface.co/collections/FastVideo/fastvideo-fasth3)
本检查点需要 FastVideo 的 VSA-H3 注意力后端。如果您希望仅下载蒸馏适配器,请使用上方的匹配 LoRA。
使用 FastVideo 运行
安装 uv (https://docs.astral.sh/uv/getting-started/installation/),然后按照下方的 CUDA 13 / Blackwell 路径操作。这将选择 FastVideo 已发布的 CUDA kernel wheel 包,而非本地编译内核。其他平台请参阅安装指南 (https://hao-ai-lab.github.io/FastVideo/getting_started/installation/)。
git clone https://github.com/hao-ai-lab/FastVideo.git cd FastVideo uv venv --python 3.12 --seed source .venv/bin/activate UV_TORCH_BACKEND=cu130 uv pip install \ --no-sources-package fastvideo-kernel \ -e ".[fasth3]"
python examples/inference/basic/basic_fasth3.py \ --model-path FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree \ --prompt "your prompt" \ --no-warmup \ --repeats 1
测试使用的默认设置为四块 B200 GPU 和训练好的四步前向调度方案。在其他多 GPU CUDA 系统上,请遵循安装指南并添加 --no-replicated-dit --vsa-kernel triton --no-fa4。GPU 数量必须能整除 H3 的 56 个注意力头。
适用范围
此预览版支持文本到音视频生成。FL2VA 和 Ref2VA 未经蒸馏。对于高难度运动、精细细节以及部分音频,效果可能仍不及基础版 MiniMax H3 模型。本检查点继承了 MiniMax H3 社区许可证 (https://huggingface.co/FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree/tree/main/LICENSE)。
致谢
我们感谢 Nuva Lab (https://nuvalab.ai/) 凭借其在实际创意视频智能体工作负载中的经验,为 FastH3 带来了生产环境所需的落地能力。其面向生产的微调洞见有助于将开源研究与商业视频工作流的实用数据辅助蒸馏桥接起来,下一步的重点将是 Omni Ref。
我们感谢 NVIDIA FastGen (https://github.com/NVlabs/FastGen) 团队提供的 DMD2 (https://arxiv.org/abs/2405.14867) 框架以及 H3 参考实验,这帮助我们校准了评分时钟、模态转换和反向模拟。
同时感谢 MiniMax (https://huggingface.co/MiniMaxAI/MiniMax-H3) 发布 H3-Base,以及 vLLM 项目 (https://vllm.ai/)、NVIDIA (https://www.nvidia.com/en-us/) 和 MBZUAI (https://mbzuai.ac.ae/) 对 FastVideo (https://github.com/hao-ai-lab/FastVideo) 持续的赞助与支持。
Rehan Sheikh (@rehan_shei): Minimax H3 Max 生成视频的速度快过播放速度,所以我把它接到了 Twitch 直播上!现在你可以观看无限的跨维度频道了 - 直播链接见下方。
相似文章
MiniMax H3 Max(由 fal 在 MiniMax H3 上后训练)树立了视频生成的新 Pareto Frontier,速度比基础模型快近50倍。
MiniMax H3 Max 由 fal 在 MiniMax H3 上进行后训练,为视频生成树立了新的 Pareto Frontier,生成时间比基础模型快近50倍,在 image-to-video 和 text-to-video 任务中分别实现了18倍和24倍的速度提升。
MiniMax H3(10分钟阅读)
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
介绍 fal 推出的 H3 Max(5分钟阅读)
H3 Max 是 MiniMax H3 的后训练版本,专为最大速度优化。它在视频质量、提示理解和美学方面的人类偏好评估中排名第一,同时生成视频的速度比官方端点快多达35倍。
@nazranf_: H3 Max 正在以不到3秒的速度生成5秒的768p视频,带有原生立体声音频。这比实时还快,而且i…
H3 Max 是一个AI模型,能在不到3秒内生成5秒的768p视频,带有原生立体声音频,比实时更快,并在Design Arena和Artificial Analysis的图转视频类别中排名第一。一个演示展示了其在Twitch上的连续视频流应用。
FastVideo/FastVideo-FastH3-四步-预览版-v1-VSA-无数据
FastVideo 发布 FastH3 预览版 v1,这是一个 AI 模型检查点,能够从文本生成同步视频和音频,使用四次 Transformer 前向传播,通过无数据 DMD2 和 VSA-H3 在 90% 稀疏度下训练。