open-gigaai/Giga-World-1

Hugging Face Models Trending 模型

摘要

Giga-World-1 是 GigaAI Research 在 Hugging Face 上发布的视频生成模型,具备多个阶段检查点和用于场景控制的 LoRA 适配器。

标签:diffusers, safetensors, license:apache-2.0, region:us
查看原文
查看缓存全文

缓存时间: 2026/07/10 06:10

open-gigaai/Giga-World-1 · Hugging Face

来源:https://huggingface.co/open-gigaai/Giga-World-1 Giga-World-1 主页面

目录结构

model/
├── README.md
├── assets/
│   └── main_page.png
├── before_stage1/                       # Stage-1 训练前的基座检查点
│   ├── Wan2p1_1p3B-FunContro-GigaRobo-alpha-diffusers/
│   ├── Wan2p1_1p3B-FunControl-diffusers/
│   └── Wan2p2_5B-FunControl-diffusers/
├── stage1/                              # Stage-1 微调检查点
│   ├── nano/                            # 小 (1.3B) 变体
│   └── pro/                             # 大 (5B) 变体
└── stage2_distill/                      # Stage-2 蒸馏检查点
    └── ...

训练流程概述

Giga-World-1 训练流程

模型概述

Stage-1 检查点结构

每个 Stage-1 变体(nano/pro)包含两个已发布的产物:完整的 Diffusers 格式检查点和一个场景 LoRA 检查点。

stage1/{nano,pro}/
├── Giga-World-1-*-stage1_final-diffusers/         # 完整的 Diffusers 检查点
│   ├── model_index.json                           # Diffusers 管道索引
│   ├── transformer/                               # DiT / 视频 Transformer 权重
│   ├── vae/                                       # VAE 权重
│   ├── text_encoder/                              # 文本编码器权重
│   ├── tokenizer/                                 # 分词器文件
│   ├── scheduler/                                 # 调度器配置
│   ├── image_encoder/                             # 图像编码器权重
│   └── image_processor/                           # 图像预处理配置
└── Giga-World-1-*-stage1_scene_lora/              # 场景 LoRA 检查点
    ├── pytorch_lora_weights.safetensors           # 推理用的 LoRA 权重
    ├── transformer_full/                          # 完整 Transformer 导出
    ├── transformer_partial.pth                    # 部分 Transformer 检查点
    ├── pytorch_model/                             # 训练检查点分片
    ├── distributed_checkpoint/                    # 分布式训练检查点
    ├── scheduler.bin                              # 训练调度器状态
    ├── latest                                     # 最新检查点指针
    ├── zero_to_fp32.py                            # ZeRO 检查点转换脚本
    └── random_states_*.pkl                        # 训练随机状态

快速开始

Hugging Face 仓库

https://huggingface.co/GigaAI-Research/Giga-World-1

SDK 下载

# 安装 Hugging Face Hub
pip install huggingface_hub
# 通过 Hugging Face Hub 下载模型快照
from huggingface_hub import snapshot_download

model_dir = snapshot_download(repo_id='GigaAI-Research/Giga-World-1')

Git 下载

git lfs install
git clone https://huggingface.co/GigaAI-Research/Giga-World-1

致谢

我们衷心感谢开源社区以及使这项工作成为可能的项目。

Diffusers (https://github.com/huggingface/diffusers)
LeRobot (https://github.com/huggingface/lerobot)
Hugging Face (https://huggingface.co/)
ModelScope (https://modelscope.cn/)
PyTorch (https://pytorch.org/)

也感谢众多其他开源贡献者提供的工具、模型和社区支持。

许可

除非另有说明,此模型根据 Apache License 2.0 发布。

相似文章

GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM

Hugging Face Daily Papers

GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。

robbyant/lingbot-world-v2-14b-causal-fast

Hugging Face Models Trending

LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。

Genie 3:世界模型的新前沿

Google DeepMind Blog

DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。

多智能体世界模型(3分钟阅读)

TLDR AI

γ-World 是一个生成式多智能体世界模型,支持独立可控、排列对称的智能体,采用 Simplex Rotary Agent Encoding 和 Sparse Hub Attention 技术,实现了实时 24 FPS 的推演,并具有从两个玩家到四个玩家的零样本泛化能力。