open-gigaai/Giga-World-1
摘要
Giga-World-1 是 GigaAI Research 在 Hugging Face 上发布的视频生成模型,具备多个阶段检查点和用于场景控制的 LoRA 适配器。
查看缓存全文
缓存时间: 2026/07/10 06:10
open-gigaai/Giga-World-1 · Hugging Face
来源:https://huggingface.co/open-gigaai/Giga-World-1 Giga-World-1 主页面
目录结构
model/
├── README.md
├── assets/
│ └── main_page.png
├── before_stage1/ # Stage-1 训练前的基座检查点
│ ├── Wan2p1_1p3B-FunContro-GigaRobo-alpha-diffusers/
│ ├── Wan2p1_1p3B-FunControl-diffusers/
│ └── Wan2p2_5B-FunControl-diffusers/
├── stage1/ # Stage-1 微调检查点
│ ├── nano/ # 小 (1.3B) 变体
│ └── pro/ # 大 (5B) 变体
└── stage2_distill/ # Stage-2 蒸馏检查点
└── ...
训练流程概述
Giga-World-1 训练流程
模型概述
Stage-1 检查点结构
每个 Stage-1 变体(nano/pro)包含两个已发布的产物:完整的 Diffusers 格式检查点和一个场景 LoRA 检查点。
stage1/{nano,pro}/
├── Giga-World-1-*-stage1_final-diffusers/ # 完整的 Diffusers 检查点
│ ├── model_index.json # Diffusers 管道索引
│ ├── transformer/ # DiT / 视频 Transformer 权重
│ ├── vae/ # VAE 权重
│ ├── text_encoder/ # 文本编码器权重
│ ├── tokenizer/ # 分词器文件
│ ├── scheduler/ # 调度器配置
│ ├── image_encoder/ # 图像编码器权重
│ └── image_processor/ # 图像预处理配置
└── Giga-World-1-*-stage1_scene_lora/ # 场景 LoRA 检查点
├── pytorch_lora_weights.safetensors # 推理用的 LoRA 权重
├── transformer_full/ # 完整 Transformer 导出
├── transformer_partial.pth # 部分 Transformer 检查点
├── pytorch_model/ # 训练检查点分片
├── distributed_checkpoint/ # 分布式训练检查点
├── scheduler.bin # 训练调度器状态
├── latest # 最新检查点指针
├── zero_to_fp32.py # ZeRO 检查点转换脚本
└── random_states_*.pkl # 训练随机状态
快速开始
Hugging Face 仓库
https://huggingface.co/GigaAI-Research/Giga-World-1
SDK 下载
# 安装 Hugging Face Hub
pip install huggingface_hub
# 通过 Hugging Face Hub 下载模型快照
from huggingface_hub import snapshot_download
model_dir = snapshot_download(repo_id='GigaAI-Research/Giga-World-1')
Git 下载
git lfs install
git clone https://huggingface.co/GigaAI-Research/Giga-World-1
致谢
我们衷心感谢开源社区以及使这项工作成为可能的项目。
Diffusers (https://github.com/huggingface/diffusers)
LeRobot (https://github.com/huggingface/lerobot)
Hugging Face (https://huggingface.co/)
ModelScope (https://modelscope.cn/)
PyTorch (https://pytorch.org/)
也感谢众多其他开源贡献者提供的工具、模型和社区支持。
许可
除非另有说明,此模型根据 Apache License 2.0 发布。
相似文章
GigaWorld-1: 构建用于机器人策略评估的世界模型路线图
本文系统研究了用于机器人策略评估的世界模型,介绍了WMBench基准测试和GigaWorld-1模型,并指出长程滚动一致性比短期视觉真实性更为关键。
GigaWorld-Policy-0.5:由AutoResearch赋能的更快更强的WAM
GigaWorld-Policy-0.5 是一个用于机器人控制的增强版世界动作模型(WAM),通过混合动作条件世界建模(AC-WM)策略和混合变换器(Mixture-of-Transformers)架构提升训练与推理效率,在本地 RTX 4090 上实现 85 毫秒延迟。
robbyant/lingbot-world-v2-14b-causal-fast
LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。
Genie 3:世界模型的新前沿
DeepMind 发布 Genie 3,一个通用世界模型,能够从文本提示生成交互式环境,分辨率达 720p、帧率 24fps,相比前代版本具有更好的一致性和实时交互能力。
多智能体世界模型(3分钟阅读)
γ-World 是一个生成式多智能体世界模型,支持独立可控、排列对称的智能体,采用 Simplex Rotary Agent Encoding 和 Sparse Hub Attention 技术,实现了实时 24 FPS 的推演,并具有从两个玩家到四个玩家的零样本泛化能力。