SOTA图像生成本地部署 NVIDIA Cosmos3(64B) INT4量化 CUDA/MLX
摘要
NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。
Cosmos3 INT4文本到图像 + 图像到视频 在Apple Silicon上 — 代码、权重和Grok比较 GitHub - https://github.com/gtrg55/cosmos3-quant-mlx-cuda HF权重 - https://huggingface.co/JuliaML/Cosmos3-Super-Text2Image-4Step-INT4-G64-BF16 单个剪辑在M4 MAX 128GB Mac上大约需要5分钟 Cosmos3 - 一个64B参数模型
相似文章
nvidia/llama-embed-nemotron-8b 的 MLX 16/8/4/2 位量化版本
用户将 Nvidia 的 Llama-Embed-Nemotron-8B 模型转换为 MLX 格式,包含 fp16、8位、4位和2位量化,从而能够通过 mlx-embeddings 在 Apple Silicon 上实现在进程内加载嵌入向量。
nvidia/Cosmos3-Super
NVIDIA 发布了 Cosmos3,这是一套用于物理AI的全模态世界基础模型,能够从多种输入生成视频、图像、音频和动作指令,并提供针对不同任务(如策略学习和图像到视频生成)的版本。
Qwen3.8-27B 混合 IQ4_XS 量化版本,适用于16GB RAM
这是一个使用 IQ4_XS 量化的 Qwen3.8-27B AI模型的量化版本,针对16GB RAM系统进行了优化,并提供使用各种工具如 llama.cpp 和 Ollama 的本地部署指南。
@swyx: 链接汇总:
NVIDIA 发布 Cosmos 3(混合 Transformer 模型,参数最高达 64B)、Nemotron 3 Ultra(550B-A55B 大语言模型),并在 Computex 2026 上预览了 RTX Spark 个人超级芯片,在多个开源模型排行榜上达到 SOTA。
@basecampbernie: https://x.com/basecampbernie/status/2074262192304832535
本文详细介绍了作者在GIGABYTE AI TOP ATOM(DGX Spark)工作站上运行NVFP4量化图像和视频生成模型的设置与基准测试,使用FLUX.2、Qwen-Image和LTX-2.3等模型(含同步音频的视频)取得了令人印象深刻的性能。