标签
llama.cpp的一个分支引入了TurboQuant TQ3_4S量化方法,该方法映射到Blackwell FP4张量核心,在GB10上实现高达221%的提示处理加速,同时以Q3的大小保持接近Q4的质量。
一条推文指出,经过 abliterated 处理、NVFP4 量化的 Gemma-4-12B 模型(7.7 GB)在实际任务中能够与 Qwen 3.6-35B 相媲美,同时在 Blackwell GPU 上运行快速,展现了显著的效率提升。
英伟达发布了 RTX Spark,这是一款专为 Windows PC 设计的 Arm 芯片,集成了 20 核 Grace CPU、最高 6,144 个 Blackwell GPU 核心和最高 128GB 统一内存,旨在为轻薄笔记本和紧凑台式机带来高性能和 AI 能力。
LongLive-2.0 引入了一种基于NVFP4的并行基础设施,用于长视频生成,在训练上实现了高达2.15倍的加速,推理上实现了1.84倍的加速,5B模型达到了45.7 FPS。