标签
塞巴斯蒂安·阿尔托宁批评了现代图形API因遗留硬件抽象而过于复杂的问题,并提出了一种采用64位GPU指针和类CUDA内存管理的全新设计方案。
讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。
泄露的规格表明,Nvidia传闻中的50系列Super更新将使用新型3GB GDDR7模块,增加多款GPU的显存,使其对本地LLM使用更具吸引力,但价格仍令人担忧。
据报道,由于HBM供应紧张,英伟达正在测试其即将推出的Rubin Ultra加速器的低内存版本,包括192 GB或256 GB的配置,并从HBM4E切换至HBM4。
VectorWare announces that Rust's portable SIMD (core::simd) now works on the GPU, mapping SIMD vectors to warp lanes and enabling familiar Rust abstractions for GPU programming.
本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。
指出RTX PRO 6000 GPU在一年前可以很便宜地获得,但此后价格涨到了原来的三倍。
通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。
一条推文强调了RTX PRO 6000(1.8TB/s)和DGX Spark(273GB/s)之间的巨大带宽差异,认为对于本地AI代理和代理集群来说,更高的带宽至关重要。
重点介绍了一篇引入 ZeRO(零冗余优化器)的文章,这是一种内存优化系统,用于在有限的 GPU 内存上高效训练超大规模模型。
Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。
llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。
一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。
一篇研究论文,提出了一种排序学习框架,用于为GPU加速的量子电路模拟选择高效张量网络收缩计划,该框架使用从GPU测量中训练的梯度提升排序器。
伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。
vast.ai 现在支持将 Hugging Face Storage Buckets 作为云连接,允许租用的 GPU 实例直接从 HF 存储桶拉取数据集和检查点,并将结果推送回去,无需手动传输。
作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。