gpu

标签

Cards List
#gpu

降低图形API复杂性:为现代GPU设计的全新方案

Lobsters Hottest · 19小时前 缓存

塞巴斯蒂安·阿尔托宁批评了现代图形API因遗留硬件抽象而过于复杂的问题,并提出了一种采用64位GPU指针和类CUDA内存管理的全新设计方案。

0 人收藏 0 人点赞
#gpu

12GB显存的小伙伴们,我们的计划是什么?

Reddit r/LocalLLaMA · 昨天

讨论在12GB显存上运行LLM,注意到当前焦点是稠密模型,如Muse Glimmer 30B和Qwen 3.8 27B,并质疑是否需要升级到24GB显存。

0 人收藏 0 人点赞
#gpu

传闻中的50系列Super更新将各型号显存提升50%

Reddit r/LocalLLaMA · 昨天

泄露的规格表明,Nvidia传闻中的50系列Super更新将使用新型3GB GDDR7模块,增加多款GPU的显存,使其对本地LLM使用更具吸引力,但价格仍令人担忧。

0 人收藏 0 人点赞
#gpu

据报道,英伟达因内存短缺加剧正在测试Rubin Ultra的较低内存配置——测试设计包括低至192 GB并退回HBM4

Reddit r/LocalLLaMA · 昨天 缓存

据报道,由于HBM供应紧张,英伟达正在测试其即将推出的Rubin Ultra加速器的低内存版本,包括192 GB或256 GB的配置,并从HBM4E切换至HBM4。

0 人收藏 0 人点赞
#gpu

不,本地模型不会赢

Lobsters Hottest · 昨天 缓存

评论文章,认为本地 AI 模型永远不会赢,因为它们比数据中心推理更弱、更昂贵且效率更低,原因在于批处理和 GPU 优势。

0 人收藏 0 人点赞
#gpu

Rust SIMD on the GPU

Hacker News Top · 昨天 缓存

VectorWare announces that Rust's portable SIMD (core::simd) now works on the GPU, mapping SIMD vectors to warp lanes and enabling familiar Rust abstractions for GPU programming.

0 人收藏 0 人点赞
#gpu

基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模

arXiv cs.LG · 2天前 缓存

本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。

0 人收藏 0 人点赞
#gpu

@TheAhmadOsman: 大约一年前,你几乎可以免费获得一块RTX PRO 6000,约合1.2个DGX Sparks。此后价格不知何故涨到了原来的三倍。美好的…

X AI KOLs Timeline · 3天前 缓存

指出RTX PRO 6000 GPU在一年前可以很便宜地获得,但此后价格涨到了原来的三倍。

0 人收藏 0 人点赞
#gpu

RTX 5090 96GB现身阿里巴巴?

Reddit r/LocalLLaMA · 3天前

一款据称配备96GB显存的RTX 5090在阿里巴巴上现身,暗示英伟达可能会推出新的GPU版本。

0 人收藏 0 人点赞
#gpu

为消费级Nvidia显卡启用PCI-E P2P将带来超乎你想象的收益

Reddit r/LocalLLaMA · 3天前

通过打补丁的驱动和vLLM环境变量为消费级Nvidia GPU启用PCI-E点对点(P2P),如基准测试所示,可免费获得约25%的预填充吞吐量提升。

0 人收藏 0 人点赞
#gpu

@TheAhmadOsman:顺便说一下,RTX PRO 6000 = 1.8TB/s,DGX Spark = 273GB/s。如果你的目标是本地AI代理和代理集群,应该追求更高的带宽……

X AI KOLs Timeline · 3天前 缓存

一条推文强调了RTX PRO 6000(1.8TB/s)和DGX Spark(273GB/s)之间的巨大带宽差异,认为对于本地AI代理和代理集群来说,更高的带宽至关重要。

0 人收藏 0 人点赞
#gpu

@v0xium:一篇很棒的文章,介绍了 ZeRO(零冗余优化器),这是一套内存优化系统,用于高效……

X AI KOLs Timeline · 3天前 缓存

重点介绍了一篇引入 ZeRO(零冗余优化器)的文章,这是一种内存优化系统,用于在有限的 GPU 内存上高效训练超大规模模型。

0 人收藏 0 人点赞
#gpu

@TheAhmadOsman:在 DGX Station 上运行 DeepSeek V4 Flash 0731 的一些数据

X AI KOLs Timeline · 4天前 缓存

Ahmad Osman 分享了在 NVIDIA DGX Station 上运行 DeepSeek V4 Flash 0731 的性能数据。

0 人收藏 0 人点赞
#gpu

llama.cpp PR 报告:仅切换一个 SYCL 内核,Intel Battlemage 上量化 KV 解码在 118K 上下文最高提速 169%

Reddit r/LocalLLaMA · 4天前

llama.cpp 的一个 PR 提议将 Intel Battlemage 上的量化 KV 解码从 VEC 切换到 TILE SYCL 内核,据报道在 118K 上下文下解码速度提升最高约 169%。该 PR 目前处于开放状态,存在一些注意事项,且独立验证有限。

0 人收藏 0 人点赞
#gpu

@mohitwt_: 推理工程第20/30天:构建一个推测解码运行时,用较小的模型提前草拟多个token…

X AI KOLs Following · 4天前 缓存

一位开发者正在构建Octane,这是一个面向消费级硬件上的本地LLM推理的推测解码运行时,目标是实现2-3倍的加速,同时保持完全相同的输出质量。目前处于积极开发阶段,已实现分页KV缓存、连续批处理和批量注意力。

0 人收藏 0 人点赞
#gpu

面向GPU加速量子电路模拟的张量网络收缩计划的排序学习

arXiv cs.LG · 5天前 缓存

一篇研究论文,提出了一种排序学习框架,用于为GPU加速的量子电路模拟选择高效张量网络收缩计划,该框架使用从GPU测量中训练的梯度提升排序器。

0 人收藏 0 人点赞
#gpu

@CycleDecoded: 别再用原生 HuggingFace硬扛本地大模型推理了,显存直接爆满,吞吐量慢得像乌龟爬! 伯克利实验室出品的 vLLM,用搞操作系统内存分页(PagedAttention)的那套黑科技,直接把 GPU 显存压榨到了极限,KV Cache…

X AI KOLs Timeline · 5天前 缓存

伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。

0 人收藏 0 人点赞
#gpu

@julien_c: “你的数据托管在 Hugging Face 上。你的计算运行在 Vast GPU 上。”我太喜欢了!!

X AI KOLs Timeline · 5天前 缓存

vast.ai 现在支持将 Hugging Face Storage Buckets 作为云连接,允许租用的 GPU 实例直接从 HF 存储桶拉取数据集和检查点,并将结果推送回去,无需手动传输。

0 人收藏 0 人点赞
#gpu

我将vLLM的服务栈移植到C++20:66 MiB二进制,推理时无Python,输出与vLLM逐token核对

Reddit r/LocalLLaMA · 5天前

作者将vLLM的服务栈移植到C++20,生成一个66 MiB的二进制文件,推理时无Python,可逐token与vLLM核对,且在测试硬件上吞吐量具竞争力。

0 人收藏 0 人点赞
#gpu

终于为 Futhark 添加递归函数

Lobsters Hottest · 6天前 缓存

一篇博客文章,宣布在 Futhark 编程语言中加入递归函数,解释了递归在 GPU 后端上的历史性挑战以及所涉及的设计权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈