gpu-computing

标签

Cards List
#gpu-computing

5090:Windows 或 Linux 用于 Qwen3.8.27b

Reddit r/LocalLLaMA · 昨天

用户寻求建议,关于在配备 RTX 5090 和 96GB RAM 的专用 AI 机上运行 Qwen3.8.27b 模型的最佳操作系统(Windows 或 Linux)和推理服务器,以获得最佳性能。

0 人收藏 0 人点赞
#gpu-computing

@TheAhmadOsman: 预测我们将在不到18个月内,在单张RTX PRO 6000上获得与Kimi K3相当的智能 如何?…

X AI KOLs Following · 2天前 缓存

一位Twitter用户预测,与Kimi K3相当的AI智能将在18个月内运行在单张RTX PRO 6000 GPU上,并后来指出Opus 4.6 Max的质量已经可以在单张RTX 5090上运行。

0 人收藏 0 人点赞
#gpu-computing

SpaceX正式完成对Cursor的收购

TechCrunch AI · 2天前 缓存

SpaceX正式完成以600亿美元收购AI编程初创公司Cursor的交易,将Cursor的AI能力与SpaceX庞大的GPU计算基础设施相结合,以推动AI发展。

0 人收藏 0 人点赞
#gpu-computing

@matthewjgunton: NVIDIA 软件栈中有 3 个基本层级:CUDA C++、PTX 和 SASS。理解全部 3 个层级有助于你明白为什么 CU…

X AI KOLs Timeline · 2026-08-07 缓存

一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。

0 人收藏 0 人点赞
#gpu-computing

@omarsar0: TokTier makes tokenization stateful for agentic serving. Across 153,951 real agent calls with a 94.1% prompt-cache hit …

X AI KOLs Following · 2026-08-03 缓存

TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.

0 人收藏 0 人点赞
#gpu-computing

面向张量核的算子感知混合精度容差校准

arXiv cs.LG · 2026-07-21 缓存

本文提出了一种算子感知的校准方法,用于张量核正确性测试中的绝对容差校准,利用误差分布数据设定更严格的阈值。该方法在缺陷检测中将召回率绝对提升了9.3%,且误报极少,在gpuemu语料库上得到了验证。

0 人收藏 0 人点赞
#gpu-computing

@v0xium: 学习CUDA的最佳方法是通过解决问题。在这个视频中,我从零开始实现了7个初级的CUDA内核:• V…

X AI KOLs Timeline · 2026-07-20 缓存

一个从零开始实现7个初级CUDA内核的视频教程,帮助学习者打下GPU编程的坚实基础。

0 人收藏 0 人点赞
#gpu-computing

SNAP-FM: 物理约束生成建模中的稀疏非线性加速投影

arXiv cs.LG · 2026-07-02 缓存

提出SNAP-FM方法,利用稀疏GPU非线性优化加速物理约束生成建模中的约束投影,在保持精确物理约束满足的同时实现更快的推理。

0 人收藏 0 人点赞
#gpu-computing

一种全GPU工作流:构建高超声速流动物理仿真器

arXiv cs.LG · 2026-06-15 缓存

本文介绍了一种全GPU工作流,通过可微分求解器(JAX-Fluids)和基于残差的精化方法加速高超声速流动神经仿真器的数据生成与训练,提高训练分布之外的物理一致性和可靠性。

0 人收藏 0 人点赞
#gpu-computing

高斯点溅射

Hacker News Top · 2026-06-04 缓存

研究人员提出了高斯点溅射(Gaussian Point Splatting),这是一种随机渲染方法,利用像素大小的不透明点和64位GPU原子操作,能够实时渲染数亿个高斯点。该方法已被SIGGRAPH 2026接收,采用层次化剔除与并行编程原语,实现均匀的工作负载分配,与原始高斯溅射相比仅存在轻微的噪声差异。

0 人收藏 0 人点赞
#gpu-computing

@charles_irl: CuTe 和 CuTe DSL 文章包含最小代码片段,说明核心原则和基本用法。这些片段…

X AI KOLs Following · 2026-05-26

CuTe 和 CuTe DSL 文章提供了最小代码片段和 Modal Notebooks,以便动手学习。

0 人收藏 0 人点赞
#gpu-computing

ROCm 7.13 夜间版新增 Strix Halo 优化

Reddit r/LocalLLaMA · 2026-05-17

AMD 的 ROCm 7.13 技术预览版为 Strix Halo(Ryzen AI Max 300)新增优化,并将 ROCprof Trace Decoder 开源。

0 人收藏 0 人点赞
#gpu-computing

为大语言模型推理提供高性能且灵活的模型内部可观测性

arXiv cs.LG · 2026-05-13 缓存

本文介绍了 DMI-Lib,这是一种高速深层模型检查器,通过将监控与推理热点路径解耦,实现了大语言模型推理的高效内部可观测性。

0 人收藏 0 人点赞
#gpu-computing

开源了用于 GPU 工作负载执行的 MCP 服务器,寻求反馈

Reddit r/AI_Agents · 2026-05-11

Jungle Grid 已开源一款 MCP 服务器,旨在允许 AI 智能体自主估算、提交并监控用于推理和训练任务的 GPU 工作负载。

0 人收藏 0 人点赞
#gpu-computing

@antirez: DS4 正在 DGX Spark (GB10 / CUDA) 上运行,目前为私有分支。12 tokens/sec,此系统的内存带宽受限……

X AI KOLs Timeline · 2026-05-10 缓存

Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。

0 人收藏 0 人点赞
#gpu-computing

Mojo 1.0 Beta

Hacker News Top · 2026-05-08 缓存

Modular 宣布推出 Mojo 1.0 Beta,这是一种高性能编程语言,将 Python 的易用性与编译型语言的速度相结合,专为 AI 和系统编程设计。

0 人收藏 0 人点赞
#gpu-computing

cuda-oxide 手册

Lobsters Hottest · 2026-05-08 缓存

cuda-oxide 是一个实验性的 Rust 到 CUDA 编译器,允许开发者编写安全、符合 Rust 惯用法的 GPU 内核,并直接编译为 PTX。

0 人收藏 0 人点赞
#gpu-computing

cuda-oxide: 一款实验性的 Rust-to-CUDA 编译器

Lobsters Hottest · 2026-05-08 缓存

cuda-oxide 是 NVIDIA 发布的一款实验性 Rust-to-CUDA 编译器后端,支持纯 Rust GPU 内核开发,无需外部语言绑定。

0 人收藏 0 人点赞
#gpu-computing

解读早期宇宙

NVIDIA Blog · 2026-04-23 缓存

本文介绍了 NVIDIA GPU 和 Morpheus 等 AI 模型如何帮助加州大学圣克鲁兹分校的天文学家处理詹姆斯·韦伯太空望远镜产生的海量数据集,从而加速早期宇宙星系的发现与分类。

0 人收藏 0 人点赞
#gpu-computing

cupy/cupy

GitHub Trending (daily) · 2026-06-28 缓存

CuPy是一个GPU加速的库,可作为NumPy/SciPy的直接替代品,支持在NVIDIA CUDA和AMD ROCm平台上进行高效的数组运算。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈