标签
一个从零开始实现7个初级CUDA内核的视频教程,帮助学习者打下GPU编程的坚实基础。
提出SNAP-FM方法,利用稀疏GPU非线性优化加速物理约束生成建模中的约束投影,在保持精确物理约束满足的同时实现更快的推理。
本文介绍了一种全GPU工作流,通过可微分求解器(JAX-Fluids)和基于残差的精化方法加速高超声速流动神经仿真器的数据生成与训练,提高训练分布之外的物理一致性和可靠性。
研究人员提出了高斯点溅射(Gaussian Point Splatting),这是一种随机渲染方法,利用像素大小的不透明点和64位GPU原子操作,能够实时渲染数亿个高斯点。该方法已被SIGGRAPH 2026接收,采用层次化剔除与并行编程原语,实现均匀的工作负载分配,与原始高斯溅射相比仅存在轻微的噪声差异。
CuTe 和 CuTe DSL 文章提供了最小代码片段和 Modal Notebooks,以便动手学习。
AMD 的 ROCm 7.13 技术预览版为 Strix Halo(Ryzen AI Max 300)新增优化,并将 ROCprof Trace Decoder 开源。
本文介绍了 DMI-Lib,这是一种高速深层模型检查器,通过将监控与推理热点路径解耦,实现了大语言模型推理的高效内部可观测性。
Jungle Grid 已开源一款 MCP 服务器,旨在允许 AI 智能体自主估算、提交并监控用于推理和训练任务的 GPU 工作负载。
Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。
Modular 宣布推出 Mojo 1.0 Beta,这是一种高性能编程语言,将 Python 的易用性与编译型语言的速度相结合,专为 AI 和系统编程设计。
cuda-oxide 是一个实验性的 Rust 到 CUDA 编译器,允许开发者编写安全、符合 Rust 惯用法的 GPU 内核,并直接编译为 PTX。
cuda-oxide 是 NVIDIA 发布的一款实验性 Rust-to-CUDA 编译器后端,支持纯 Rust GPU 内核开发,无需外部语言绑定。
本文介绍了 NVIDIA GPU 和 Morpheus 等 AI 模型如何帮助加州大学圣克鲁兹分校的天文学家处理詹姆斯·韦伯太空望远镜产生的海量数据集,从而加速早期宇宙星系的发现与分类。
本文介绍了 Real-ESRGAN AI 超分辨率模型在 Replicate 平台上的部署情况,其特点是成本低、开源可用,并且在 Nvidia A100 GPU 上运行快速。
TensorFlow 是一个端到端的开源机器学习平台,为研究人员和开发者提供工具、库和社区资源,用于构建和部署机器学习驱动的应用程序。
mattsays/sam3-image 是一个 AI 模型,可在 Replicate 上使用,每次运行成本为 $0.0015,运行在 Nvidia L40S GPU 上,并且开源,可通过 Docker 在本地执行。
CuPy是一个GPU加速的库,可作为NumPy/SciPy的直接替代品,支持在NVIDIA CUDA和AMD ROCm平台上进行高效的数组运算。