标签
用户寻求建议,关于在配备 RTX 5090 和 96GB RAM 的专用 AI 机上运行 Qwen3.8.27b 模型的最佳操作系统(Windows 或 Linux)和推理服务器,以获得最佳性能。
一位Twitter用户预测,与Kimi K3相当的AI智能将在18个月内运行在单张RTX PRO 6000 GPU上,并后来指出Opus 4.6 Max的质量已经可以在单张RTX 5090上运行。
SpaceX正式完成以600亿美元收购AI编程初创公司Cursor的交易,将Cursor的AI能力与SpaceX庞大的GPU计算基础设施相结合,以推动AI发展。
一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。
TokTier is a stateful tokenization service that cuts tokenization overhead in agentic LLM serving by reusing stable token boundaries and running exact CPU/GPU tokenization, reducing time-to-first-token by 16–34% under vLLM.
本文提出了一种算子感知的校准方法,用于张量核正确性测试中的绝对容差校准,利用误差分布数据设定更严格的阈值。该方法在缺陷检测中将召回率绝对提升了9.3%,且误报极少,在gpuemu语料库上得到了验证。
一个从零开始实现7个初级CUDA内核的视频教程,帮助学习者打下GPU编程的坚实基础。
提出SNAP-FM方法,利用稀疏GPU非线性优化加速物理约束生成建模中的约束投影,在保持精确物理约束满足的同时实现更快的推理。
本文介绍了一种全GPU工作流,通过可微分求解器(JAX-Fluids)和基于残差的精化方法加速高超声速流动神经仿真器的数据生成与训练,提高训练分布之外的物理一致性和可靠性。
研究人员提出了高斯点溅射(Gaussian Point Splatting),这是一种随机渲染方法,利用像素大小的不透明点和64位GPU原子操作,能够实时渲染数亿个高斯点。该方法已被SIGGRAPH 2026接收,采用层次化剔除与并行编程原语,实现均匀的工作负载分配,与原始高斯溅射相比仅存在轻微的噪声差异。
CuTe 和 CuTe DSL 文章提供了最小代码片段和 Modal Notebooks,以便动手学习。
AMD 的 ROCm 7.13 技术预览版为 Strix Halo(Ryzen AI Max 300)新增优化,并将 ROCprof Trace Decoder 开源。
本文介绍了 DMI-Lib,这是一种高速深层模型检查器,通过将监控与推理热点路径解耦,实现了大语言模型推理的高效内部可观测性。
Jungle Grid 已开源一款 MCP 服务器,旨在允许 AI 智能体自主估算、提交并监控用于推理和训练任务的 GPU 工作负载。
Antirez 报告了在 DGX Spark (GB10) 上对 DS4 推理进行的基准测试,指出生成速度为 12 tokens/sec,预填充性能较高,并计划在该代码库成熟后将其合并。
Modular 宣布推出 Mojo 1.0 Beta,这是一种高性能编程语言,将 Python 的易用性与编译型语言的速度相结合,专为 AI 和系统编程设计。
cuda-oxide 是一个实验性的 Rust 到 CUDA 编译器,允许开发者编写安全、符合 Rust 惯用法的 GPU 内核,并直接编译为 PTX。
cuda-oxide 是 NVIDIA 发布的一款实验性 Rust-to-CUDA 编译器后端,支持纯 Rust GPU 内核开发,无需外部语言绑定。
本文介绍了 NVIDIA GPU 和 Morpheus 等 AI 模型如何帮助加州大学圣克鲁兹分校的天文学家处理詹姆斯·韦伯太空望远镜产生的海量数据集,从而加速早期宇宙星系的发现与分类。
CuPy是一个GPU加速的库,可作为NumPy/SciPy的直接替代品,支持在NVIDIA CUDA和AMD ROCm平台上进行高效的数组运算。