标签
作者分享了使用CMP170矿卡构建的DIY CUDA设备设置,用于运行AI模型如Qwen Flash Next,实现了出色的推理性能。
一个GitHub仓库,提供结构化的100天LLM推理工程学习计划,涵盖从CUDA内核到自动扩展的主题,并配有可运行的脚本。
一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。
据《华尔街日报》报道,中国机器人以86%的占比主导全球人形机器人出货量,英伟达正将其类CUDA生态系统扩展至这一高度集中的机器人市场。
llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。
本文介绍了DataKernelBench,这是一个用于评估LLMs在优化GPU内核以处理数据库查询方面的基准测试,相比如torch.compile等基线方法实现了加速。
这是 NVIDIA 开放 GPU 内核模块的一个分支,它支持消费级 GeForce GPU(3090、4090、5090)之间的 PCIe 点对点通信,允许直接通过 PCIe 进行数据传输,从而显著提升多 GPU 性能。
讨论比较了CUDA与MLX在Apple的M5 Ultra Mac Studio背景下的成熟度,强调需要竞争来优化本地AI硬件,这可能使Apple超越NVIDIA。
本文提出了一种特征主码本布局,用于内存高效的稀疏二进制自组织映射,使得在单个GPU上训练多达105万神经元的大规模映射成为可能,并在MEDLINE数据上实现了显著的加速。
在 Hot Chips 2026 上,Nvidia 宣布了将 CUDA 支持扩展到 RISC-V CPU 的计划,概述了具体的硬件要求,如服务器级CPU、ACPI和PCIe一致性,以实现高效的GPU计算。
用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。
这篇博文详细介绍了NVIDIA RTX 4090上GPU内存读取指令的硬件路径,解释了CUDA内核如何通过L1缓存和DRAM等组件访问内存,以提供性能洞察。
NVIDIA 已发布一个由 NVIDIA 托管的 CUDA MCP 服务器和一个开源的 Nsight Copilot Blueprint,以提供 AI 辅助的 CUDA 开发,包括文档访问、代码生成和性能分析。
一篇详细文章,介绍如何通过几何分析、CUDA编程和OpenStreetMap数据过滤,从照片中解决OSINT挑战来定位岛屿。
PTXBench被介绍为一个基准,用于评估和适配大型语言模型,以使用架构特定的PTX优化GPU内核,显示性能不均和微调见解。
KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。
一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。
Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。
有用户报告称,将 CUDA 从 13.2 更新到 13.3 可以修复 DeepSeek V4 Flash 0731 的循环问题,使模型在长编码任务中重新可用。