cuda

标签

Cards List
#cuda

CMP170Hx “Spark” 设备

Reddit r/LocalLLaMA ↗ · 2026-09-01

作者分享了使用CMP170矿卡构建的DIY CUDA设备设置,用于运行AI模型如Qwen Flash Next,实现了出色的推理性能。

0 人收藏 0 人点赞
#cuda

@suraj_sharma14:如果你想精通推理工程,这个资源是一座金矿:https://github.com/elizabetht/10…

X AI KOLs Timeline ↗ · 2026-08-31 缓存

一个GitHub仓库,提供结构化的100天LLM推理工程学习计划,涵盖从CUDA内核到自动扩展的主题,并配有可运行的脚本。

0 人收藏 0 人点赞
#cuda

(NInfer分支) 我为Qwen-3.8 27B在双5090显卡上实现1M上下文的尝试

Reddit r/LocalLLaMA ↗ · 2026-08-29

一位开发者分支了NInfer,这是一个C++20/CUDA推理引擎,添加了张量并行和YaRN绳索缩放,使得Qwen3.8-27B能够在双5090显卡上运行1M token上下文,并在特定解码场景中优于vLLM。

0 人收藏 0 人点赞
#cuda

@rohanpaul_ai:中国机器人占据全球人形机器人出货量的86%,英伟达正将其CUDA模式扩展至这一集中度极高的市场...

X AI KOLs Timeline ↗ · 2026-08-29 缓存

据《华尔街日报》报道,中国机器人以86%的占比主导全球人形机器人出货量,英伟达正将其类CUDA生态系统扩展至这一高度集中的机器人市场。

0 人收藏 0 人点赞
#cuda

@sachindetrax: 262K 上下文长度,运行于 16GB RTX 5070 Ti 显卡上。Qwen 3.8 27B Q3 模型达到约 25 tok/s,同时一个自适应 llama.cpp 分支在 RAM 和 VRAM 之间流式传输 KV 缓存…

X AI KOLs Timeline ↗ · 2026-08-29 缓存

llama.cpp 的一个自适应 KV 缓存流式传输分支,使得在 16GB RTX 5070 Ti GPU 上运行 Qwen 3.8 27B 模型并支持 262K 上下文成为可能,通过在内存与显存间高效管理,实现了约 25 tok/s 的速度。

0 人收藏 0 人点赞
#cuda

DataKernelBench: LLMs能否优化GPU数据库查询?

arXiv cs.CL ↗ · 2026-08-27 缓存

本文介绍了DataKernelBench,这是一个用于评估LLMs在优化GPU内核以处理数据库查询方面的基准测试,相比如torch.compile等基线方法实现了加速。

0 人收藏 0 人点赞
#cuda

@QuixiAI: https://x.com/QuixiAI/status/2092804334417236135

X AI KOLs Following ↗ · 2026-08-27 缓存

这是 NVIDIA 开放 GPU 内核模块的一个分支,它支持消费级 GeForce GPU(3090、4090、5090)之间的 PCIe 点对点通信,允许直接通过 PCIe 进行数据传输,从而显著提升多 GPU 性能。

0 人收藏 0 人点赞
#cuda

@TheAhmadOsman: 需要明确的是,如果您比较GPU和新的M5 Ultra Mac Studio,CUDA仍然比MLX更成熟。然而,生态系统…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

讨论比较了CUDA与MLX在Apple的M5 Ultra Mac Studio背景下的成熟度,强调需要竞争来优化本地AI硬件,这可能使Apple超越NVIDIA。

0 人收藏 0 人点赞
#cuda

面向内存高效的稀疏二进制自组织映射的特征主码本:在单消费级GPU上将MEDLINE图谱扩展至105万神经元

arXiv cs.LG ↗ · 2026-08-26 缓存

本文提出了一种特征主码本布局,用于内存高效的稀疏二进制自组织映射,使得在单个GPU上训练多达105万神经元的大规模映射成为可能,并在MEDLINE数据上实现了显著的加速。

0 人收藏 0 人点赞
#cuda

Hot Chips 2026: CUDA 瞄准 RISC-V – 作者:Chester Lam

Hacker News Top ↗ · 2026-08-24 缓存

在 Hot Chips 2026 上,Nvidia 宣布了将 CUDA 支持扩展到 RISC-V CPU 的计划,概述了具体的硬件要求,如服务器级CPU、ACPI和PCIe一致性,以实现高效的GPU计算。

0 人收藏 0 人点赞
#cuda

4张R9700、2张Mi210 或 4张4080S 32G

Reddit r/LocalLLaMA ↗ · 2026-08-24

用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。

0 人收藏 0 人点赞
#cuda

当GPU读取内存时会发生什么

Hacker News Top ↗ · 2026-08-21 缓存

这篇博文详细介绍了NVIDIA RTX 4090上GPU内存读取指令的硬件路径,解释了CUDA内核如何通过L1缓存和DRAM等组件访问内存,以提供性能洞察。

0 人收藏 0 人点赞
#cuda

NVIDIA 发布了一个由 NVIDIA 托管的 CUDA MCP,用于 AI 辅助的 CUDA 操作,如搜索官方最新文档、编写优化的 GPU 代码以及分析性能数据。

Reddit r/LocalLLaMA ↗ · 2026-08-20 缓存

NVIDIA 已发布一个由 NVIDIA 托管的 CUDA MCP 服务器和一个开源的 Nsight Copilot Blueprint,以提供 AI 辅助的 CUDA 开发,包括文档访问、代码生成和性能分析。

0 人收藏 0 人点赞
#cuda

利用几何和CUDA编程对随机岛屿进行地理定位

Hacker News Top ↗ · 2026-08-19 缓存

一篇详细文章,介绍如何通过几何分析、CUDA编程和OpenStreetMap数据过滤,从照片中解决OSINT挑战来定位岛屿。

0 人收藏 0 人点赞
#cuda

PTXBench:基于架构特定PTX的GPU内核优化基准测试与LLM适配

arXiv cs.CL ↗ · 2026-08-19 缓存

PTXBench被介绍为一个基准,用于评估和适配大型语言模型,以使用架构特定的PTX优化GPU内核,显示性能不均和微调见解。

0 人收藏 0 人点赞
#cuda

KernelArc:一个用于GPU内核优化的多智能体框架

arXiv cs.AI ↗ · 2026-08-19 缓存

KernelArc是一个多智能体框架,使用策略专业化智能体来自主优化GPU内核以处理异构工作负载,并在NVIDIA GPU基准测试中取得顶级排名。

0 人收藏 0 人点赞
#cuda

CUDA 共享内存交错

Hacker News Top ↗ · 2026-08-13 缓存

本文解释了CUDA共享内存交错技术,用于优化GPU内存访问模式,并通过代码示例展示性能提升。

0 人收藏 0 人点赞
#cuda

@matthewjgunton: NVIDIA 软件栈中有 3 个基本层级:CUDA C++、PTX 和 SASS。理解全部 3 个层级有助于你明白为什么 CU…

X AI KOLs Timeline ↗ · 2026-08-07 缓存

一条教育性推文,解释了 NVIDIA 软件栈的三个层级(CUDA C++、PTX、SASS),以及 CUDA 的抽象如何构建护城河,同时提到 Luminal 的自动编译器搜索。

0 人收藏 0 人点赞
#cuda

MoE训练提速40%:更快的megakernel,居然来自Cursor(针对B200)

Reddit r/LocalLLaMA ↗ · 2026-08-05 缓存

Cursor开源了Mixture-of-Kittens (MoK),这是一个面向NVIDIA Blackwell GPU的确定性MoE训练megakernel,它融合了计算与通信,相比基线实现最高可提供2.37倍加速。

0 人收藏 0 人点赞
#cuda

PSA 将 CUDA 从 13.2 更新到 13.3 以解决 DeepSeek V4 Flash 0731 循环问题!

Reddit r/LocalLLaMA ↗ · 2026-08-05

有用户报告称,将 CUDA 从 13.2 更新到 13.3 可以修复 DeepSeek V4 Flash 0731 的循环问题,使模型在长编码任务中重新可用。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈