cuda

标签

Cards List
#cuda

使用动态批次调整防止PyTorch中的CUDA内存溢出

Reddit r/LocalLLaMA ↗ · 昨天

MEM v3 是一个用于PyTorch的内存管理工具,它动态调整批次大小和梯度累积,以防止训练和微调过程中的CUDA内存溢出崩溃,具有抗混乱性、防崩溃检查点和实时遥测功能。

0 人收藏 0 人点赞
#cuda

KernelZero: 协同进化Proposer与Coder实现持续改进的GPU内核生成

Hugging Face Daily Papers ↗ · 2天前 缓存

KernelZero提出了一种协同进化框架,利用Proposer和Coder模型提升GPU内核生成能力,在CUDA和Triton基准测试中表现出色。

0 人收藏 0 人点赞
#cuda

@Oluwaphilemon1: 在12GB RTX 5070上运行的Qwen3.8-Flash-Next速度只有15 tok/s,显然这不够好。所以与其买更大的G…

X AI KOLs Timeline ↗ · 2天前 缓存

一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。

0 人收藏 0 人点赞
#cuda

Qwen3.8 flash next + ExLlamaV3 + Hermes 真是令人惊叹

Reddit r/LocalLLaMA ↗ · 3天前

用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。

0 人收藏 0 人点赞
#cuda

Show HN: 智能代理CUDA内核优化器

Hacker News Top ↗ · 4天前 缓存

一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。

0 人收藏 0 人点赞
#cuda

@shao__meng: https://x.com/shao__meng/status/2101835798316495007

X AI KOLs Timeline ↗ · 2026-09-21 缓存

Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。

0 人收藏 0 人点赞
#cuda

laya.cpp: 优化的Laya近即时决策

Reddit r/LocalLLaMA ↗ · 2026-09-20

laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。

0 人收藏 0 人点赞
#cuda

@AtlasInferenceX:我们的GitHub获得了700颗星标。特别感谢开源贡献者、品牌大使以及所有中间的帮助者...

X AI KOLs Following ↗ · 2026-09-20 缓存

Atlas是一个用纯Rust和CUDA编写的开源LLM推理引擎,实现了高性能并兼容NVIDIA和AMD硬件。

0 人收藏 0 人点赞
#cuda

我将一对非对称的Tesla V100 PCIe显卡(16 GB + 32 GB)改造成一个令人惊讶的强大本地LLM实验室——使用Qwen3.8 27B Q6和Q8模型,实现了1.38k提示token/s和40解码token/s的速度

Reddit r/LocalLLaMA ↗ · 2026-09-19

一位用户使用llama.cpp配合张量分割和其他优化,将一对不匹配的Tesla V100 GPU(16GB和32GB)配置成一个强大的本地LLM实验室,使用Qwen3.8 27B模型实现了高提示和解码速度。

0 人收藏 0 人点赞
#cuda

这效果如何? 262k Qwen3.8:27B-Q4_K_M

Reddit r/LocalLLaMA ↗ · 2026-09-19

用户已在异构 GPU 环境中为 Qwen3.8 模型实现了 nvfp4 KV 缓存支持,使用自定义 CUDA 内核和量化来优化性能。

0 人收藏 0 人点赞
#cuda

Flyweight:开源 C++/CUDA 引擎,可在单个 GPU 和系统 RAM 上运行超出 VRAM 大小的 MoE 模型。首次 PyPI 发布,寻求贡献者。

Reddit r/LocalLLaMA ↗ · 2026-09-18

Flyweight 是一款开源 C++/CUDA 推理引擎,可在消费级 GPU 结合系统 RAM 的情况下运行大型 MoE 模型,提供优化性能,并与 Qwen 和 DeepSeek 等模型兼容。

0 人收藏 0 人点赞
#cuda

@PyTorch:在2026年PyTorch北美大会上,Dhritiman Das,机器学习基础设施高级软件工程师(@Li…)

X AI KOLs Timeline ↗ · 2026-09-17 缓存

在2026年PyTorch北美大会上,Dhritiman Das将展示一个基于PyTorch的检索引擎,该引擎使用PyTorch作为检索、过滤和排名的主要运行时,专为LinkedIn的信息流和搜索等可扩展用例设计。

0 人收藏 0 人点赞
#cuda

@no_stp_on_snek: 小步前进。昨晚朋友远程进行的AMD开发:https://github.com/Avarok-Cybersecurity/atlas/pull/1107……

X AI KOLs Timeline ↗ · 2026-09-17 缓存

远程开发已为Atlas LLM推理引擎添加了AMD R9700(RDNA 4)支持,使其能够在硬件上运行像Qwen3.8-27B和Ornith-9B这样的模型。

0 人收藏 0 人点赞
#cuda

我们打造了一款开源GPU性能分析工具,可直接将AI代理指向其中,省去手动解析追踪记录的麻烦。

Reddit r/LocalLLaMA ↗ · 2026-09-17

本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。

0 人收藏 0 人点赞
#cuda

CUDA/HIP:Flash Attention 调优(gfx1201)由 pwilkin · 拉取请求 #28102 · ggml-org/llama.cpp

Reddit r/LocalLLaMA ↗ · 2026-09-11 缓存

此拉取请求为 llama.cpp 项目中的 CUDA/HIP 引入了 Flash Attention 调优优化,针对 gfx1201 硬件以提升推理性能。

0 人收藏 0 人点赞
#cuda

在8GB GPU上实验用于PyTorch的自适应内存管理器——非常期待反馈

Reddit r/LocalLLaMA ↗ · 2026-09-09

作者正在实验用于PyTorch的自适应内存管理器,以防止8GB GPU上的CUDA内存溢出错误,分享代码并寻求社区反馈。

0 人收藏 0 人点赞
#cuda

SOTA图像生成本地部署 NVIDIA Cosmos3(64B) INT4量化 CUDA/MLX

Reddit r/LocalLLaMA ↗ · 2026-09-09

NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。

0 人收藏 0 人点赞
#cuda

深入North Mini Code的Megakernel服务引擎(22分钟阅读)

TLDR AI ↗ · 2026-09-09 缓存

Cohere为North Mini Code引入了一个Megakernel服务引擎,通过优化自回归解码的内存带宽,在H100 GPU上实现了比vLLM快1.25倍至1.41倍的推理速度。

0 人收藏 0 人点赞
#cuda

我们开源了Paddock,我们的Rust/C++推理引擎,自带CUDA内核(MIT/Apache-2.0)

Reddit r/LocalLLaMA ↗ · 2026-09-04

Paddock是一个开源的Rust/C++推理引擎,带有自定义CUDA内核,在基准测试中展示了与vLLM和SGLang相竞争的性能,同时支持OpenAI/Anthropic风格的API和GGUF/safetensors格式。

0 人收藏 0 人点赞
#cuda

PyTorch:在PyTorch 2.14中,容错性成为c10d的一等概念,支持进程组的原地重配置。当……

X AI KOLs Timeline ↗ · 2026-09-03 缓存

PyTorch 2.14版本引入了容错性作为c10d的一等概念,支持进程组的原地重配置,同时带来了NVGEMM内核、新的nccl2后端以及Apple Silicon的原生线性代数等特性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈