标签
MEM v3 是一个用于PyTorch的内存管理工具,它动态调整批次大小和梯度累积,以防止训练和微调过程中的CUDA内存溢出崩溃,具有抗混乱性、防崩溃检查点和实时遥测功能。
一位用户构建了一个名为Strata的开源推理引擎,用于优化Qwen3.8-Flash-Next在普通硬件上的运行,将速度从最初的15 tok/s提升到了最高65.1 tok/s。
用户分享了他们使用 Qwen3.8 模型配合 ExLlamaV3 在 6x3090 GPU 上的积极体验,达到了每秒 80-120 个令牌,并通过 Matrix 控制 Hermes 代理进行日常使用。
一个智能代理CUDA内核优化器,通过迭代代码生成、正确性检查、基准测试和优化,自动化GPU实现生成,由LangGraph和OpenAI模型驱动。
Baseten出版的《Inference Engineering》是一本系统化的书籍,讲解从CUDA到生产部署的AI推理优化技术,帮助工程师在生产环境中高效运行开源模型。
laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。
Atlas是一个用纯Rust和CUDA编写的开源LLM推理引擎,实现了高性能并兼容NVIDIA和AMD硬件。
一位用户使用llama.cpp配合张量分割和其他优化,将一对不匹配的Tesla V100 GPU(16GB和32GB)配置成一个强大的本地LLM实验室,使用Qwen3.8 27B模型实现了高提示和解码速度。
用户已在异构 GPU 环境中为 Qwen3.8 模型实现了 nvfp4 KV 缓存支持,使用自定义 CUDA 内核和量化来优化性能。
Flyweight 是一款开源 C++/CUDA 推理引擎,可在消费级 GPU 结合系统 RAM 的情况下运行大型 MoE 模型,提供优化性能,并与 Qwen 和 DeepSeek 等模型兼容。
在2026年PyTorch北美大会上,Dhritiman Das将展示一个基于PyTorch的检索引擎,该引擎使用PyTorch作为检索、过滤和排名的主要运行时,专为LinkedIn的信息流和搜索等可扩展用例设计。
远程开发已为Atlas LLM推理引擎添加了AMD R9700(RDNA 4)支持,使其能够在硬件上运行像Qwen3.8-27B和Ornith-9B这样的模型。
本文介绍了一款开源GPU性能分析工具,它能以JSON格式提供性能指标数据,帮助AI代理自动完成针对vLLM、SGLang等基于CUDA的AI引擎的性能调优,无需人工进行手动轨迹分析。
此拉取请求为 llama.cpp 项目中的 CUDA/HIP 引入了 Flash Attention 调优优化,针对 gfx1201 硬件以提升推理性能。
作者正在实验用于PyTorch的自适应内存管理器,以防止8GB GPU上的CUDA内存溢出错误,分享代码并寻求社区反馈。
NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。
Cohere为North Mini Code引入了一个Megakernel服务引擎,通过优化自回归解码的内存带宽,在H100 GPU上实现了比vLLM快1.25倍至1.41倍的推理速度。
Paddock是一个开源的Rust/C++推理引擎,带有自定义CUDA内核,在基准测试中展示了与vLLM和SGLang相竞争的性能,同时支持OpenAI/Anthropic风格的API和GGUF/safetensors格式。
PyTorch 2.14版本引入了容错性作为c10d的一等概念,支持进程组的原地重配置,同时带来了NVGEMM内核、新的nccl2后端以及Apple Silicon的原生线性代数等特性。
DGX Spark中发现了一个bug,作者敦促NVIDIA确保它能无延迟地获取最新的CUDA更新。