标签
感谢 tcclaviger 为 vLLM 添加专家 RAM 卸载支持,使得在本地多 GPU 设置上运行 DeepSeek-V4-Flash-Vision-Exp 等大型 AI 模型成为可能。
BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。
本文介绍了一种配置,通过 Thunderbolt 5 在 MacBook Pro 上使用 AMD Radeon AI Pro R9700 GPU,结合自定义驱动和 LemonSeed-Engine 运行大语言模型如 Qwen3.6-3.8。
优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。
本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。
此工具提供可复现的 Windows 环境,用于在 AMD GPU 上运行针对 CUDA 的应用程序,使用 ZLUDA 和 AMD HIP/ROCm,并通过 RX 9060 XT 和 LibTorch 工作负载进行了验证。
此拉取请求为 ggml-cuda 的 HIP 添加缺失的 AMD GCN MMQ 配置,增强了 llama.cpp 推理库中 RDNA2 GPU(如 MI50 和 MI60)的预填充性能。
VoxGen是专为VoxCPM2模型设计的新轻量级原生推理引擎,使用Rust和Vulkan计算针对AMD显卡优化,以提升性能并消除Python/PyTorch依赖。
本文介绍了为在AMD MI350X GPU上运行Qwen3.6-35B-A3B大语言模型所做的优化,实现了高输出令牌吞吐量,并开源了内核以提升性能。
用户通过禁用运行时电源管理,解决了在无头 Linux 系统上使用 AMD GPU 运行大型 AI 模型时崩溃的问题,防止模型权重被转储到有限内存中导致 OOM 错误。
AsmEvo 是一个用于AMD GPU内核的智能汇编级优化器,通过提出低级编辑并验证与原始二进制文件的功能等价性来提高性能,在MI308X GPU上实现了高达3.88倍的加速。
已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。
一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。
Linux内核补丁引入了KNOD,这是一种用于将内核网络数据包卸载直接交给AMD GPU的机制,能够在无需用户空间依赖(如ROCm)的情况下加速数据包处理。该代码管理GPU队列,对每个数据包程序进行JIT编译,并完全从内核调度工作。
USAF(超稀疏自适应微调)是一种新方法,允许在消费级GPU(包括AMD硬件)上微调MoE模型,仅需12GB VRAM。与无法做到的LoRA/QLoRA不同,USAF只训练最重要的稀疏权重和路由器。
讨论了在双 9060 XT GPU 配置上运行 Gemma 4 31B 模型的 Q6 量化版本,很可能是用于本地推理。
在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。
llama.cpp b9158 已发布,修复了 RDNA3 GPU 上的 Flash Attention 问题,提升了 AMD 用户的性能。
一位用户分享了通过命令'Disable-mmagent -mc'禁用内存压缩来解决Windows 11中AMD GPU运行AI模型时的性能瓶颈问题。
在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。