amd-gpu

标签

Cards List
#amd-gpu

vLLM 的 RAM 卸载技术 - tcclaviger 致谢帖

Reddit r/LocalLLaMA ↗ · 昨天

感谢 tcclaviger 为 vLLM 添加专家 RAM 卸载支持,使得在本地多 GPU 设置上运行 DeepSeek-V4-Flash-Vision-Exp 等大型 AI 模型成为可能。

0 人收藏 0 人点赞
#amd-gpu

@Anbeeld: BeeLlama v0.4.7 发布了!在使用 MTP 和 DFlash 时,您可以节省数 GB 的 VRAM!在图像中展示的示例中…

X AI KOLs Timeline ↗ · 6天前

BeeLlama v0.4.7 发布,通过为 MTP 和 DFlash 提供独立的 drafter ubatch 大小调整,实现数 GB 的 VRAM 节省,并大幅提升 ROCm 和 CUDA 在 AI 推理方面的性能。

0 人收藏 0 人点赞
#amd-gpu

在 Razer 外接盒中使用 Thunderbolt 5 运行 AMD Radeon AI PRO R9700 的 MacBook Pro M5 Max LSE LLM

Reddit r/LocalLLaMA ↗ · 2026-09-24

本文介绍了一种配置,通过 Thunderbolt 5 在 MacBook Pro 上使用 AMD Radeon AI Pro R9700 GPU,结合自定义驱动和 LemonSeed-Engine 运行大语言模型如 Qwen3.6-3.8。

0 人收藏 0 人点赞
#amd-gpu

在单张 AMD Radeon R9700 上运行 Qwen3.8 27b NVFP4 达 153 tok/s,8 并发请求下 470 tok/s,预填充速度 3,619 tok/s

Reddit r/LocalLLaMA ↗ · 2026-09-17

优化了在单张 AMD Radeon R9700 GPU 上运行 Qwen3.8 27b NVFP4 模型的性能,解码速度高达每秒 153 个令牌,预填充速度达每秒 3,619 个令牌,并提升了并发性能。

0 人收藏 0 人点赞
#amd-gpu

AMDKernelVault:面向AMD GPU内核优化的大规模数据集与智能代理训练

arXiv cs.CL ↗ · 2026-09-14 缓存

本文介绍AMDKernelVault,这是一个用于AMD GPU内核优化的开放数据集和训练框架,包含大规模HIP和Triton内核,以及用于生成和验证内核的代理驱动流水线。

0 人收藏 0 人点赞
#amd-gpu

适用于 AMD 的 Windows CUDA

Hacker News Top ↗ · 2026-09-13 缓存

此工具提供可复现的 Windows 环境,用于在 AMD GPU 上运行针对 CUDA 的应用程序,使用 ZLUDA 和 AMD HIP/ROCm,并通过 RX 9060 XT 和 LibTorch 工作负载进行了验证。

0 人收藏 0 人点赞
#amd-gpu

ggml-cuda: hip: 添加缺失的 AMD GCN MMQ 配置 by thelittlefireman · Pull Request #27841 · ggml-org/llama.cpp - RDNA2(MI50, MI60) 的预填充性能改进

Reddit r/LocalLLaMA ↗ · 2026-09-12 缓存

此拉取请求为 ggml-cuda 的 HIP 添加缺失的 AMD GCN MMQ 配置,增强了 llama.cpp 推理库中 RDNA2 GPU(如 MI50 和 MI60)的预填充性能。

0 人收藏 0 人点赞
#amd-gpu

VoxGen,针对AMD优化的VoxCPM 2模型TTS推理引擎

Reddit r/LocalLLaMA ↗ · 2026-09-02

VoxGen是专为VoxCPM2模型设计的新轻量级原生推理引擎,使用Rust和Vulkan计算针对AMD显卡优化,以提升性能并消除Python/PyTorch依赖。

0 人收藏 0 人点赞
#amd-gpu

用于AMD MI350X的Qwen3.6-35B-A3B开源内核:在8块GPU上实现78,498输出tok/s

Reddit r/LocalLLaMA ↗ · 2026-08-26

本文介绍了为在AMD MI350X GPU上运行Qwen3.6-35B-A3B大语言模型所做的优化,实现了高输出令牌吞吐量,并开源了内核以提升性能。

0 人收藏 0 人点赞
#amd-gpu

已修复 7900 xtx + 无头 Linux 崩溃(低内存 OOM)amdgpu.runpm=0

Reddit r/LocalLLaMA ↗ · 2026-08-25

用户通过禁用运行时电源管理,解决了在无头 Linux 系统上使用 AMD GPU 运行大型 AI 模型时崩溃的问题,防止模型权重被转储到有限内存中导致 OOM 错误。

0 人收藏 0 人点赞
#amd-gpu

AsmEvo: 带功能等价验证的AMD GPU内核智能汇编级优化

arXiv cs.CL ↗ · 2026-08-24 缓存

AsmEvo 是一个用于AMD GPU内核的智能汇编级优化器,通过提出低级编辑并验证与原始二进制文件的功能等价性来提高性能,在MI308X GPU上实现了高达3.88倍的加速。

0 人收藏 0 人点赞
#amd-gpu

GLM 和我创建了一个针对 AMD GFX906(Mi50、Mi60、Radeon VII、GCN HIP)优化的 llama.cpp 分支 - 机器学习、大语言模型和 AI

Reddit r/LocalLLaMA ↗ · 2026-08-22

已创建一个 llama.cpp 的分支,并针对 AMD GFX906 GPU 进行了优化,提升了 Mi50、Mi60、Radeon VII 和 GCN HIP 上的性能,适用于机器学习和大语言模型应用。

0 人收藏 0 人点赞
#amd-gpu

价值100美元的GPU以7.39 t/s运行Qwen 3.8 27b模型

Reddit r/LocalLLaMA ↗ · 2026-08-17

一位用户演示在两张RX 580 GPU上运行量化为Q3_K_M的Qwen 27b AI模型,使用价值低于100美元的旧DDR3硬件,达到7.39 tokens/秒的性能。

0 人收藏 0 人点赞
#amd-gpu

Linux补丁引入"KNOD",用于将内核网络卸载直接交给AMD GPU

Reddit r/LocalLLaMA ↗ · 2026-07-20 缓存

Linux内核补丁引入了KNOD,这是一种用于将内核网络数据包卸载直接交给AMD GPU的机制,能够在无需用户空间依赖(如ROCm)的情况下加速数据包处理。该代码管理GPU队列,对每个数据包程序进行JIT编译,并完全从内核调度工作。

0 人收藏 0 人点赞
#amd-gpu

如果GPU能跑推理,那也应该能微调。[P]

Reddit r/MachineLearning ↗ · 2026-07-04 缓存

USAF(超稀疏自适应微调)是一种新方法,允许在消费级GPU(包括AMD硬件)上微调MoE模型,仅需12GB VRAM。与无法做到的LoRA/QLoRA不同,USAF只训练最重要的稀疏权重和路由器。

0 人收藏 0 人点赞
#amd-gpu

Gemma 4 31B Q6 在双 9060 XT 上运行

Reddit r/LocalLLaMA ↗ · 2026-06-22

讨论了在双 9060 XT GPU 配置上运行 Gemma 4 31B 模型的 Q6 量化版本,很可能是用于本地推理。

0 人收藏 0 人点赞
#amd-gpu

7900XTX 24GB 显存,终于能够在 131k 上下文下容纳 Q6K+MTP 和 Qwen 3.6 27B

Reddit r/LocalLLaMA ↗ · 2026-06-20

在 AMD 7900XTX 上优化显存使用的指南,通过编译带有 OpenBLAS 和 CUDA_FA_ALL_QUANTS 的 llama.cpp,并使用 q5_0/q4_0 的 KVCache 量化,以运行使用 Q6K 量化和 131k 上下文的 27B Qwen 模型。

0 人收藏 0 人点赞
#amd-gpu

llama.cpp b9158 刚刚发布了 RDNA3 Flash Attention 修复

Reddit r/LocalLLaMA ↗ · 2026-05-15

llama.cpp b9158 已发布,修复了 RDNA3 GPU 上的 Flash Attention 问题,提升了 AMD 用户的性能。

0 人收藏 0 人点赞
#amd-gpu

如果你使用Windows,请禁用内存压缩以消除瓶颈!

Reddit r/LocalLLaMA ↗ · 2026-05-14

一位用户分享了通过命令'Disable-mmagent -mc'禁用内存压缩来解决Windows 11中AMD GPU运行AI模型时的性能瓶颈问题。

0 人收藏 0 人点赞
#amd-gpu

MI50s 上的 Qwen 3.6 27B @52.8 tps TG @1569 tps PP(无 MTP,无量化)

Reddit r/LocalLLaMA ↗ · 2026-05-13

在 AMD MI50 GPU 上使用自定义 vllm 分支运行 Qwen 3.6 27B 的基准测试结果,实现了 52.8 tokens/s TG 和 1569 tokens/s PP,无量化或 MTP,证明了在 2018 年硬件上用于代理任务的可行性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈