rocm

标签

Cards List
#rocm

Qwen 3.8 27B KV f16 与 q8_0 并非等价

Reddit r/LocalLLaMA · 昨天

一位用户分享了测试结果,表明在Qwen 3.8 27B模型中,KV缓存类型f16和q8_0并不等价,f16在细节和一致性上表现更好,并提供了AMD ROCm硬件的配置详情。

0 人收藏 0 人点赞
#rocm

在廉价 Radeon 7600 上运行 Qwen 3.6 35B A3B-Q8_0 gguf,速度 18 token/s * 更新后提升至 21 t/s

Reddit r/LocalLLaMA · 2026-08-12

用户报告在 Radeon 7600 上使用 llama.cpp 和 ROCm 运行 Qwen 3.6 35B A3B-Q8_0 gguf,在显存超频后达到每秒 21 tokens,并提到一个与显示相关的性能 bug。

0 人收藏 0 人点赞
#rocm

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA · 2026-08-10

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

0 人收藏 0 人点赞
#rocm

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top · 2026-08-04 缓存

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.

0 人收藏 0 人点赞
#rocm

MSLK kernel reference (Website)

TLDR AI · 2026-08-03 缓存

Documentation reference for MSLK 1.3.0, a library of fused GPU kernels for transformer workloads including attention, quantization, GEMM, and MoE routing, supporting CUDA and ROCm with PyTorch integration.

0 人收藏 0 人点赞
#rocm

@PyTorch: 作为@AMD AI DevMaster黑客马拉松官方推荐框架,PyTorch使开发者能够构建AI应用…

X AI KOLs Timeline · 2026-07-22 缓存

AMD AI DevMaster黑客马拉松于2026年7月10日至8月6日举行,设有三个赛道(多模态AI、智能体AI、物理AI)和30,000美元奖金池,PyTorch作为ROCm支持的AMD GPU上的官方框架。

0 人收藏 0 人点赞
#rocm

llamacpp有一个新的PR,声称使用rocm可将提示处理速度提升约15%,同时修复了一个bug,使Q2_K的速度提升了28倍

Reddit r/LocalLLaMA · 2026-07-21 缓存

llama.cpp的一个新PR将ROCm上的提示处理速度提升了约15%,并修复了一个bug,使Q2_K量化速度提升了28倍。

0 人收藏 0 人点赞
#rocm

AMD ROCm 7.14 "TheRock" 技术预览已发布,针对最新 AMD GPU 计算堆栈

Reddit r/LocalLLaMA · 2026-07-16 缓存

AMD 发布了 ROCm 7.14 'TheRock' 技术预览,带来了AI训练增强、针对Comfy UI等特定AI工作负载的性能提升高达16%,以及对开源GPU计算堆栈的持续Windows支持。

0 人收藏 0 人点赞
#rocm

Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA · 2026-07-15 缓存

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

0 人收藏 0 人点赞
#rocm

改装版RTX 4090 48GB vs Radeon AI Pro R9700 vs Arc Pro B70:本地编程LLM选哪个?

Reddit r/LocalLLaMA · 2026-07-09

用户寻求关于在改装版RTX 4090 48GB、双AMD Radeon AI Pro R9700或双Intel Arc Pro B70之间选择的建议,用于运行本地编程LLM,重点比较价格、显存、软件生态和推理速度的权衡。

0 人收藏 0 人点赞
#rocm

@PyTorch:PyTorch 基金会博客新文章:@AMD 和 @Meta 贡献者分享如何将 PyTorch Monarch 引入 AMD Instinct G…

X AI KOLs Following · 2026-07-07 缓存

AMD 和 Meta 贡献者将 PyTorch Monarch 移植到 AMD Instinct GPU 并配合 ROCm,实现了大规模容错分布式训练。该博客详细介绍了工程工作以及在大型集群上的验证情况。

0 人收藏 0 人点赞
#rocm

将 PyTorch Monarch 移植到 AMD GPU:在 ROCm 上进行单控制器分布式训练(13 分钟阅读)

TLDR AI · 2026-07-07 缓存

本文描述了将分布式训练运行时 PyTorch Monarch 移植到基于 ROCm 的 AMD GPU 的过程,实现了大规模单控制器容错训练,并解决了大规模 LLM 训练中的可靠性挑战。

0 人收藏 0 人点赞
#rocm

@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611

X AI KOLs Following · 2026-07-06 缓存

QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。

0 人收藏 0 人点赞
#rocm

@0x0SojalSec: 去他妈的付费课程,掌握AI系统的GPU工程。从基础书籍和CUDA/ROCm编程到低阶…

X AI KOLs Timeline · 2026-07-02 缓存

一份精心整理的资源列表,用于掌握AI系统的GPU工程,涵盖CUDA、ROCm、优化工具、多GPU编排和分布式训练。

0 人收藏 0 人点赞
#rocm

@DanKornas: GPU 工程学领域过于广泛,无法通过零散标签学习。Awesome GPU Engineering 是一个精心整理的 GitHub 资源列表,涵盖……

X AI KOLs Timeline · 2026-06-28 缓存

一个精心整理的 GitHub 资源列表,用于学习 GPU 工程学,涵盖架构、内核编程、优化、分布式系统及 AI 加速,包括书籍、框架、分析工具和面试准备内容。

0 人收藏 0 人点赞
#rocm

AMD Strix Halo RDMA 集群搭建指南

Hacker News Top · 2026-06-28 缓存

一份使用自定义 Docker/Podman 工具箱,借助 ROCm/RCCL RDMA 支持,将两个 AMD Strix Halo 节点集群化,以在 256GB 统一内存上通过张量并行启用 vLLM 的搭建指南。

0 人收藏 0 人点赞
#rocm

既然大语言模型编码这么厉害……

Reddit r/LocalLLaMA · 2026-06-25

讨论为何大语言模型未能帮助ROCm和英特尔的软件生态系统追上CUDA,并指出NVIDIA的高定价和真正市场竞争的必要性。

0 人收藏 0 人点赞
#rocm

AMD / Strix Halo+ 用户的大新闻

Reddit r/LocalLLaMA · 2026-06-24

AMD Strix Halo 设备上的 NPU 现在可用于 AI 推理,支持混合模式,结合 NPU 和 iGPU 以实现更快的提示处理。Lemonade 和 AMD 的 ROCm 等软件使之成为可能。

0 人收藏 0 人点赞
#rocm

ROCm vs Vulkan vs vLLM 在双R9700上的对比

Reddit r/LocalLLaMA · 2026-06-21

对运行在双AMD Radeon 9700 GPU上的AI推理框架ROCm、Vulkan和vLLM进行比较,可能是在对大型语言模型的性能进行基准测试。

0 人收藏 0 人点赞
#rocm

最新eBay特价品基准测试:W6800(改装版V620)

Reddit r/LocalLLaMA · 2026-06-17

一位用户对一款刷入W6800固件并配备定制吹风风扇的改装版AMD V620 GPU进行了基准测试,通过Vulkan和ROCm后端运行大型语言模型,比较了Qwen2.5-27B在不同量化级别下的性能表现。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈