rocm

标签

Cards List
#rocm

使用MTP时,Gemma 4 12B QAT模型的速度反而比未使用时更慢...

Reddit r/LocalLLaMA · 2026-09-01

用户报告在使用Vulkan后端时,Gemma 4 12B QAT模型开启MTP后的推理速度变慢,但发现切换到ROCm后性能显著提升,MTP下达到60t/s。

0 人收藏 0 人点赞
#rocm

Puget Systems 的一份非常令人困惑的报告

Reddit r/LocalLLaMA · 2026-09-01 缓存

本文评估了双 AMD Radeon AI PRO R9700 GPU 的 AI 推理性能,并将其与 Intel Arc Pro B70 和 NVIDIA RTX 5090 进行比较,突出了成本效益和软件挑战。

0 人收藏 0 人点赞
#rocm

ROCm 10.0:十年开放计算,专为智能体AI时代打造

Reddit r/LocalLLaMA · 2026-08-28 缓存

AMD发布了其开源GPU计算平台的重大更新ROCm 10.0,标志着十年发展历程,并通过ROCm.AI引入了原生智能体AI开发体验。

0 人收藏 0 人点赞
#rocm

4张R9700、2张Mi210 或 4张4080S 32G

Reddit r/LocalLLaMA · 2026-08-24

用户正在比较GPU选项,如R9700、Mi210和4080S,以实现128GB VRAM用于并行运行多个AI模型,考虑因素包括成本、性能和兼容性。

0 人收藏 0 人点赞
#rocm

AMD 用户:您试过 llama.cpp 的 AMD-Ecosystem 分支吗?最高 2 倍提示处理速度

Reddit r/LocalLLaMA · 2026-08-23

本文讨论了 llama.cpp 的一个 AMD 特定分支,该分支显著提升了 AMD 用户的提示处理速度,使用 ROCm/Hip 时,在密集模型上性能最高提升 2 倍,尽管在其他指标上有些权衡。

0 人收藏 0 人点赞
#rocm

Qwen 3.8 27B KV f16 与 q8_0 并非等价

Reddit r/LocalLLaMA · 2026-08-20

一位用户分享了测试结果,表明在Qwen 3.8 27B模型中,KV缓存类型f16和q8_0并不等价,f16在细节和一致性上表现更好,并提供了AMD ROCm硬件的配置详情。

0 人收藏 0 人点赞
#rocm

在廉价 Radeon 7600 上运行 Qwen 3.6 35B A3B-Q8_0 gguf,速度 18 token/s * 更新后提升至 21 t/s

Reddit r/LocalLLaMA · 2026-08-12

用户报告在 Radeon 7600 上使用 llama.cpp 和 ROCm 运行 Qwen 3.6 35B A3B-Q8_0 gguf,在显存超频后达到每秒 21 tokens,并提到一个与显示相关的性能 bug。

0 人收藏 0 人点赞
#rocm

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA · 2026-08-10

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

0 人收藏 0 人点赞
#rocm

DeepSeek V4 Flash on a Single AMD MI300X

Hacker News Top · 2026-08-04 缓存

This repository provides configuration, patches, and tuning to run the DeepSeek V4 Flash 304B checkpoint on a single AMD MI300X in production, achieving 168 tok/s decode without quantization. It includes correctness overlays for vLLM ROCm, AITER tuning tables, and a hybrid KV cache strategy.

0 人收藏 0 人点赞
#rocm

MSLK kernel reference (Website)

TLDR AI · 2026-08-03 缓存

Documentation reference for MSLK 1.3.0, a library of fused GPU kernels for transformer workloads including attention, quantization, GEMM, and MoE routing, supporting CUDA and ROCm with PyTorch integration.

0 人收藏 0 人点赞
#rocm

@PyTorch: 作为@AMD AI DevMaster黑客马拉松官方推荐框架,PyTorch使开发者能够构建AI应用…

X AI KOLs Timeline · 2026-07-22 缓存

AMD AI DevMaster黑客马拉松于2026年7月10日至8月6日举行,设有三个赛道(多模态AI、智能体AI、物理AI)和30,000美元奖金池,PyTorch作为ROCm支持的AMD GPU上的官方框架。

0 人收藏 0 人点赞
#rocm

llamacpp有一个新的PR,声称使用rocm可将提示处理速度提升约15%,同时修复了一个bug,使Q2_K的速度提升了28倍

Reddit r/LocalLLaMA · 2026-07-21 缓存

llama.cpp的一个新PR将ROCm上的提示处理速度提升了约15%,并修复了一个bug,使Q2_K量化速度提升了28倍。

0 人收藏 0 人点赞
#rocm

AMD ROCm 7.14 "TheRock" 技术预览已发布,针对最新 AMD GPU 计算堆栈

Reddit r/LocalLLaMA · 2026-07-16 缓存

AMD 发布了 ROCm 7.14 'TheRock' 技术预览,带来了AI训练增强、针对Comfy UI等特定AI工作负载的性能提升高达16%,以及对开源GPU计算堆栈的持续Windows支持。

0 人收藏 0 人点赞
#rocm

Qwen 3.5 122B Heretic ROCmFP4 iMatrix

Reddit r/LocalLLaMA · 2026-07-15 缓存

Qwen 3.5 122B 模型的一种紧凑型、重要性校准的 ROCmFP4 量化版本,适用于高内存 AMD 系统,实现了更优的质量(KLD 降低 14%)和性能(28.45 tok/s)。需要 ROCmFPX 运行时,不兼容标准 llama.cpp。

0 人收藏 0 人点赞
#rocm

改装版RTX 4090 48GB vs Radeon AI Pro R9700 vs Arc Pro B70:本地编程LLM选哪个?

Reddit r/LocalLLaMA · 2026-07-09

用户寻求关于在改装版RTX 4090 48GB、双AMD Radeon AI Pro R9700或双Intel Arc Pro B70之间选择的建议,用于运行本地编程LLM,重点比较价格、显存、软件生态和推理速度的权衡。

0 人收藏 0 人点赞
#rocm

@PyTorch:PyTorch 基金会博客新文章:@AMD 和 @Meta 贡献者分享如何将 PyTorch Monarch 引入 AMD Instinct G…

X AI KOLs Following · 2026-07-07 缓存

AMD 和 Meta 贡献者将 PyTorch Monarch 移植到 AMD Instinct GPU 并配合 ROCm,实现了大规模容错分布式训练。该博客详细介绍了工程工作以及在大型集群上的验证情况。

0 人收藏 0 人点赞
#rocm

将 PyTorch Monarch 移植到 AMD GPU:在 ROCm 上进行单控制器分布式训练(13 分钟阅读)

TLDR AI · 2026-07-07 缓存

本文描述了将分布式训练运行时 PyTorch Monarch 移植到基于 ROCm 的 AMD GPU 的过程,实现了大规模单控制器容错训练,并解决了大规模 LLM 训练中的可靠性挑战。

0 人收藏 0 人点赞
#rocm

@QuixiAI: https://x.com/QuixiAI/status/2073936537213915611

X AI KOLs Following · 2026-07-06 缓存

QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。

0 人收藏 0 人点赞
#rocm

@0x0SojalSec: 去他妈的付费课程,掌握AI系统的GPU工程。从基础书籍和CUDA/ROCm编程到低阶…

X AI KOLs Timeline · 2026-07-02 缓存

一份精心整理的资源列表,用于掌握AI系统的GPU工程,涵盖CUDA、ROCm、优化工具、多GPU编排和分布式训练。

0 人收藏 0 人点赞
#rocm

@DanKornas: GPU 工程学领域过于广泛,无法通过零散标签学习。Awesome GPU Engineering 是一个精心整理的 GitHub 资源列表,涵盖……

X AI KOLs Timeline · 2026-06-28 缓存

一个精心整理的 GitHub 资源列表,用于学习 GPU 工程学,涵盖架构、内核编程、优化、分布式系统及 AI 加速,包括书籍、框架、分析工具和面试准备内容。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈