strix-halo

标签

Cards List
#strix-halo

如果您在Strix Halo上运行Qwen 3.8 Flash Next,请使用此软件进行推理。它比llama.cpp快得多,尤其是在高上下文情况下。

Reddit r/LocalLLaMA ↗ · 5天前

一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。

0 人收藏 0 人点赞
#strix-halo

现在是否是购买 Strix Halo 的糟糕时机?

Reddit r/LocalLLaMA ↗ · 2026-09-20

文章探讨了在 495+ 即将发布和 RAM 危机背景下,现在是否是购买 Strix Halo 硬件的好时机,并请求推荐用于运行本地 LLM(如 Qwen 模型)的安静盒子。

0 人收藏 0 人点赞
#strix-halo

Strix Halo迷你主机尺寸图表更新(2026年9月)

Reddit r/LocalLLaMA ↗ · 2026-09-17

Strix Halo迷你主机尺寸图表更新,为395型号最终版,在495型号发布前。

0 人收藏 0 人点赞
#strix-halo

你在 Strix Halo 128GB 上运行的最佳模型是什么?

Reddit r/LocalLLaMA ↗ · 2026-09-16

作者分享了在配备 Strix Halo 和 128GB 统一内存的 Framework 台式机上运行本地 AI 模型的经验,偏好使用 Qwen 模型进行编码,并寻求关于如何更好利用硬件的建议。

0 人收藏 0 人点赞
#strix-halo

针对Strix Halo - 官方llama.cpp并非理想选择及如何实现最高吞吐量

Reddit r/LocalLLaMA ↗ · 2026-09-08

本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。

0 人收藏 0 人点赞
#strix-halo

DeepSeek V4 Flash 0731 在 Strix Halo 上:草稿模型、n_max 参数扫描和实际有帮助的启动行

Reddit r/LocalLLaMA ↗ · 2026-08-18

本文介绍了 DeepSeek V4 Flash 0731 在 Strix Halo 硬件上的基准测试结果,展示了不同草稿模型和 n_max 设置下的性能,得出结论 n_max=3 提供了最佳的速度平衡。

0 人收藏 0 人点赞
#strix-halo

在Strix Halo上运行的Qwen3.8-27B Q8_0令人印象深刻

Reddit r/LocalLLaMA ↗ · 2026-08-17

作者在配备Ryzen AI Max+ 395的ROG Flow Z13上测试了Qwen3.8-27B Q8_0 AI模型,使用Lemonade Server和llama.cpp进行推测解码,实现了令人印象深刻的本地推理性能,生成了一个飞行模拟器。

0 人收藏 0 人点赞
#strix-halo

Ling 3.0 Flash 在 Strix Halo 上的表现

Reddit r/LocalLLaMA ↗ · 2026-08-10

推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。

0 人收藏 0 人点赞
#strix-halo

我的 Strix Halo 每天最多花费 0.48 美元

Reddit r/LocalLLaMA ↗ · 2026-07-10

本文比较了在 Strix Halo(每天最多 0.48 美元)与 Nvidia A6000 上运行 AI 模型的能源成本,强调了能效和多功能性。

0 人收藏 0 人点赞
#strix-halo

具体到RAG,预填充速度比解码速度更重要,以及为何Strix Halo在交互式使用中表现不佳

Reddit r/LocalLLaMA ↗ · 2026-07-03

本文解释了在RAG应用中,预填充速度比解码速度更重要,并讨论了为何AMD的Strix Halo APU在交互式使用场景中表现不佳。

0 人收藏 0 人点赞
#strix-halo

AMD Strix Halo RDMA 集群搭建指南

Hacker News Top ↗ · 2026-06-28 缓存

一份使用自定义 Docker/Podman 工具箱,借助 ROCm/RCCL RDMA 支持,将两个 AMD Strix Halo 节点集群化,以在 256GB 统一内存上通过张量并行启用 vLLM 的搭建指南。

0 人收藏 0 人点赞
#strix-halo

GLM 5.2 on Dual Strix Halo (256GB): Worth it?

Reddit r/LocalLLaMA ↗ · 2026-06-25 缓存

本文评测了在双Strix Halo(256GB显存)上运行GLM 5.2(IQ2M量化版本)的性能,生成速度仅约7 token/s,编码任务耗时是DeepSeek V4 Flash的两倍,性价比远不如其他模型,因此不建议在此硬件配置下使用。

0 人收藏 0 人点赞
#strix-halo

AMD / Strix Halo+ 用户的大新闻

Reddit r/LocalLLaMA ↗ · 2026-06-24

AMD Strix Halo 设备上的 NPU 现在可用于 AI 推理,支持混合模式,结合 NPU 和 iGPU 以实现更快的提示处理。Lemonade 和 AMD 的 ROCm 等软件使之成为可能。

0 人收藏 0 人点赞
#strix-halo

@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……

X AI KOLs Timeline ↗ · 2026-06-18 缓存

在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。

0 人收藏 0 人点赞
#strix-halo

Nemotron - 深度之王?4个≤120B模型的对比

Reddit r/LocalLLaMA ↗ · 2026-06-14

使用Strix Halo硬件对四个大型语言模型(≤120B参数)在深度上下文性能上的比较。与GPT-OSS和Qwen模型相比,Nemotron Super在深度上下文中的提示处理速度表现出色。

0 人收藏 0 人点赞
#strix-halo

xdna-top: 面向 Strix Halo (Ryzen AI Max) 的统一 NPU+iGPU 终端监视器 — 终于能看到 NPU 工作了

Reddit r/LocalLLaMA ↗ · 2026-06-11

xdna-top 是一款终端监视器,可在 Ryzen AI Max/Strix Halo 系统上同时显示 NPU 和 iGPU 活动,提供 NPU 计数器增量的真实视图,而非虚假的利用率百分比。

0 人收藏 0 人点赞
#strix-halo

@antirez: 整合了 DwarfStar 社区的优秀成果,完善了 Strix Halo 的支持。看起来非常不错。更多质量检查……

X AI KOLs Following ↗ · 2026-06-07 缓存

Antirez 正在整合 DwarfStar 社区的贡献以改进 Strix Halo 的支持,预计很快完成最终质量检查并合并。

0 人收藏 0 人点赞
#strix-halo

DGX Spark、Strix Halo价格上涨(翻倍)?

Reddit r/LocalLLaMA ↗ · 2026-05-27

注意到DGX Spark和Strix Halo硬件价格上涨,表明对本地AI计算的需求正在增长。

0 人收藏 0 人点赞
#strix-halo

Strix Halo 用户:一个被拒绝的 PR 可使 MOE 的 PP 速度提升高达 30%。

Reddit r/LocalLLaMA ↗ · 2026-05-26

一个针对 llama.cpp 的被拒绝的 PR 可在 AMD Strix Halo 硬件上为 MOE 模型提供高达 30% 的提示处理速度提升,但增益会随上下文长度增加而递减。

0 人收藏 0 人点赞
#strix-halo

为最大化StrixHalo性能而折腾(+NVLink双eGPU 3090改造)

Reddit r/LocalLLaMA ↗ · 2026-05-22

用户详细介绍了对配备双RTX 3090 eGPU和NVLink的AMD Strix Halo系统进行改造和基准测试的过程,发现对密集模型的LLM推理速度有所提升,尤其是使用vLLM时,并讨论了能效权衡。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈