标签
一位用户推荐了一个GitHub项目,用于在Strix Halo上更快地推理Qwen 3.8 Flash Next,展示的基准速度显著优于llama.cpp。
文章探讨了在 495+ 即将发布和 RAM 危机背景下,现在是否是购买 Strix Halo 硬件的好时机,并请求推荐用于运行本地 LLM(如 Qwen 模型)的安静盒子。
作者分享了在配备 Strix Halo 和 128GB 统一内存的 Framework 台式机上运行本地 AI 模型的经验,偏好使用 Qwen 模型进行编码,并寻求关于如何更好利用硬件的建议。
本文讨论了在Strix Halo硬件上优化性能的官方llama.cpp替代方案,其中特定分支在AI推理任务中实现了显著更高的吞吐量。
本文介绍了 DeepSeek V4 Flash 0731 在 Strix Halo 硬件上的基准测试结果,展示了不同草稿模型和 n_max 设置下的性能,得出结论 n_max=3 提供了最佳的速度平衡。
作者在配备Ryzen AI Max+ 395的ROG Flow Z13上测试了Qwen3.8-27B Q8_0 AI模型,使用Lemonade Server和llama.cpp进行推测解码,实现了令人印象深刻的本地推理性能,生成了一个飞行模拟器。
推文报告称,AMD Strix Halo 上的 Ling 3.0 Flash 在使用 ROCm 优化格式时明显快于 Qwen-122b,但指出在某些测试框架中工具调用功能异常。
本文比较了在 Strix Halo(每天最多 0.48 美元)与 Nvidia A6000 上运行 AI 模型的能源成本,强调了能效和多功能性。
本文解释了在RAG应用中,预填充速度比解码速度更重要,并讨论了为何AMD的Strix Halo APU在交互式使用场景中表现不佳。
一份使用自定义 Docker/Podman 工具箱,借助 ROCm/RCCL RDMA 支持,将两个 AMD Strix Halo 节点集群化,以在 256GB 统一内存上通过张量并行启用 vLLM 的搭建指南。
本文评测了在双Strix Halo(256GB显存)上运行GLM 5.2(IQ2M量化版本)的性能,生成速度仅约7 token/s,编码任务耗时是DeepSeek V4 Flash的两倍,性价比远不如其他模型,因此不建议在此硬件配置下使用。
AMD Strix Halo 设备上的 NPU 现在可用于 AI 推理,支持混合模式,结合 NPU 和 iGPU 以实现更快的提示处理。Lemonade 和 AMD 的 ROCm 等软件使之成为可能。
在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。
使用Strix Halo硬件对四个大型语言模型(≤120B参数)在深度上下文性能上的比较。与GPT-OSS和Qwen模型相比,Nemotron Super在深度上下文中的提示处理速度表现出色。
xdna-top 是一款终端监视器,可在 Ryzen AI Max/Strix Halo 系统上同时显示 NPU 和 iGPU 活动,提供 NPU 计数器增量的真实视图,而非虚假的利用率百分比。
Antirez 正在整合 DwarfStar 社区的贡献以改进 Strix Halo 的支持,预计很快完成最终质量检查并合并。
注意到DGX Spark和Strix Halo硬件价格上涨,表明对本地AI计算的需求正在增长。
一个针对 llama.cpp 的被拒绝的 PR 可在 AMD Strix Halo 硬件上为 MOE 模型提供高达 30% 的提示处理速度提升,但增益会随上下文长度增加而递减。
用户详细介绍了对配备双RTX 3090 eGPU和NVLink的AMD Strix Halo系统进行改造和基准测试的过程,发现对密集模型的LLM推理速度有所提升,尤其是使用vLLM时,并讨论了能效权衡。