hardware-tuning

标签

Cards List
#hardware-tuning

在40核 M5 Max 上的 Splash:通过调优内核为你的芯片实现解码性能提升20%

Reddit r/LocalLLaMA ↗ · 11小时前

本文介绍了如何在 Splash 中使用 'make tune-kernels' 工具来优化40核 M5 Max 芯片上的 AI 模型解码,通过为特定硬件调优内核布局,实现高达20%的速度提升。

0 人收藏 0 人点赞
#hardware-tuning

Qwen3.8-Flash-Next 在 NVIDIA 5090 和 64GB 内存配置下使用 Llama.cpp - 似乎未使用 RAM?

Reddit r/LocalLLaMA ↗ · 昨天

用户分享了在配备 NVIDIA 5090 GPU 和 64GB RAM 的系统上使用 Llama.cpp 运行 Qwen3.8-Flash-Next 模型的性能结果和设置细节,指出推理过程中 RAM 使用量异常低。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈