gpu-offloading

标签

Cards List
#gpu-offloading

有闲置的老旧低显存GPU吗?或许可以用来运行 Just Vision mmproj llama.cpp

Reddit r/LocalLLaMA · 5天前

文章建议利用旧GPU卸载llama.cpp中的mmproj组件,以提升多模态处理速度,同时不影响推理性能,作为缓慢的--no-mmproj-offload选项的替代方案。

0 人收藏 0 人点赞
#gpu-offloading

GPU热专家重载功能是社区所需

Reddit r/LocalLLaMA · 5天前

请求LLaMA维护者实现一个名为'GPU热专家重载'的功能,以提高具有中等活跃参数的MOE模型的解码速度,使其在像3090这样的GPU上更易于本地使用。

0 人收藏 0 人点赞
#gpu-offloading

@RiskRich: 你的8GB GPU不再是死路一条 FreeToken的论文报告Qwen3.6 35B在RTX 4060笔记本上运行,速度达到39…

X AI KOLs Timeline · 2026-08-23 缓存

FreeToken使得在诸如8GB GPU的有限硬件上运行大型AI模型如Qwen3.6 35B成为可能,通过将负载转移到CPU和RAM,为边缘计算提供了一种经济高效的解决方案。

0 人收藏 0 人点赞
#gpu-offloading

llama.cpp 在混合专家模型(MoE)和 GPU+CPU 卸载场景下,P 核比 E 核更慢?

Reddit r/LocalLLaMA · 2026-07-24

观察到在使用 GPU+CPU 卸载运行混合专家模型时,llama.cpp 在 P 核上的运行速度比 E 核慢。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈