标签
一位用户使用llama.cpp配合张量分割和其他优化,将一对不匹配的Tesla V100 GPU(16GB和32GB)配置成一个强大的本地LLM实验室,使用Qwen3.8 27B模型实现了高提示和解码速度。
一位用户分享了在双GPU配置(RTX 4090 + RTX 3090)上使用llama.cpp运行Qwen3.6 27B (Q8_0)的优化设置,在250k上下文下实现了75-100 t/s和1500 pp。