标签
以下是在双块英伟达3090显卡上运行Qwen 3.8 27B Q8模型的性能演示:通过单次指令生成名为RetroCraft的《我的世界》仿制游戏,包含详细的Token处理与生成速度分析。
经过两个月本地 LLM 测试,作者认为 gemma-4-12B-it-QAT 和 MTP 辅助组合在速度和可用性上表现最佳,硬件为 i7-13700 + 64GB RAM + RTX 4070。
一位用户分享了他们搭建双GPU本地AI实验室的经验,使用了RTX 4080 Super和5060 Ti,通过llama.cpp和llama-swap运行Qwen 3.6模型,以降低API成本并实现无限制的实验。