Qwen3.6 35b Q2_XXS:在2026年,GPU 贫困也没那么糟糕

Reddit r/LocalLLaMA 新闻

摘要

展示了在2026年,即使在显卡性能不足的情况下,也能通过量化版Qwen3.6-35B模型在低端笔记本电脑上用24分钟构建类塞尔达RPG游戏。

一块土豆也能在24分钟内创造出超酷的RPG游戏 笔记本电脑配置:I3处理器,8GB内存,0GB显存,Windows 11系统 llama-server.exe --host 0.0.0.0 --port 8080 -m models\qwen3.6-35b-Instruct\Qwen_Qwen3.6-35B-A3B-IQ2_XXS.gguf -c 8192 -n 8192 -tb 4 -b 512 -ub 512 --cache-type-v q8_0 --cache-type-k q8_0 -fa auto -ngl 0 --temp 0.0 --reasoning off 模型地址:https://huggingface.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF/resolve/main/Qwen_Qwen3.6-35B-A3B-IQ2_XXS.gguf(使用Instruct模型以减少推理token消耗) 生成耗时:24分钟,速度3 token/秒 生成提示词: ``` 制作一个类塞尔达传说的2D角色扮演游戏世界 角色需可攻击敌人 操控按键: W-上移 S-下移 A-左移 D-右移 F-攻击 主角持剑消灭敌人,通过击杀获得经验值升级并增强实力 敌人将随机生成形成无限循环 要求:输出为单个HTML文件 ```
查看原文

相似文章

Qwen 30B MoE - 30tps - 6GB显存 - 搞定!

Reddit r/LocalLLaMA

一位用户分享了在RTX 3050 6GB上成功运行Qwen 30B MoE的经验,支持90k上下文,速度达到每秒30-35个token,庆祝低端硬件的出色表现。