Qwen3.6 35b Q2_XXS:在2026年,GPU 贫困也没那么糟糕
摘要
展示了在2026年,即使在显卡性能不足的情况下,也能通过量化版Qwen3.6-35B模型在低端笔记本电脑上用24分钟构建类塞尔达RPG游戏。
一块土豆也能在24分钟内创造出超酷的RPG游戏
笔记本电脑配置:I3处理器,8GB内存,0GB显存,Windows 11系统
llama-server.exe --host 0.0.0.0 --port 8080 -m models\qwen3.6-35b-Instruct\Qwen_Qwen3.6-35B-A3B-IQ2_XXS.gguf -c 8192 -n 8192 -tb 4 -b 512 -ub 512 --cache-type-v q8_0 --cache-type-k q8_0 -fa auto -ngl 0 --temp 0.0 --reasoning off
模型地址:https://huggingface.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF/resolve/main/Qwen_Qwen3.6-35B-A3B-IQ2_XXS.gguf(使用Instruct模型以减少推理token消耗)
生成耗时:24分钟,速度3 token/秒
生成提示词:
```
制作一个类塞尔达传说的2D角色扮演游戏世界
角色需可攻击敌人
操控按键:
W-上移
S-下移
A-左移
D-右移
F-攻击
主角持剑消灭敌人,通过击杀获得经验值升级并增强实力
敌人将随机生成形成无限循环
要求:输出为单个HTML文件
```
相似文章
@sudoingX:更新:Qwen 3.6 27b dense q4 在单张 3090 上一次生成了 Octopus Invaders 游戏。Hermes Agent 驱动了整个事…
用户基准测试表明,Qwen 3.6 27B dense 模型(Q4 量化)能够在单张 RTX 3090 上通过单次提示自主生成一个完全可玩的多文件游戏,性能显著优于其前代版本,且无需任何人工干预。测试结果突显了在消费级硬件上本地代码生成和智能体能力方面的重大改进。
在搭载RTX 4060(8GB)的笔记本电脑上运行Qwen3.6-35B-A3B——哪些有效、哪些无效以及一个令人意外的推测解码结果
详细记录了在8GB笔记本GPU上运行Qwen3.6-35B-A3B MoE模型的经历,涵盖有效优化(如--no-mmap和VRAM余量)、意料之外的发现(推测解码相比基准测试提升26%的速度)以及Windows和CPU瓶颈的陷阱。
在廉价 Radeon 7600 上运行 Qwen 3.6 35B A3B-Q8_0 gguf,速度 18 token/s * 更新后提升至 21 t/s
用户报告在 Radeon 7600 上使用 llama.cpp 和 ROCm 运行 Qwen 3.6 35B A3B-Q8_0 gguf,在显存超频后达到每秒 21 tokens,并提到一个与显示相关的性能 bug。
大家忽略了 Qwen 3.8 27B Q2 + Q2 DFlash + Q5 KV 的实力
一位用户分享了使用 QAT Q2 和 Q5 KV 运行量化版 Qwen 3.8 27B 模型的经验,在 12GB 显卡上实现了高达 200K token 上下文的高性能,性能超越了 Sonnet 4.6 等模型。
Qwen 30B MoE - 30tps - 6GB显存 - 搞定!
一位用户分享了在RTX 3050 6GB上成功运行Qwen 30B MoE的经验,支持90k上下文,速度达到每秒30-35个token,庆祝低端硬件的出色表现。