@TraffAlex: 32GB VRAM的AI模型 — 前17名速查表 调用HuggingFace API,获取了真实的.gguf Q4大小。每个链接均为直接下载…
摘要
一份速查表,列出了使用GGUF Q4量化针对32GB VRAM优化的顶级AI模型,并提供来自HuggingFace的直接下载链接。包含Qwen、DeepSeek、Llama和Mistral系列的模型,以及关于量化和上下文设置的提示。
查看缓存全文
缓存时间: 2026/07/06 18:17
适用于32GB显存的AI模型 — 前17个速查表
访问HuggingFace API,获取了真实的.gguf Q4大小。每个链接都是直接下载。保存好这份资料。
━━━━━━━━━━━━━━━━━━━━
QWEN — 首选推荐
Qwen3.6-35B-A3B (unsloth)
MoE猛兽 — 仅3B激活参数
35B | 22.3 GB (Q4)
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF…
Qwen3.6-27B (unsloth)
多模态旗舰
27B | 17.6 GB (Q4)
https://huggingface.co/unsloth/Qwen3.6-27B-GGUF…
Qwen3-Coder-30B-A3B (unsloth)
编程MoE专家
30B | 19.2 GB (Q4)
https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF…
Qwen3.6-27B (ubergarm)
27B | 16.6 GB (IQ4_KS)
https://huggingface.co/ubergarm/Qwen3.6-27B-GGUF…
Qwen3.6-35B-A3B (bartowski)
35B | 22.9 GB (Q4)
https://huggingface.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF…
Qwen3.6-27B-Huihui-abliterated
27B | 16.5 GB (Q4_K_M)
https://huggingface.co/Abiray/Huihui-Qwen3.6-27B-abliterated-Q4_K_M-GGUF…
Qwen3.6-27B-MTP-pi-tune
推理调优变体
27B | 16.8 GB (Q4)
https://huggingface.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF…
Qwen3.6-27B-i1 (混合量化)
27B | 14.6 GB (IQ4_KS)
https://huggingface.co/cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF…
Qwen2.5-32B-Instruct (bartowski)
可靠的工作马
32B | 20.4 GB (Q4)
https://huggingface.co/bartowski/Qwen2.5-32B-Instruct-GGUF…
━━━━━━━━━━━━━━━━━━━━
DEEPSEEK — 首选推荐
R1-Distill-Qwen-32B
推理之王
32B | 20.6 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-GGUF…
R1-Distill-Qwen-32B-abliterated
无审查推理
32B | 20.6 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF…
DeepSeek-Coder-V2-Lite-Instruct
MoE编程器,轻量级
16B | 10.9 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUF…
━━━━━━━━━━━━━━━━━━━━
LLAMA + MOE — 首选推荐
Llama-3.2-8X3B-MOE-Dark-Champion
18.4B | 11.3 GB (Q4)
https://huggingface.co/DavidAU/Llama-3.2-8X3B-MOE-Dark-Champion-Instruct-uncensored-abliterated-18.4B-GGUF…
Llama-3.2-8X4B-MOE-V2-Dark-Champion
21B | 12.9 GB (Q4)
https://huggingface.co/DavidAU/Llama-3.2-8X4B-MOE-V2-Dark-Champion-Instruct-uncensored-abliterated-21B-GGUF…
Dolphin-Mistral-24B-Venice
无审查MoE版本
24B | 14.9 GB (Q4)
https://huggingface.co/bartowski/cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-GGUF…
Mistral-MOE-4X7B-Dark-MultiVerse
24B MoE,增强版且无审查
24B | 14.7 GB (Q4)
https://huggingface.co/DavidAU/Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24B-gguf…
Mistral-Nemo-Instruct-2407
12B | 8.0 GB (Q4)
https://huggingface.co/bartowski/Mistral-Nemo-Instruct-2407-GGUF…
━━━━━━━━━━━━━━━━━━━━
32GB显存前三名
1 Qwen3.6-35B-A3B — MoE速度,22.3 GB
2 Qwen3-Coder-30B-A3B — 编程之王,19.2 GB
3 R1-Distill-Qwen-32B — 推理,20.6 GB
━━━━━━━━━━━━━━━━━━━━
快速提示
Q4_K_M = 最佳质量/大小比
MoE = 大模型质量,小模型速度
n_gpu_layers = 99 (全部放入GPU)
n_ctx = 8192 (标准上下文)
通过HF API验证 · 2025-07-05
#LocalAI #GGUF #LLM #Qwen #DeepSeek #Llama #AI #Quantization #32GBVRAM #RunLocally
unsloth/Qwen-AgentWorld-35B-A3B-GGUF · Hugging Face
来源:https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF
该仓库包含Qwen-AgentWorld-35B-A3B的模型权重和配置文件,这是一个为智能体环境仿真训练的原生语言世界模型。这些构件与Hugging Face Transformers、vLLM、SGLang等兼容。Qwen-AgentWorld是首个在单个模型中覆盖七个智能体交互领域的语言世界模型。它通过长链思维推理来模拟智能体环境,给定智能体的动作和交互历史,预测下一个环境状态。通过三阶段流水线训练——CPT注入环境知识,SFT激活下一状态预测推理,RL增强模拟真实性——Qwen-AgentWorld是一个原生世界模型:从CPT阶段开始,环境建模就是训练目标,而非事后附加。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#highlights
亮点
- 七个统一领域。单个模型涵盖MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web和OS——跨越文本和GUI交互环境。
- 原生世界模型。从CPT开始的环境建模,而非在通用LLM上进行事后适配。
- 可泛化、可扩展且可控的模拟器。零样本泛化到OOD环境(例如OpenClaw);可控扰动和虚构世界构造超越了真实环境训练。
- 智能体基础模型。在单轮、非智能体轨迹上的LWM RL热身,迁移到多轮、工具调用的智能体任务,跨越7个基准测试,包括3个完全域外任务。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#model-overview
模型概览
- 类型:因果语言模型(语言世界模型)
- 基础模型:Qwen3.5-35B-A3B-Base (https://huggingface.co/Qwen/Qwen3.5-35B-A3B-Base)
- 训练阶段:持续预训练 (CPT) → 监督微调 (SFT) → 强化学习 (RL, GSPO)
- 参数数量:总共35B,激活3B
- 隐藏维度:2048
- 词嵌入:248320(填充后)
- 层数:40
- 隐藏布局:10 × (3 × (门控DeltaNet → MoE) → 1 × (门控注意力 → MoE))
- 门控DeltaNet:
- 线性注意力头数:V为32,QK为16
- 头维度:128
- 门控注意力:
- 注意力头数:Q为16,KV为2
- 头维度:256
- 旋转位置嵌入维度:64
- 混合专家
- 专家数:256
- 激活专家数:8路由 + 1共享
- 专家中间维度:512
- 上下文长度:262,144 tokens
- 免责声明:训练流水线中不包含任何外部API服务的输出。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#performance
性能
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#agentworldbench-open-ended-evaluation
AgentWorldBench(开放式评估)
每个领域五维度评分均值,归一化到0-100分。
| 模型 | MCP | 搜索 | 终端 | SWE | Android | Web | OS | 总体 |
|---|---|---|---|---|---|---|---|---|
| GPT-5.4 | 70.10 | 37.26 | 53.69 | 66.29 | 60.00 | 51.80 | 68.58 | 58.25 |
| Claude Opus 4.8 | 54.93 | 35.14 | 59.18 | 64.10 | 61.50 | 54.66 | 66.62 | 56.59 |
| Claude Opus 4.6 | 69.90 | 29.30 | 57.51 | 64.55 | 61.74 | 51.42 | 70.20 | 57.80 |
| Gemini 3.1 Pro | 59.07 | 30.21 | 52.47 | 59.07 | 61.40 | 52.83 | 66.92 | 54.57 |
| Claude Sonnet 4.6 | 70.00 | 28.79 | 56.98 | 64.52 | 58.03 | 50.78 | 63.17 | 56.04 |
| DeepSeek-V4-Pro | 63.27 | 27.61 | 51.26 | 59.44 | 55.17 | 50.32 | 63.70 | 52.97 |
| GLM-5.1 | 67.60 | 22.46 | 47.32 | 52.07 | 59.10 | 51.50 | 59.13 | 51.31 |
| Kimi K2.6 | 65.23 | 27.48 | 52.54 | 58.77 | 58.93 | 50.20 | 60.80 | 53.42 |
| MiniMax-M2.7 | 55.82 | 27.30 | 41.62 | 37.44 | 52.40 | 50.52 | 57.73 | 46.12 |
| Qwen3.5-35B-A3B | 57.87 | 25.98 | 46.13 | 47.58 | 53.18 | 47.10 | 56.27 | 47.73 |
| Qwen3.5-397B-A17B | 68.31 | 30.81 | 55.30 | 64.44 | 54.90 | 48.55 | 60.85 | 54.74 |
| Qwen3.6-Plus | 55.28 | 21.94 | 50.58 | 59.08 | 57.65 | 50.78 | 60.33 | 50.81 |
| Qwen-AgentWorld-35B-A3B | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 |
| Qwen-AgentWorld-397B-A17B | 68.24 | 37.82 | 57.73 | 68.49 | 60.20 | 50.98 | 67.89 | 58.71 |
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#quickstart
快速开始
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#deployment
部署
Qwen-AgentWorld-35B-A3B可以通过流行的推理框架通过API提供服务。下面,我们展示启动OpenAI兼容API服务器的示例命令。
模型默认上下文长度为262,144 tokens。如果遇到内存不足(OOM)错误,请考虑减小上下文窗口。但是,由于Qwen-AgentWorld利用扩展上下文进行多轮环境模拟,我们建议至少保持128K tokens的上下文长度。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#sglang
SGLang
SGLang (https://github.com/sgl-project/sglang) 是一个用于大型语言模型的快速服务框架。
python -m sglang.launch_server \
--model-path Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3
OpenAI兼容API将在 http://localhost:8000/v1 可用。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#vllm
vLLM
vLLM (https://github.com/vllm-project/vllm) 是一个高吞吐量、内存高效的LLM推理引擎。
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--trust-remote-code
OpenAI兼容API将在 http://localhost:8000/v1 可用。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#inference-with-transformers
使用Transformers进行推理
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
)
messages = [
{
"role": "system",
"content": "你是一个语言世界模型,模拟Linux终端环境。给定用户的命令,预测终端输出。"
},
{
"role": "user",
"content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
}
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#using-via-the-chat-completions-api
通过Chat Completions API使用
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:8000/v1",
api_key="EMPTY",
)
# 终端领域示例
messages = [
{
"role": "system",
"content": "你是一个语言世界模型,模拟Linux终端环境。给定用户的命令,预测终端输出。"
},
{
"role": "user",
"content": "Action: execute_bash\nCommand: ls -la /home/user/project/"
}
]
response = client.chat.completions.create(
model="Qwen/Qwen-AgentWorld-35B-A3B",
messages=messages,
max_tokens=32768,
temperature=0.6,
)
print(response.choices[0].message.content)
我们在GitHub仓库的
prompts/(https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供了所有7个领域的领域特定世界模型系统提示模板。这些可作为使用Qwen-AgentWorld作为环境模拟器时的通用系统提示。每个领域文件夹包含一个system_prompt.txt(世界模型系统提示)和一个judge_system_prompt.txt(评估提示)。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#evaluate-on-agentworldbench
在AgentWorldBench上评估
AgentWorldBench通过从5个维度对每个预测的环境观测进行评分来评估语言世界模型:格式、事实性、一致性、真实性和质量。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#setup
设置
# 克隆评估仓库
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld
# 下载基准测试
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench
# 安装依赖
pip install openai
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#run-evaluation
运行评估
评估遵循三步流水线:
cd eval
# 步骤1:运行世界模型推理
python eval.py infer \
--data-dir ../AgentWorldBench \
--model-base-url http://localhost:8000/v1 \
--model-name Qwen/Qwen-AgentWorld-35B-A3B \
--output-dir ./results
# 步骤2:运行LLM评判评分
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
--predictions ./results/predictions.jsonl \
--judge-base-url https://api.openai.com/v1 \
--judge-model gpt-5.2-2025-12-11 \
--output-dir ./results
# 步骤3:汇总并显示分数
python eval.py score --predictions ./results/judged.jsonl
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#best-practices
最佳实践
- 采样参数:我们推荐世界模型推理使用
temperature=0.6、top_p=0.95、top_k=20。模型默认使用思考模式(...)在生成预测观测前推理环境状态转换。 - 足够的输出长度:对于大多数查询,我们推荐输出长度为32,768 tokens。对于长、多步骤的轨迹,您可以增加最大输出长度以适应详细的环境观测。
- 领域特定系统提示:为获得最佳模拟保真度,请使用GitHub仓库的
prompts/(https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供的领域特定系统提示。
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#citation
引用
如果您觉得我们的工作有帮助,欢迎引用我们。
@article{zuo2026qwen,
title={Qwen-agentworld: language world models for general agents},
author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},
journal={arXiv preprint arXiv:2606.24597},
year={2026}
}
相似文章
google/gemma-4-12B-it-qat-q4_0-gguf
Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。
@0xSero:本周最适合你硬件的模型。8-12GB - https://huggingface.co/LiquidAI/LFM2.5-8B-A1B… 令人难以置信的模型,如此快速,如此…
每周精选推荐最适合不同硬件配置(从8GB到768GB显存)的AI模型,突出性能与基准测试结果。
@0xSero:适合你硬件的最佳模型——4GB到12GB显存——VibeThinker-3B——秒杀所有同量级模型……
本推文推荐了针对不同显存容量优化的AI模型,重点介绍了VibeThinker-3B在3B参数量下的强大推理能力,以及其他用于编程和通用场景的模型。
@theemozilla: 我们正在努力改善 Hermes 中的本地模型体验,每个参数量级的最佳本地模型是什么?
用户询问针对不同 VRAM 级别(8-16GB、24-32GB、128GB)的最佳本地 AI 模型推荐,提到了 Gemma4、Qwen 和 DeepSeek 变体,因为他们正在改进 Hermes 中的本地模型支持。
在政治动荡前值得获取的模型
一份精选的推荐AI模型列表(例如Qwen3.5、Gemma 4、Mistral Medium),适用于统一内存最高256GB的系统,涵盖创意、编程、智能体及通用聊天等使用场景。