@TraffAlex: 32GB VRAM的AI模型 — 前17名速查表 调用HuggingFace API,获取了真实的.gguf Q4大小。每个链接均为直接下载…

X AI KOLs Timeline 新闻

摘要

一份速查表,列出了使用GGUF Q4量化针对32GB VRAM优化的顶级AI模型,并提供来自HuggingFace的直接下载链接。包含Qwen、DeepSeek、Llama和Mistral系列的模型,以及关于量化和上下文设置的提示。

AI MODELS FOR 32GB VRAM — TOP 17 CHEAT SHEET 调用HuggingFace API,获取了真实的.gguf Q4大小。 每个链接均为直接下载。保存此页。 ━━━━━━━━━━━━━━━━━━━━ QWEN — 精选推荐 Qwen3.6-35B-A3B (unsloth) MoE猛兽 — 仅3B活跃参数 35B | 22.3 GB (Q4) https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF… Qwen3.6-27B (unsloth) 多模态旗舰 27B | 17.6 GB (Q4) https://huggingface.co/unsloth/Qwen3.6-27B-GGUF… Qwen3-Coder-30B-A3B (unsloth) 编码MoE专家 30B | 19.2 GB (Q4) https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF… Qwen3.6-27B (ubergarm) 27B | 16.6 GB (IQ4_KS) https://huggingface.co/ubergarm/Qwen3.6-27B-GGUF… Qwen3.6-35B-A3B (bartowski) 35B | 22.9 GB (Q4) https://huggingface.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF… Qwen3.6-27B-Huihui-abliterated 27B | 16.5 GB (Q4_K_M) https://huggingface.co/Abiray/Huihui-Qwen3.6-27B-abliterated-Q4_K_M-GGUF… Qwen3.6-27B-MTP-pi-tune 推理调优变体 27B | 16.8 GB (Q4) https://huggingface.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF… Qwen3.6-27B-i1 (混合量化) 27B | 14.6 GB (IQ4_KS) https://huggingface.co/cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF… Qwen2.5-32B-Instruct (bartowski) 可靠的主力 32B | 20.4 GB (Q4) https://huggingface.co/bartowski/Qwen2.5-32B-Instruct-GGUF… ━━━━━━━━━━━━━━━━━━━━ DEEPSEEK — 精选推荐 R1-Distill-Qwen-32B 推理之王 32B | 20.6 GB (Q4) https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-GGUF… R1-Distill-Qwen-32B-abliterated 无限制推理 32B | 20.6 GB (Q4) https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF… DeepSeek-Coder-V2-Lite-Instruct MoE编码器,轻量级 16B | 10.9 GB (Q4) https://huggingface.co/bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUF… ━━━━━━━━━━━━━━━━━━━━ LLAMA + MOE — 精选推荐 Llama-3.2-8X3B-MOE-Dark-Champion 18.4B | 11.3 GB (Q4) https://huggingface.co/DavidAU/Llama-3.2-8X3B-MOE-Dark-Champion-Instruct-uncensored-abliterated-18.4B-GGUF… Llama-3.2-8X4B-MOE-V2-Dark-Champion 21B | 12.9 GB (Q4) https://huggingface.co/DavidAU/Llama-3.2-8X4B-MOE-V2-Dark-Champion-Instruct-uncensored-abliterated-21B-GGUF… Dolphin-Mistral-24B-Venice 无限制MoE版 24B | 14.9 GB (Q4) https://huggingface.co/bartowski/cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-GGUF… Mistral-MOE-4X7B-Dark-MultiVerse 24B MoE,增强且无限制 24B | 14.7 GB (Q4) https://huggingface.co/DavidAU/Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24B-gguf… Mistral-Nemo-Instruct-2407 12B | 8.0 GB (Q4) https://huggingface.co/bartowski/Mistral-Nemo-Instruct-2407-GGUF… ━━━━━━━━━━━━━━━━━━━━ 32GB VRAM 前三名 ① Qwen3.6-35B-A3B — MoE速度,22.3 GB ② Qwen3-Coder-30B-A3B — 编码之王,19.2 GB ③ R1-Distill-Qwen-32B — 推理,20.6 GB ━━━━━━━━━━━━━━━━━━━━ 快速提示 Q4_K_M = 最佳质量/大小比 MoE = 大模型质量,小模型速度 n_gpu_layers = 99 (全部在GPU上) n_ctx = 8192 (标准上下文) 通过HF API验证 · 2025-07-05 #LocalAI #GGUF #LLM #Qwen #DeepSeek #Llama #AI #Quantization #32GBVRAM #RunLocally
查看原文
查看缓存全文

缓存时间: 2026/07/06 18:17

适用于32GB显存的AI模型 — 前17个速查表
访问HuggingFace API,获取了真实的.gguf Q4大小。每个链接都是直接下载。保存好这份资料。
━━━━━━━━━━━━━━━━━━━━
QWEN — 首选推荐
Qwen3.6-35B-A3B (unsloth)
MoE猛兽 — 仅3B激活参数
35B | 22.3 GB (Q4)
https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF…

Qwen3.6-27B (unsloth)
多模态旗舰
27B | 17.6 GB (Q4)
https://huggingface.co/unsloth/Qwen3.6-27B-GGUF…

Qwen3-Coder-30B-A3B (unsloth)
编程MoE专家
30B | 19.2 GB (Q4)
https://huggingface.co/unsloth/Qwen3-Coder-30B-A3B-Instruct-GGUF…

Qwen3.6-27B (ubergarm)
27B | 16.6 GB (IQ4_KS)
https://huggingface.co/ubergarm/Qwen3.6-27B-GGUF…

Qwen3.6-35B-A3B (bartowski)
35B | 22.9 GB (Q4)
https://huggingface.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF…

Qwen3.6-27B-Huihui-abliterated
27B | 16.5 GB (Q4_K_M)
https://huggingface.co/Abiray/Huihui-Qwen3.6-27B-abliterated-Q4_K_M-GGUF…

Qwen3.6-27B-MTP-pi-tune
推理调优变体
27B | 16.8 GB (Q4)
https://huggingface.co/bytkim/Qwen3.6-27B-MTP-pi-tune-GGUF…

Qwen3.6-27B-i1 (混合量化)
27B | 14.6 GB (IQ4_KS)
https://huggingface.co/cHunter789/Qwen3.6-27B-i1-IQ4_KS-GGUF…

Qwen2.5-32B-Instruct (bartowski)
可靠的工作马
32B | 20.4 GB (Q4)
https://huggingface.co/bartowski/Qwen2.5-32B-Instruct-GGUF…

━━━━━━━━━━━━━━━━━━━━
DEEPSEEK — 首选推荐
R1-Distill-Qwen-32B
推理之王
32B | 20.6 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-GGUF…

R1-Distill-Qwen-32B-abliterated
无审查推理
32B | 20.6 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF…

DeepSeek-Coder-V2-Lite-Instruct
MoE编程器,轻量级
16B | 10.9 GB (Q4)
https://huggingface.co/bartowski/DeepSeek-Coder-V2-Lite-Instruct-GGUF…

━━━━━━━━━━━━━━━━━━━━
LLAMA + MOE — 首选推荐
Llama-3.2-8X3B-MOE-Dark-Champion
18.4B | 11.3 GB (Q4)
https://huggingface.co/DavidAU/Llama-3.2-8X3B-MOE-Dark-Champion-Instruct-uncensored-abliterated-18.4B-GGUF…

Llama-3.2-8X4B-MOE-V2-Dark-Champion
21B | 12.9 GB (Q4)
https://huggingface.co/DavidAU/Llama-3.2-8X4B-MOE-V2-Dark-Champion-Instruct-uncensored-abliterated-21B-GGUF…

Dolphin-Mistral-24B-Venice
无审查MoE版本
24B | 14.9 GB (Q4)
https://huggingface.co/bartowski/cognitivecomputations_Dolphin-Mistral-24B-Venice-Edition-GGUF…

Mistral-MOE-4X7B-Dark-MultiVerse
24B MoE,增强版且无审查
24B | 14.7 GB (Q4)
https://huggingface.co/DavidAU/Mistral-MOE-4X7B-Dark-MultiVerse-Uncensored-Enhanced32-24B-gguf…

Mistral-Nemo-Instruct-2407
12B | 8.0 GB (Q4)
https://huggingface.co/bartowski/Mistral-Nemo-Instruct-2407-GGUF…

━━━━━━━━━━━━━━━━━━━━
32GB显存前三名
1 Qwen3.6-35B-A3B — MoE速度,22.3 GB
2 Qwen3-Coder-30B-A3B — 编程之王,19.2 GB
3 R1-Distill-Qwen-32B — 推理,20.6 GB

━━━━━━━━━━━━━━━━━━━━
快速提示
Q4_K_M = 最佳质量/大小比
MoE = 大模型质量,小模型速度
n_gpu_layers = 99 (全部放入GPU)
n_ctx = 8192 (标准上下文)
通过HF API验证 · 2025-07-05
#LocalAI #GGUF #LLM #Qwen #DeepSeek #Llama #AI #Quantization #32GBVRAM #RunLocally


unsloth/Qwen-AgentWorld-35B-A3B-GGUF · Hugging Face

来源:https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF

该仓库包含Qwen-AgentWorld-35B-A3B的模型权重和配置文件,这是一个为智能体环境仿真训练的原生语言世界模型。这些构件与Hugging Face Transformers、vLLM、SGLang等兼容。Qwen-AgentWorld是首个在单个模型中覆盖七个智能体交互领域的语言世界模型。它通过长链思维推理来模拟智能体环境,给定智能体的动作和交互历史,预测下一个环境状态。通过三阶段流水线训练——CPT注入环境知识,SFT激活下一状态预测推理,RL增强模拟真实性——Qwen-AgentWorld是一个原生世界模型:从CPT阶段开始,环境建模就是训练目标,而非事后附加。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#highlights

亮点

  • 七个统一领域。单个模型涵盖MCP(工具调用)、搜索、终端、SWE(软件工程)、Android、Web和OS——跨越文本和GUI交互环境。
  • 原生世界模型。从CPT开始的环境建模,而非在通用LLM上进行事后适配。
  • 可泛化、可扩展且可控的模拟器。零样本泛化到OOD环境(例如OpenClaw);可控扰动和虚构世界构造超越了真实环境训练。
  • 智能体基础模型。在单轮、非智能体轨迹上的LWM RL热身,迁移到多轮、工具调用的智能体任务,跨越7个基准测试,包括3个完全域外任务。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#model-overview

模型概览

  • 类型:因果语言模型(语言世界模型)
  • 基础模型:Qwen3.5-35B-A3B-Base (https://huggingface.co/Qwen/Qwen3.5-35B-A3B-Base)
  • 训练阶段:持续预训练 (CPT) → 监督微调 (SFT) → 强化学习 (RL, GSPO)
  • 参数数量:总共35B,激活3B
  • 隐藏维度:2048
  • 词嵌入:248320(填充后)
  • 层数:40
  • 隐藏布局:10 × (3 × (门控DeltaNet → MoE) → 1 × (门控注意力 → MoE))
  • 门控DeltaNet:
    • 线性注意力头数:V为32,QK为16
    • 头维度:128
  • 门控注意力:
    • 注意力头数:Q为16,KV为2
    • 头维度:256
  • 旋转位置嵌入维度:64
  • 混合专家
    • 专家数:256
    • 激活专家数:8路由 + 1共享
    • 专家中间维度:512
  • 上下文长度:262,144 tokens
  • 免责声明:训练流水线中不包含任何外部API服务的输出。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#performance

性能

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#agentworldbench-open-ended-evaluation

AgentWorldBench(开放式评估)
每个领域五维度评分均值,归一化到0-100分。

模型MCP搜索终端SWEAndroidWebOS总体
GPT-5.470.1037.2653.6966.2960.0051.8068.5858.25
Claude Opus 4.854.9335.1459.1864.1061.5054.6666.6256.59
Claude Opus 4.669.9029.3057.5164.5561.7451.4270.2057.80
Gemini 3.1 Pro59.0730.2152.4759.0761.4052.8366.9254.57
Claude Sonnet 4.670.0028.7956.9864.5258.0350.7863.1756.04
DeepSeek-V4-Pro63.2727.6151.2659.4455.1750.3263.7052.97
GLM-5.167.6022.4647.3252.0759.1051.5059.1351.31
Kimi K2.665.2327.4852.5458.7758.9350.2060.8053.42
MiniMax-M2.755.8227.3041.6237.4452.4050.5257.7346.12
Qwen3.5-35B-A3B57.8725.9846.1347.5853.1847.1056.2747.73
Qwen3.5-397B-A17B68.3130.8155.3064.4454.9048.5560.8554.74
Qwen3.6-Plus55.2821.9450.5859.0857.6550.7860.3350.81
Qwen-AgentWorld-35B-A3B64.7936.6953.9665.6358.1749.5565.9256.39
Qwen-AgentWorld-397B-A17B68.2437.8257.7368.4960.2050.9867.8958.71

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#quickstart

快速开始

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#deployment

部署
Qwen-AgentWorld-35B-A3B可以通过流行的推理框架通过API提供服务。下面,我们展示启动OpenAI兼容API服务器的示例命令。

模型默认上下文长度为262,144 tokens。如果遇到内存不足(OOM)错误,请考虑减小上下文窗口。但是,由于Qwen-AgentWorld利用扩展上下文进行多轮环境模拟,我们建议至少保持128K tokens的上下文长度。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#sglang

SGLang
SGLang (https://github.com/sgl-project/sglang) 是一个用于大型语言模型的快速服务框架。

python -m sglang.launch_server \  
  --model-path Qwen/Qwen-AgentWorld-35B-A3B \  
  --port 8000 \  
  --tp-size 4 \  
  --context-length 262144 \  
  --reasoning-parser qwen3  

OpenAI兼容API将在 http://localhost:8000/v1 可用。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#vllm

vLLM
vLLM (https://github.com/vllm-project/vllm) 是一个高吞吐量、内存高效的LLM推理引擎。

vllm serve Qwen/Qwen-AgentWorld-35B-A3B \  
  --port 8000 \  
  --tensor-parallel-size 4 \  
  --max-model-len 262144 \  
  --reasoning-parser qwen3 \  
  --trust-remote-code  

OpenAI兼容API将在 http://localhost:8000/v1 可用。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#inference-with-transformers

使用Transformers进行推理

from transformers import AutoModelForCausalLM, AutoTokenizer  

model_name = "Qwen/Qwen-AgentWorld-35B-A3B"  
tokenizer = AutoTokenizer.from_pretrained(model_name)  
model = AutoModelForCausalLM.from_pretrained(  
    model_name,  
    torch_dtype="auto",  
    device_map="auto",  
)  

messages = [  
    {  
        "role": "system",  
        "content": "你是一个语言世界模型,模拟Linux终端环境。给定用户的命令,预测终端输出。"  
    },  
    {  
        "role": "user",  
        "content": "Action: execute_bash\nCommand: ls -la /home/user/project/"  
    }  
]  

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)  
inputs = tokenizer([text], return_tensors="pt").to(model.device)  
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)  
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)  
print(response)  

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#using-via-the-chat-completions-api

通过Chat Completions API使用

from openai import OpenAI  

client = OpenAI(  
    base_url="http://localhost:8000/v1",  
    api_key="EMPTY",  
)  

# 终端领域示例  
messages = [  
    {  
        "role": "system",  
        "content": "你是一个语言世界模型,模拟Linux终端环境。给定用户的命令,预测终端输出。"  
    },  
    {  
        "role": "user",  
        "content": "Action: execute_bash\nCommand: ls -la /home/user/project/"  
    }  
]  

response = client.chat.completions.create(  
    model="Qwen/Qwen-AgentWorld-35B-A3B",  
    messages=messages,  
    max_tokens=32768,  
    temperature=0.6,  
)  

print(response.choices[0].message.content)  

我们在GitHub仓库的 prompts/ (https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供了所有7个领域的领域特定世界模型系统提示模板。这些可作为使用Qwen-AgentWorld作为环境模拟器时的通用系统提示。每个领域文件夹包含一个 system_prompt.txt(世界模型系统提示)和一个 judge_system_prompt.txt(评估提示)。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#evaluate-on-agentworldbench

在AgentWorldBench上评估
AgentWorldBench通过从5个维度对每个预测的环境观测进行评分来评估语言世界模型:格式事实性一致性真实性质量

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#setup

设置

# 克隆评估仓库  
git clone https://github.com/QwenLM/Qwen-AgentWorld.git  
cd Qwen-AgentWorld  

# 下载基准测试  
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench  

# 安装依赖  
pip install openai  

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#run-evaluation

运行评估
评估遵循三步流水线:

cd eval  

# 步骤1:运行世界模型推理  
python eval.py infer \  
    --data-dir ../AgentWorldBench \  
    --model-base-url http://localhost:8000/v1 \  
    --model-name Qwen/Qwen-AgentWorld-35B-A3B \  
    --output-dir ./results  

# 步骤2:运行LLM评判评分  
export OPENAI_API_KEY="your-api-key"  
python eval.py judge \  
    --predictions ./results/predictions.jsonl \  
    --judge-base-url https://api.openai.com/v1 \  
    --judge-model gpt-5.2-2025-12-11 \  
    --output-dir ./results  

# 步骤3:汇总并显示分数  
python eval.py score --predictions ./results/judged.jsonl  

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#best-practices

最佳实践

  1. 采样参数:我们推荐世界模型推理使用 temperature=0.6top_p=0.95top_k=20。模型默认使用思考模式(...)在生成预测观测前推理环境状态转换。
  2. 足够的输出长度:对于大多数查询,我们推荐输出长度为32,768 tokens。对于长、多步骤的轨迹,您可以增加最大输出长度以适应详细的环境观测。
  3. 领域特定系统提示:为获得最佳模拟保真度,请使用GitHub仓库的 prompts/ (https://github.com/QwenLM/Qwen-AgentWorld/tree/master/prompts) 目录中提供的领域特定系统提示。

https://huggingface.co/unsloth/Qwen-AgentWorld-35B-A3B-GGUF#citation

引用
如果您觉得我们的工作有帮助,欢迎引用我们。

@article{zuo2026qwen,  
  title={Qwen-agentworld: language world models for general agents},  
  author={Zuo, Yuxin and Xiao, Zikai and Sheng, Li and Huang, Fei and Tu, Jianhong and Liu, Yuxuan and Tang, Tianyi and Hu, Xiaomeng and Su, Yang and Lan, Qingfeng and others},  
  journal={arXiv preprint arXiv:2606.24597},  
  year={2026}  
}  

相似文章

google/gemma-4-12B-it-qat-q4_0-gguf

Hugging Face Models Trending

Google DeepMind 发布了 Gemma 4 模型,这些模型通过量化感知训练(QAT)进行了优化,并提供包括 GGUF 在内的多种格式,在降低内存需求的同时实现了高质量。

在政治动荡前值得获取的模型

Reddit r/LocalLLaMA

一份精选的推荐AI模型列表(例如Qwen3.5、Gemma 4、Mistral Medium),适用于统一内存最高256GB的系统,涵盖创意、编程、智能体及通用聊天等使用场景。