所有当前流行本地模型一览表 + Opus 4.8 测试结果
摘要
本文提供了一份流行本地AI模型的对比表格,涵盖代理、编码、通用和多模态任务等各种基准测试,以帮助用户根据硬件规格和用例选择模型。
如果您正在考虑哪个模型最适合您的硬件规格和当前任务,以下是一个包含所有当前流行且仍可视为本地模型的表格。
LLM测试得分特性
| 模型 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 |
|------|-----------------------------|------------------------|---------------------|---------------|-------------|----------|
| 总参数 | ≈285B | 284B | 125B | 320B | 27B | 未公布 |
| 活跃参数 | 13B | 13B | 6B | 18B | 27B | 未公布 |
代理基准测试
| 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 |
|----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------|
| Terminal Bench 2.1 | 83.9 | 82.7 | – | 82.6 | 73.0 | 85.0 |
| NL2Repo | 57.7 | 54.2 | 48.1 | 52.1 | 42.3 | 69.7 |
| DeepSWE | 59.3 | 54.4 | 58.7 | 61.1 | 42.2 | 58.0 |
| Toolathlon-Verified | 75.9 | 70.3 | 73.5 | 72.1 | – | 76.2 |
| Agents' Last Exam | 27.3 | 25.2⁷ | 24.3 | 28.1 | 20.4 | 25.7 |
| AutomationBench (Public) | 25.7 | 25.1 | – | 25.3 | – | 27.2 |
| GDPval-AA v2 | – | 68.1 | – | 72.3 | – | 75.1 |
| Cybergym | 75.3 | 76.7 | – | – | – | 78.3 |
| DSBench-Hard | 63.6 | 59.6 | – | – | – | 71.7 |
| DSBench-FullStack | – | 68.7 | – | – | – | 71.6 |
| ApexBench (Pass@1) | 36.5 | 26.2⁷ | – | – | – | 39.4 |
| HLE with tools (full set) | – | 16.8 | – | 22.9 | – | 25.4 |
编码基准测试
| 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 |
|----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------|
| SWE-bench Pro | – | 56.0 | 62.5 | – | 61.7 | – |
| SWE-bench Multilingual | – | – | 81.0 | – | 73.8 | – |
| CoWorkBench | – | 45.1 | 73.9 | – | 70.7 | – |
| JobBench | – | 41.3 | 55.7 | – | 33.4 | – |
通用基准测试
| 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 |
|----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------|
| GPQA Diamond | – | 90.8 | 91.7 | – | 89.2 | – |
| HLE (without tools) | – | 33.8 | 35.9 | – | 30.8 | – |
| LiveCodeBench v6 | – | 90.6 | 91.9 | – | 90.3 | – |
| IFBench | – | 79.2 | 81.3 | – | 79.5 | – |
多模态基准测试
| 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 |
|----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------|
| Chartography | 64.3 | – | – | – | – | 65.0 |
| ZeroBench (Pass@5) | 35.0 | – | – | – | – | 34.0 |
| BabyVision¹⁰ | – | – | – | 73.0 | 65.7 / 85.6 | 34.1 |
| MathVision¹⁰ | – | – | 90.6 / 95.7 | – | 90.0 / 94.6 | – |
| RealWorldQA | – | – | 88.5 | – | 85.9 | – |
| AndroidWorld | – | – | 84.5 | – | 81.9 | – |
| OSWorld 2.0 (partial credit) | – | – | 52.3 | – | 48.0 | – |
| Vision2Web | – | – | 64.0 | – | 62.9 | – |
| ClawEval-MM (Pass@3) | – | – | 64.4 | – | 57.4 | – |
| RecreationBench | – | – | 49.9 | – | 47.1 | – |
| ERQA | – | – | 72.3 | – | 65.5 | – |
注意:我使用了GLM-5.3从模型的官方Hugging Face页面中整理出此表格。
注意2:Opus-4.8的结果仅作展示用途,在选择每行最佳模型时已省略。
相似文章
现在运行本地模型已经很不错了
作者报告说,运行本地AI模型如今已经表现出色,最近发布的GPT-OSS和Gemma 4等模型使得在本地进行自主编码的准确率达到了前沿模型的大约75%,与几个月前相比有了显著提升。
所有本地模型都很差。即使是DeepseekV4也只能处理指令。请证明我错了
一位用户分享了对本地AI模型的挫败感,尽管在Vast.ai试用了花费超过400美元,却发现只有Claude Opus能有效处理复杂任务,如分析260页的PDF和Dropbox数据。
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。
按实际使用而非基准分数排名的AI模型——基准冠军勉强进入前20
一份基于实际使用量、成本和速度的AI模型排名显示,基准冠军在实际采用率上往往落后,像Flash Lite和GPT-5这样更便宜/更快的模型领先于Gemini 3.1 Pro等高价竞品。
本地文本到图像模型对比:终极测试。
用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。