所有当前流行本地模型一览表 + Opus 4.8 测试结果

Reddit r/LocalLLaMA 新闻

摘要

本文提供了一份流行本地AI模型的对比表格,涵盖代理、编码、通用和多模态任务等各种基准测试,以帮助用户根据硬件规格和用例选择模型。

如果您正在考虑哪个模型最适合您的硬件规格和当前任务,以下是一个包含所有当前流行且仍可视为本地模型的表格。 LLM测试得分特性 | 模型 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 | |------|-----------------------------|------------------------|---------------------|---------------|-------------|----------| | 总参数 | ≈285B | 284B | 125B | 320B | 27B | 未公布 | | 活跃参数 | 13B | 13B | 6B | 18B | 27B | 未公布 | 代理基准测试 | 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 | |----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------| | Terminal Bench 2.1 | 83.9 | 82.7 | – | 82.6 | 73.0 | 85.0 | | NL2Repo | 57.7 | 54.2 | 48.1 | 52.1 | 42.3 | 69.7 | | DeepSWE | 59.3 | 54.4 | 58.7 | 61.1 | 42.2 | 58.0 | | Toolathlon-Verified | 75.9 | 70.3 | 73.5 | 72.1 | – | 76.2 | | Agents' Last Exam | 27.3 | 25.2⁷ | 24.3 | 28.1 | 20.4 | 25.7 | | AutomationBench (Public) | 25.7 | 25.1 | – | 25.3 | – | 27.2 | | GDPval-AA v2 | – | 68.1 | – | 72.3 | – | 75.1 | | Cybergym | 75.3 | 76.7 | – | – | – | 78.3 | | DSBench-Hard | 63.6 | 59.6 | – | – | – | 71.7 | | DSBench-FullStack | – | 68.7 | – | – | – | 71.6 | | ApexBench (Pass@1) | 36.5 | 26.2⁷ | – | – | – | 39.4 | | HLE with tools (full set) | – | 16.8 | – | 22.9 | – | 25.4 | 编码基准测试 | 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 | |----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------| | SWE-bench Pro | – | 56.0 | 62.5 | – | 61.7 | – | | SWE-bench Multilingual | – | – | 81.0 | – | 73.8 | – | | CoWorkBench | – | 45.1 | 73.9 | – | 70.7 | – | | JobBench | – | 41.3 | 55.7 | – | 33.4 | – | 通用基准测试 | 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 | |----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------| | GPQA Diamond | – | 90.8 | 91.7 | – | 89.2 | – | | HLE (without tools) | – | 33.8 | 35.9 | – | 30.8 | – | | LiveCodeBench v6 | – | 90.6 | 91.9 | – | 90.3 | – | | IFBench | – | 79.2 | 81.3 | – | 79.5 | – | 多模态基准测试 | 基准测试 | DeepSeek-V4-Flash-Vision-Exp | DeepSeek-V4-Flash-0731 | Qwen3.8-Flash-Next | GLM-5.3-Flash | Qwen3.8-27B | Opus-4.8 | |----------|-----------------------------|------------------------|---------------------|---------------|-------------|----------| | Chartography | 64.3 | – | – | – | – | 65.0 | | ZeroBench (Pass@5) | 35.0 | – | – | – | – | 34.0 | | BabyVision¹⁰ | – | – | – | 73.0 | 65.7 / 85.6 | 34.1 | | MathVision¹⁰ | – | – | 90.6 / 95.7 | – | 90.0 / 94.6 | – | | RealWorldQA | – | – | 88.5 | – | 85.9 | – | | AndroidWorld | – | – | 84.5 | – | 81.9 | – | | OSWorld 2.0 (partial credit) | – | – | 52.3 | – | 48.0 | – | | Vision2Web | – | – | 64.0 | – | 62.9 | – | | ClawEval-MM (Pass@3) | – | – | 64.4 | – | 57.4 | – | | RecreationBench | – | – | 49.9 | – | 47.1 | – | | ERQA | – | – | 72.3 | – | 65.5 | – | 注意:我使用了GLM-5.3从模型的官方Hugging Face页面中整理出此表格。 注意2:Opus-4.8的结果仅作展示用途,在选择每行最佳模型时已省略。
查看原文

相似文章

现在运行本地模型已经很不错了

Hacker News Top

作者报告说,运行本地AI模型如今已经表现出色,最近发布的GPT-OSS和Gemma 4等模型使得在本地进行自主编码的准确率达到了前沿模型的大约75%,与几个月前相比有了显著提升。

本地文本到图像模型对比:终极测试。

Reddit r/LocalLLaMA

用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。