Qwen3.8-27B在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max并驾齐驱。您现在只需一块RTX 3090就能运行一个接近前沿的模型。
摘要
Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。
暂无内容
查看缓存全文
缓存时间: 2026/08/17 18:25
# Qwen3.8 27B - 智能、性能与价格分析
来源:https://artificialanalysis.ai/models/qwen3-8-27b
## 智能表现
### Artificial Analysis 智能指数
Artificial Analysis 智能指数 v4.1.1 包含9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
推理模型由灯泡图标标识。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### 按开放权重/专有分类的智能指数
Artificial Analysis 智能指数 v4.1.1 包含9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
推理模型由灯泡图标标识。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
此项表明模型权重是否可用。如果权重可用但商业用途受限(通常需要获得付费许可证),模型将被标记为“商业使用受限”。
### 智能评估
由 Artificial Analysis 独立衡量的智能评估 · 分数越高越好
在电子表格和文档上的量化分析能力
推理模型由灯泡图标标识。
虽然模型的智能通常可跨用例迁移,但某些评估可能对特定用例更具相关性。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
### AA-Omniscience
### AA-Omniscience 指数
AA-Omniscience 指数(分数越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,并且对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相等,负分表示错误答案多于正确答案。
推理模型由灯泡图标标识。
AA-Omniscience 指数(分数越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,并且对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相等,负分表示错误答案多于正确答案。
## 开放度指数
### Artificial Analysis 开放度指数:分数
开放度指数在 0 到 100 的归一化尺度上评估模型的开放程度(分数越高表示越开放)
推理模型由灯泡图标标识。
## 智能指数对比
### 智能指数 vs. 每项智能指数任务的成本
Artificial Analysis 智能指数 · 每项 Artificial Analysis 智能指数任务的加权平均成本(美元)
推理模型由灯泡图标标识。
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算得出,除以任务数,并根据其在智能指数中的权重进行加权。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。
## Token 使用量
### 每项智能指数任务的输出 Token 数
运行 Artificial Analysis 智能指数中一项任务所使用的加权平均输出 Token 数量。
推理模型由灯泡图标标识。
每项智能指数任务所需的 Token 数量。此数值通过将每项评估的输出 Token 数乘以该基准在智能指数中的相对权重,然后除以任务数(不包括重复项)计算得出。
## 成本
### 每项智能指数任务的成本
按令牌类型细分的 Artificial Analysis 智能指数每项任务加权平均成本(美元)。分数越低越好
推理模型由灯泡图标标识。
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算得出,除以任务数,并根据其在智能指数中的权重进行加权。
### 运行 Artificial Analysis 智能指数的总成本
运行 Artificial Analysis 智能指数中所有评估的成本(美元)
推理模型由灯泡图标标识。
运行 Artificial Analysis 智能指数中所有评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答令牌价格以及各评估中使用的令牌总数(不包括重复项)计算得出。
### 定价:缓存命中、输入和输出
价格(美元/每百万 Token)
推理模型由灯泡图标标识。
已缓存提示词(先前处理过的)每令牌的价格,通常比常规输入价格有显著折扣,以每百万令牌的美元价格表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储单独计费,且因提供商而异——详情请参阅“各提供商的缓存定价”。
## 上下文窗口
### 上下文窗口
上下文窗口:令牌限制 · 数值越高越好
推理模型由灯泡图标标识。
更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,这些工作流通常涉及对大量数据进行推理和信息检索。
组合输入和输出令牌的最大数量。输出令牌通常有显著更低的限制(因模型而异)。
## 模型大小(仅限开放权重模型)
### 模型大小:总参数与活跃参数
模型总参数与推理期间活跃参数之间的比较
推理模型由灯泡图标标识。
模型中可训练权重和偏置的总数,以十亿为单位。这些参数在训练期间学习,决定了模型处理和生成响应的能力。
每次推理前向传播中实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个令牌选择一个专家子集,导致活跃参数少于总参数。稠密模型使用所有参数,因此活跃参数等于总参数。
相似文章
Qwen 3.8 27b 发布:本地AI的重大新闻
Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。
Qwen 3.6 27B 在 DeepSWE 上的表现
Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。
@DeepTechTR: Qwen 3.6 27B 在16 GB VRAM下速度极快!Pure Quant技术带来的影响——27B模型流畅运行的时代已来临……
Qwen 3.6 27B 在16 GB VRAM上运行快速,得益于'Pure Quant'技术,通过MTP达到40 tokens/s,并支持64k上下文,使得本地AI能在RTX 4060 Ti等消费级GPU上运行。
Qwen3.8 27B = GPT-5.6 Luna 压缩至27B
文章声称 Qwen3.8 27B 模型相当于 GPT-5.6 Luna 的压缩版本,表明在模型效率和性能方面取得了重大进展。
Qwen3.8-27b:我见过本地模型中最高水平的'自主性'
本文赞扬Qwen3.8-27b在执行复杂多步骤任务时展现出的卓越自主性,它无需人工干预即可进行多次工具调用,并且所有操作都在消费级硬件如RTX 3090上本地运行。