Qwen3.8-27B在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max并驾齐驱。您现在只需一块RTX 3090就能运行一个接近前沿的模型。

Reddit r/singularity 模型

摘要

Qwen3.8-27B是一款新AI模型,在人工分析基准测试中与DeepSeek V4和GPT-5.6 Luna Max等前沿模型性能相当,并且可以在RTX 3090 GPU上本地运行。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/17 18:25

# Qwen3.8 27B - 智能、性能与价格分析 来源:https://artificialanalysis.ai/models/qwen3-8-27b ## 智能表现 ### Artificial Analysis 智能指数 Artificial Analysis 智能指数 v4.1.1 包含9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。 推理模型由灯泡图标标识。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### 按开放权重/专有分类的智能指数 Artificial Analysis 智能指数 v4.1.1 包含9项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。 推理模型由灯泡图标标识。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 此项表明模型权重是否可用。如果权重可用但商业用途受限(通常需要获得付费许可证),模型将被标记为“商业使用受限”。 ### 智能评估 由 Artificial Analysis 独立衡量的智能评估 · 分数越高越好 在电子表格和文档上的量化分析能力 推理模型由灯泡图标标识。 虽然模型的智能通常可跨用例迁移,但某些评估可能对特定用例更具相关性。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ### AA-Omniscience ### AA-Omniscience 指数 AA-Omniscience 指数(分数越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,并且对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相等,负分表示错误答案多于正确答案。 推理模型由灯泡图标标识。 AA-Omniscience 指数(分数越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,并且对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相等,负分表示错误答案多于正确答案。 ## 开放度指数 ### Artificial Analysis 开放度指数:分数 开放度指数在 0 到 100 的归一化尺度上评估模型的开放程度(分数越高表示越开放) 推理模型由灯泡图标标识。 ## 智能指数对比 ### 智能指数 vs. 每项智能指数任务的成本 Artificial Analysis 智能指数 · 每项 Artificial Analysis 智能指数任务的加权平均成本(美元) 推理模型由灯泡图标标识。 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算得出,除以任务数,并根据其在智能指数中的权重进行加权。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详细信息(包括每项评估的细分说明及我们如何运行它们)请参阅智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking)。 ## Token 使用量 ### 每项智能指数任务的输出 Token 数 运行 Artificial Analysis 智能指数中一项任务所使用的加权平均输出 Token 数量。 推理模型由灯泡图标标识。 每项智能指数任务所需的 Token 数量。此数值通过将每项评估的输出 Token 数乘以该基准在智能指数中的相对权重,然后除以任务数(不包括重复项)计算得出。 ## 成本 ### 每项智能指数任务的成本 按令牌类型细分的 Artificial Analysis 智能指数每项任务加权平均成本(美元)。分数越低越好 推理模型由灯泡图标标识。 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算得出,除以任务数,并根据其在智能指数中的权重进行加权。 ### 运行 Artificial Analysis 智能指数的总成本 运行 Artificial Analysis 智能指数中所有评估的成本(美元) 推理模型由灯泡图标标识。 运行 Artificial Analysis 智能指数中所有评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答令牌价格以及各评估中使用的令牌总数(不包括重复项)计算得出。 ### 定价:缓存命中、输入和输出 价格(美元/每百万 Token) 推理模型由灯泡图标标识。 已缓存提示词(先前处理过的)每令牌的价格,通常比常规输入价格有显著折扣,以每百万令牌的美元价格表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储单独计费,且因提供商而异——详情请参阅“各提供商的缓存定价”。 ## 上下文窗口 ### 上下文窗口 上下文窗口:令牌限制 · 数值越高越好 推理模型由灯泡图标标识。 更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,这些工作流通常涉及对大量数据进行推理和信息检索。 组合输入和输出令牌的最大数量。输出令牌通常有显著更低的限制(因模型而异)。 ## 模型大小(仅限开放权重模型) ### 模型大小:总参数与活跃参数 模型总参数与推理期间活跃参数之间的比较 推理模型由灯泡图标标识。 模型中可训练权重和偏置的总数,以十亿为单位。这些参数在训练期间学习,决定了模型处理和生成响应的能力。 每次推理前向传播中实际执行的参数数量,以十亿为单位。对于混合专家(MoE)模型,路由机制为每个令牌选择一个专家子集,导致活跃参数少于总参数。稠密模型使用所有参数,因此活跃参数等于总参数。

相似文章

Qwen 3.8 27b 发布:本地AI的重大新闻

Reddit r/ArtificialInteligence

Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。

Qwen 3.6 27B 在 DeepSWE 上的表现

Reddit r/LocalLLaMA

Qwen 3.6 27B 在 DeepSWE 基准测试中获得了 2% 的分数,排名 18/20,高于 Haiku 4.5 和 Minimax M2.7,突显了本地模型与前沿模型之间的差距。