首页
/
新闻
/
GLM5.3 Artificial Analysis 基准测试
GLM5.3 Artificial Analysis 基准测试
摘要
本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。
暂无内容
查看缓存全文
缓存时间:
2026/08/18 22:35
# GLM-5.3 (max) - 智能、性能与成本分析
来源:https://artificialanalysis.ai/models/glm-5-3
## 智能性
### Artificial Analysis 智能指数
Artificial Analysis 智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR
推理模型以灯泡图标标识
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。
### 按开放权重/专有分类的智能指数
Artificial Analysis 智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR
推理模型以灯泡图标标识
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。
表示模型权重是否可用。如果权重可用但商业用途受限(通常需要获取付费许可),模型将标记为“商业使用受限”。
### 智能评估
由 Artificial Analysis 独立评估 · 越高越好
在电子表格和文档方面的量化分析
推理模型以灯泡图标标识
虽然模型的智能性通常适用于各种用例,但特定评估可能对某些用例更具相关性。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。
### AA-Omniscience
### AA-Omniscience 指数
AA-Omniscience 指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相当,负分表示错误答案多于正确答案。
推理模型以灯泡图标标识
AA-Omniscience 指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相当,负分表示错误答案多于正确答案。
## 智能指数对比
### 智能指数 vs. 每项智能指数任务成本
Artificial Analysis 智能指数 · 每项 Artificial Analysis 智能指数任务的加权平均成本(美元)
推理模型以灯泡图标标识
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算,除以任务数量,并根据其智能指数权重加权。
Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。
## 令牌使用量
### 每项智能指数任务的输出令牌数
运行一项 Artificial Analysis 智能指数任务所用的输出令牌加权平均数量
推理模型以灯泡图标标识
每项智能指数任务所需的令牌数。这是通过将每项评估的输出令牌乘以智能指数中每个基准的相对权重,然后除以任务数量(不包括重复)计算得出。
## 成本
### 每项智能指数任务成本
每项 Artificial Analysis 智能指数任务的加权平均成本(美元),按令牌类型细分。越低越好
推理模型以灯泡图标标识
每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算,除以任务数量,并根据其智能指数权重加权。
### 运行 Artificial Analysis 智能指数的成本
运行 Artificial Analysis 智能指数中所有评估的成本(美元)
推理模型以灯泡图标标识
运行 Artificial Analysis 智能指数中评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答令牌价格以及评估中使用的令牌数量(不包括重复)计算。
### 定价:缓存命中、输入与输出
价格(美元/百万令牌)
推理模型以灯泡图标标识
缓存提示(先前已处理)的每令牌价格,通常比常规输入价格有显著折扣,以美元/百万令牌表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储另外计费,并因提供商而异 - 详情请参见“按提供商的缓存定价”。
## 上下文窗口
### 上下文窗口
上下文窗口:令牌限制 · 越高越好
推理模型以灯泡图标标识
更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,该工作流通常涉及对大量数据的推理和信息检索。
组合输入与输出令牌的最大数量。输出令牌的限制通常显著更低(因模型而异)。
相似文章
Reddit r/ArtificialInteligence
文章比较了GLM-5.3与GPT-5.5等AI模型在基准测试中的性能指标,强调了成本效益并质疑基准测试的效度,同时探讨高效的方法论评估方式。
Hacker News Top
智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。
Reddit r/LocalLLaMA
根据 Artificial Analysis 的 Intelligence Index,GLM-5.2 (max) 目前整体上排名第三,包含对智能性、开放性、成本和令牌使用量的详细分析。
Reddit r/singularity
文章讨论了 GLM-5.3-Flash 模型的基准测试对比,重点介绍了其前沿智能和成本效率,该内容来自发布博客文章。
X AI KOLs Timeline
GLM-5.3-Flash becomes the 3rd strongest open-weight model on AA. It shines even more when the benchmark focuses on complex agentic work. > **Artificial Analysis (@ArtificialAnlys):** > Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic workflow automation benchmark with a private test set. This is a continuation of our rollout of Intelligence Index v5 > > Changelog (Index v4.2 → Index