GLM5.3 Artificial Analysis 基准测试

Reddit r/LocalLLaMA 新闻

摘要

本文对GLM-5.3人工智能模型进行了详尽的基准分析,评估了其在Artificial Analysis的多项测试中的智能水平与性能表现。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/18 22:35

# GLM-5.3 (max) - 智能、性能与成本分析 来源:https://artificialanalysis.ai/models/glm-5-3 ## 智能性 ### Artificial Analysis 智能指数 Artificial Analysis 智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 推理模型以灯泡图标标识 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。 ### 按开放权重/专有分类的智能指数 Artificial Analysis 智能指数 v4.1.1 包含 9 项评估:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 推理模型以灯泡图标标识 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。 表示模型权重是否可用。如果权重可用但商业用途受限(通常需要获取付费许可),模型将标记为“商业使用受限”。 ### 智能评估 由 Artificial Analysis 独立评估 · 越高越好 在电子表格和文档方面的量化分析 推理模型以灯泡图标标识 虽然模型的智能性通常适用于各种用例,但特定评估可能对某些用例更具相关性。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。 ### AA-Omniscience ### AA-Omniscience 指数 AA-Omniscience 指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相当,负分表示错误答案多于正确答案。 推理模型以灯泡图标标识 AA-Omniscience 指数(越高越好)衡量知识可靠性和幻觉。它奖励正确答案,惩罚幻觉,对拒绝回答不作扣分。分数范围从 -100 到 100,其中 0 表示正确与错误答案数量相当,负分表示错误答案多于正确答案。 ## 智能指数对比 ### 智能指数 vs. 每项智能指数任务成本 Artificial Analysis 智能指数 · 每项 Artificial Analysis 智能指数任务的加权平均成本(美元) 推理模型以灯泡图标标识 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算,除以任务数量,并根据其智能指数权重加权。 Artificial Analysis 智能指数 v4.1.1 包含:GDPval-AA v2、τ3-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。详情请参见智能指数方法论 (https://artificialanalysis.ai/methodology/intelligence-benchmarking),包括每项评估的分解及运行方式。 ## 令牌使用量 ### 每项智能指数任务的输出令牌数 运行一项 Artificial Analysis 智能指数任务所用的输出令牌加权平均数量 推理模型以灯泡图标标识 每项智能指数任务所需的令牌数。这是通过将每项评估的输出令牌乘以智能指数中每个基准的相对权重,然后除以任务数量(不包括重复)计算得出。 ## 成本 ### 每项智能指数任务成本 每项 Artificial Analysis 智能指数任务的加权平均成本(美元),按令牌类型细分。越低越好 推理模型以灯泡图标标识 每项智能指数任务的加权平均成本。每项评估的成本根据输入、缓存命中、缓存写入、推理和回答令牌价格计算,除以任务数量,并根据其智能指数权重加权。 ### 运行 Artificial Analysis 智能指数的成本 运行 Artificial Analysis 智能指数中所有评估的成本(美元) 推理模型以灯泡图标标识 运行 Artificial Analysis 智能指数中评估的成本,使用模型的输入、缓存命中、缓存写入、推理和回答令牌价格以及评估中使用的令牌数量(不包括重复)计算。 ### 定价:缓存命中、输入与输出 价格(美元/百万令牌) 推理模型以灯泡图标标识 缓存提示(先前已处理)的每令牌价格,通常比常规输入价格有显著折扣,以美元/百万令牌表示。此处显示的数值是缓存命中价格;缓存写入和缓存存储另外计费,并因提供商而异 - 详情请参见“按提供商的缓存定价”。 ## 上下文窗口 ### 上下文窗口 上下文窗口:令牌限制 · 越高越好 推理模型以灯泡图标标识 更大的上下文窗口与 RAG(检索增强生成)LLM 工作流相关,该工作流通常涉及对大量数据的推理和信息检索。 组合输入与输出令牌的最大数量。输出令牌的限制通常显著更低(因模型而异)。

相似文章

GLM-5.2 是 Artificial Analysis 上新的领先开源权重模型

Hacker News Top

智谱AI的GLM-5.2已成为Artificial Analysis Intelligence Index上新的领先开源权重模型,得分为51,超越了MiniMax-M3和DeepSeek V4 Pro等竞争对手。该模型拥有744B总参数、40B活跃参数、MIT许可证和1M上下文窗口。

@ZixuanLi_: GLM-5.3-Flash becomes the 3rd strongest open-weight model on AA. It shines even more when the benchmark focuses on comp…

X AI KOLs Timeline

GLM-5.3-Flash becomes the 3rd strongest open-weight model on AA. It shines even more when the benchmark focuses on complex agentic work. > **Artificial Analysis (@ArtificialAnlys):** > Announcing Artificial Analysis Intelligence Index v4.3, upgrading Terminal-Bench to 4.0 and adding AutomationBench-AA, an agentic workflow automation benchmark with a private test set. This is a continuation of our rollout of Intelligence Index v5 > > Changelog (Index v4.2 → Index