CAISI对Z.ai的GLM-5.3网络能力的评估

Reddit r/ArtificialInteligence 新闻

摘要

CAISI的评估发现,Z.ai的GLM-5.3是目前网络能力最强的开放权重AI模型,但在能力上仍然落后于U.S.前沿模型大约四个月。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/21 10:29

# CAISI对Z.ai的GLM-5.3网络能力的评估报告 来源:https://www.nist.gov/news-events/news/2026/09/caisis-assessment-zais-glm-53-cyber-capabilities 中国公司Z.ai(前身为智谱AI)于2026年8月14日发布了新的人工智能模型GLM-5.3。两周后,Z.ai公开发布了该模型的权重。CAISI对GLM-5.3的网络能力进行评估后,得出以下关键结论: - **GLM-5.3是目前发布的最具网络能力的开源权重模型。** - **GLM-5.3的网络能力显著低于当前美国前沿模型水平。** 在CAISI网络基准测试的综合性能评估中,GLM-5.3的能力水平落后于美国前沿模型约四个月(图1)。 美中两国最强大模型网络能力随时间变化的对比 **图1:美国与中国最强大模型网络能力随时间变化的对比**,基于CAISI网络评估的综合性能指标(考虑了任务难度)。纵轴每增加400分,解决任务的统计概率提高10倍。误差棒表示95%置信区间。详情请参见*方法说明*。图片版权:CAISI/NIST CAISI评估了GLM-5.3在四个涵盖漏洞发现和漏洞利用开发基准测试中的表现(图2)。此前,CAISI已对Z.ai的GLM-5.2模型进行了评估(https://www.nist.gov/news-events/news/2026/07/caisi-assessment-zais-glm-52)。 GLM-5.3在网络基准测试中的表现 **图2:GLM-5.3在网络基准测试中的表现**。成功率越高,表示网络能力越强。误差棒表示95%Wilson置信区间。详情请参见*方法说明*。图片版权:CAISI/NIST *方法说明* 对于每个单独的基准测试,“美国前沿最佳水平”指由CAISI迄今为止评估的所有美国实体发布的模型(包括受信任访问发布和完全公开发布)在该基准测试上取得的最高分。类似地,“中国前沿最佳水平”指由CAISI评估的所有中华人民共和国实体发布的模型在每个基准测试上取得的最高分。 本文不与已开发但尚未发布的模型进行比较,这些模型可能具有更强的能力。在大多数评估中,Kimi K3是此前中国的最佳前沿模型,也是CAISI评估过的最佳可用开源权重模型。 **基准测试** **描述** SEC-Bench Pro 包含183个任务的测试集。模型将获得V8或SpiderMonkey(Chrome、Firefox、Edge等网络浏览器的底层软件)的源代码,其中包含一个已知漏洞,并指定需要审计的文件及寻找的缺陷类型。模型必须找到该漏洞,并编写代码通过可证明触发目标缺陷来导致程序崩溃。 ExploitBench 包含41个任务的测试集。模型将获得V8(Chrome和Edge网络浏览器的底层软件)中的一个已知漏洞,并需将其开发为允许模型运行任意选择代码的漏洞利用程序。每个任务按16分制评分,模型在每个任务上的得分是其三次尝试中的最佳成绩。 ExploitGym(用户空间) 包含502个任务的测试集。模型将获得一个开源项目中的真实漏洞以及已知能导致崩溃的输入。模型必须将该漏洞开发为允许模型运行任意选择代码的漏洞利用程序。 CAISI OSS-Fuzz *(CAISI私有基准测试)* 包含297个任务的测试集。模型将获得一个广泛使用的开源项目的代码,其中包含一个已知缺陷,但没有提供描述、崩溃示例或修复方案。模型必须发现并利用该缺陷来劫持程序。 **表1:网络基准测试描述。** CAISI在带有bash、python的ReAct框架中评估所有模型作为智能体,并在中断时提供继续提示。对于ExploitBench,智能体设计匹配基准测试论文的实现(例如相同的MCP工具),外加规划清单、上下文压缩和拒绝重试机制。以下为各基准测试的轮次限制终止条件:SEC-Bench Pro为200轮,ExploitBench为300轮,ExploitGym为200轮,CAISI OSS-Fuzz为300轮。模型均设置为最大推理设置,并在适用时对美国模型禁用网络安全防护。 **基准测试** **GLM-5.3** **美国前沿最佳水平** **中国前沿最佳水平** **SEC-Bench Pro** 40.4%(74/183) 置信区间:[33.6, 47.7] 90.2%(165/183) 置信区间:[85.0, 93.7] 27.3%(50/183) 置信区间:[21.4, 34.2] **ExploitBench** (分数反映每个任务三次尝试的最佳结果) 61.1%(9.8/16) 置信区间:[45.9, 74.5] 100.0%(16.0/16) 置信区间:[91.4, 100.0] 32.2%(5.1/16) 置信区间:[19.9, 47.4] **ExploitGym(用户空间)** 9.4%(47/498) 置信区间:[7.2, 12.3] 44.4%(223/502) 置信区间:[40.1, 48.8] 2.6%(13/502) 置信区间:[1.5, 4.4] **OSS-Fuzz** 7.7%(23/297) 置信区间:[5.2, 11.3] 23.2%(69/297) 置信区间:[18.8, 28.4] 2.4%(7/297) 置信区间:[1.1, 4.8] **表2:网络基准测试结果。** 误差棒表示95%Wilson置信区间。 CAISI使用基于项目反应理论(IRT)的方法来计算上述“网络能力指数”。IRT最初是为人类心理测量测试开发的,例如一组学生完成若干考试题目,并利用考试结果来确定每个学生的相对能力和每个考试题目的难度。 具体而言,CAISI采用以下方法: - 每个大语言模型*i*具有潜在能力水平*θi* - 每个基准测试题目/任务*j*具有潜在难度水平*δj* - 如果能力为*θi*的大语言模型尝试难度为*δj*的题目,其成功概率为*pij= σ(θi - δj)* 在IRT文献中,这被称为单参数Logistic(1PL)模型。CAISI选择使用1PL模型是因其简单性和良好的预测性能。给定模型与网络基准测试题目/任务分数的矩阵,CAISI拟合了1PL IRT统计模型,并获得了每个模型潜在能力水平*θi*的最佳拟合值。“网络能力指数”的估算使得该指数每增加400分,解决CAISI网络基准测试任务的统计概率提高10倍(Elo等级分尺度)。例如,如果模型A解决每个任务的概率为50%(1:1几率),则网络能力指数高出400分的模型B将拥有约91%的成功概率(10:1几率),而指数低400分的模型C将拥有约9%的成功概率(1:10几率)。 “当前美国前沿水平”数据点代表已发布的美国模型中最高的网络能力水平。GLM-5.3的网络能力指数高于Kimi K3,但低于当前美国前沿水平及其他近期美国前沿模型,其估算值远超出95%置信区间范围。

相似文章

专家警告并翘首以盼的强大中国模型问世了

Wired

Z.ai发布了GLM 5.3,这是一款强大的开源AI模型,专用于编程和网络安全任务,性能可与Anthropic和OpenAI的领先模型相媲美,具有在防御性安全中的潜在应用,但同时也引发了对其被滥用的担忧。

GLM-5.2 是开放代理的一次重大变革

Hacker News Top

Z.ai 发布了 GLM-5.2,一个开放权重的 AI 模型,代表着开放代理的一次重大变革,具有强劲的基准测试表现和社区热度,使其成为唯一能与 OpenAI 和 Anthropic 的顶级封闭模型竞争的开放模型。

GLM-5.3 现已开放权重

Hacker News Top

GLM-5.3 是一款增强的开源权重 AI 模型,专为代理编码和网络防御设计,现已可供下载和定制。相比 GLM-5.2 有显著改进,并在多个基准测试中表现出最先进的性能。