@seclink: 看来还可以创建更多语言的 benchmark , 一夜之间,大家都在抓紧评测大语言模型的网络安全能力, 看这是真涌现还是瞎J8自嗨, 接下来得继续补充 next.js , rust , golang ,c/c++ ,python 的高质量…
摘要
本文讨论了为更多编程语言创建基准测试以评估大语言模型的网络安全能力,并宣布了JSEF v1.3.0的发布,该工具是一个Java安全教学框架和基准,用于衡量SAST工具和LLMs的漏洞检测能力。
查看缓存全文
缓存时间: 2026/08/15 21:52
看来还可以创建更多语言的 benchmark ,
一夜之间,大家都在抓紧评测大语言模型的网络安全能力,
看这是真涌现还是瞎J8自嗨,
接下来得继续补充 next.js , rust , golang ,c/c++ ,python 的高质量样本了.
Y11 (@seclink): 1/ JSEF v1.3.0 is out. JSEF = a Spring Boot 3.x Java security-teaching framework AND a benchmark for measuring how well SAST tools and LLMs hunt vulnerabilities. Today: we hardened the “hard tasks” part. 🧵
相似文章
@seclink:刚刚在 JSEF(Java 安全教育框架)中发布了一个漏洞搜寻基准。它旨在对 SAST 工具和…
JSEF 新增了一个漏洞搜寻基准,在相同提示下对 SAST 工具和 LLM 进行评分,包含 52 个跨难度级别的机器可读检查点,采用 Youden 指数评分。MIT 许可。
@seclink: 我们刚刚发布了 JSEF v1.4.0-benchmark,一个 Spring Boot 3.x Java 漏洞挖掘基准,现在新增了 85 个样本(503→588 个检查点……
JSEF v1.4.0-benchmark 已发布,在 Spring Boot 3.x Java 漏洞挖掘基准中新增了 85 个样本,以增强安全测试覆盖范围和验证。
@mylifcc: AI 安全红队神器来了! 刚刚发现一个超硬核的开源项目 —— DeepTeam! 由 Confident AI 出品,基于 DeepEval 打造的 LLM Red Teaming 框架,专门用来“黑”你自己的大模型: 50+ 种真实漏洞…
Confident AI 发布了名为 DeepTeam 的开源 LLM 红队测试框架,支持 50+ 种漏洞检测和 20+ 种对抗攻击,旨在帮助开发者安全地测试大语言模型。
@seclink: glm-5.3 终于开放邀请 众测 网络安全能力了, 看起来不是自嗨,大家快报名验收一下新能力吧!
GLM-5.3 开放网络安全能力众测,邀请组织和研究人员参与评估。
@seclink: 智谱 AI(https://Z.ai)今天发布了 GLM-5.3,和 GLM-5.2 共用同一个基座模型,所有提升都来自后训练阶段的强化学习(RL)。 【1】编程:开源阵营里最强,但离闭源前沿还有距离 GLM-5.3 在多个编程基准上拿到…
智谱AI发布了GLM-5.3,通过后训练强化学习在编程和网络安全能力上取得显著提升,成为开源模型中编程能力最强的模型,并意外发现大量真实漏洞。