vulnerability-assessment

标签

Cards List
#vulnerability-assessment

我为能处理资金的AI代理构建了一个安全测试平台,寻求现实世界的反馈。

Reddit r/AI_Agents ↗ · 2026-09-28

作者构建了AgentPaySec,这是一个用于具有财务权限的AI代理的安全测试平台,并在模拟的支付代理上进行了测试,发现了漏洞,目前正在寻求社区对攻击场景的反馈。

0 人收藏 0 人点赞
#vulnerability-assessment

HarnessRisk:一个面向生命周期的代理工具安全性基准测试

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。

0 人收藏 0 人点赞
#vulnerability-assessment

@seclink: 看来还可以创建更多语言的 benchmark , 一夜之间,大家都在抓紧评测大语言模型的网络安全能力, 看这是真涌现还是瞎J8自嗨, 接下来得继续补充 next.js , rust , golang ,c/c++ ,python 的高质量…

X AI KOLs Timeline ↗ · 2026-08-15 缓存

本文讨论了为更多编程语言创建基准测试以评估大语言模型的网络安全能力,并宣布了JSEF v1.3.0的发布,该工具是一个Java安全教学框架和基准,用于衡量SAST工具和LLMs的漏洞检测能力。

0 人收藏 0 人点赞
#vulnerability-assessment

免费AI代理安全评估

Reddit r/AI_Agents ↗ · 2026-06-01

Antitech 为AI代理提供免费的早期安全评估服务,针对提示注入、工具滥用、数据泄露等攻击向量进行测试,并提供漏洞报告和参与折扣。

0 人收藏 0 人点赞
#vulnerability-assessment

RedBench:大型语言模型综合红队测试通用数据集

arXiv cs.CL ↗ · 2026-04-20 缓存

RedBench 引入了一个通用数据集,聚合了 37 个基准数据集,包含 29,362 个样本,涵盖 22 个风险类别和 19 个领域,用于实现大型语言模型的标准化和综合红队测试评估。该工作解决了现有红队测试数据集中的不一致问题,并提供了基准、评估代码和开源资源,用于评估 LLM 对对抗提示的鲁棒性。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈