一个好的AI代理技能安全扫描器基准测试应该包含什么?

Reddit r/AI_Agents 新闻

摘要

讨论了为评估AI代理技能的安全扫描器设计基准测试的挑战,这些技能引入了新的供应链风险。它还质疑基准测试是否应包括真实世界的恶意样本、合成案例、完整技能目录或边界案例。

AI代理越来越依赖外部技能来读取文件、调用API、运行脚本、安装依赖项或与本地工具交互。这使得技能成为新的供应链攻击面。但评估这个生态系统的扫描器似乎很棘手。恶意技能可能隐藏在指令、帮助脚本、依赖文件、生成的工件、编码的有效载荷或误导性文档中。有些案例也很模糊:存在漏洞、可疑但不明显恶意。一个好的基准测试应该包含什么?- 真实世界的恶意样本、合成案例,还是两者兼有?- 完整的技能目录而不是孤立的代码片段?- 良性、可疑和恶意之间的边界案例?- 仅评分最终结论,还是也包括风险类别/严重性?- 哪些攻击模式对代理技能最重要?好奇其他人会如何设计这个。
查看原文

相似文章

好的基准

arXiv cs.AI

这篇2026年7月的论文基于Terminal Bench项目的经验,定义了为AI智能体设计有效基准任务的原则。好的任务应当正确、可解、可验证、明确规范,并且因有趣的原因而具有难度,强调现实世界相关性和基于结果的验证。