capability-confound

标签

Cards List
#capability-confound

安全,还是仅仅是能力?对智能体安全基准的效度审计

arXiv cs.AI ↗ · 2026-08-03 缓存

本文对四个智能体安全基准(R-Judge、InjecAgent、AgentHarm、AgentDojo)在多个模型上进行了审计,表明它们的分数受能力混淆影响,指标存在伪影,且不同基准之间的排名相互矛盾,从而削弱了可互换的安全性声明。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈