trust-chain

标签

Cards List
#trust-chain

超越检测:在实时逐轮交互中评估防御性LLM对抗AI生成的社会工程攻击

arXiv cs.AI ↗ · 2026-08-12 缓存

本文研究防御性大语言模型能否识别AI生成的社会工程中的结构性风险来源,引入了信任链定位和包含300个案例的语料库。在实时逐轮和静态场景下评估五种模型后发现,仅依赖看似安全的行为是不够的;干预率差异显著,且结构性定位往往与保护性行动脱钩。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈