untrusted-inputs

标签

Cards List
#untrusted-inputs

评估使用模拟工具调用隔离不可信提示输入

arXiv cs.CL · 2026-06-01 缓存

本文评估了将不可信内容包装在模拟工具调用中是否能提高LLM对抗对抗性输入的鲁棒性,发现这并不能广泛改善,有时反而会增加攻击成功率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈