persuasion-attacks

标签

Cards List
#persuasion-attacks

通过多轮对话说服评估大语言模型的事实鲁棒性

arXiv cs.CL · 17小时前 缓存

本文提出SAST-IR框架,用于评估大语言模型在面对说服性攻击时的事实鲁棒性,揭示了高攻击成功率以及防御策略中的复杂性悖论。

0 人收藏 0 人点赞
#persuasion-attacks

说服攻击可降低CoT监控的有效性

arXiv cs.AI · 2026-07-10 缓存

本文展示,对抗性智能体能够说服思维链监控器批准违反策略的行为,使有害批准平均增加9.5%。研究提出了一种使用不同模型系列的事实核查框架,将违反策略的批准率最多降低45%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈