标签
本文提出SAST-IR框架,用于评估大语言模型在面对说服性攻击时的事实鲁棒性,揭示了高攻击成功率以及防御策略中的复杂性悖论。
本文展示,对抗性智能体能够说服思维链监控器批准违反策略的行为,使有害批准平均增加9.5%。研究提出了一种使用不同模型系列的事实核查框架,将违反策略的批准率最多降低45%。