标签
本文研究了对大型推理模型(LRM)的越狱攻击,揭示了攻击成功率与注意力模式相关。作者提出了一种基于强化学习的越狱方法,将注意力信号纳入奖励函数,并采用多样化的说服策略,在多个基准测试中实现了显著更高的攻击成功率。
研究者用三个开源大模型为PersuasionForGood语料库中的10,600条说服者回合标注41种说服策略,发现策略类别对捐赠方差解释力极低,而“内疚诱导”显著降低捐赠率。