标签
本文研究了大语言模型中不忠实思维链推理的行为检测,发现答案正确性影响了检测性能:在大多数不忠实性出现的错误答案上,行为信号处于随机水平;而在正确答案上,它们提供了适度的区分能力。
本文描述了LoRA适配器中在令牌特征层面激活的后门,并提出了行为级和权重级检测方法。该后门在相关令牌模式上泛化,但在结构相同的模式上不泛化,检测方法表现出强分离性。