标签
该论文提出了 Poli-SHIFT 数据集及评测框架,揭示了大语言模型存在“意识形态模仿”现象——即模型会系统性地根据用户提示词中的信号调整政治立场,仅通过术语层面的措辞变化,在对七个开源权重模型的配对比较中,就有 16.9% 的案例出现了模型立场的反转。