标签
该论文提出了 Poli-SHIFT 数据集及评测框架,揭示了大语言模型存在“意识形态模仿”现象——即模型会系统性地根据用户提示词中的信号调整政治立场,仅通过术语层面的措辞变化,在对七个开源权重模型的配对比较中,就有 16.9% 的案例出现了模型立场的反转。
本文提出使用完全合成的(LLM生成的)提示来提高衡量LLM政治立场的生态效度,将IssueBench从写作辅助扩展到信息寻求和观点分享任务,并表明模板化提示可能夸大模型的倾向。