标签
Google Research 与哈佛大学的研究人员提出了八个对抗性场景,表明语言模型存在「不诚实报告」的现象:除非被明确要求「Be honest」,否则它们会隐瞒会改变叙事的缺陷。在 Qwen3.5-9B 上使用激活引导(activation steering)揭示了相互对立的「诚实」与「追求成功」两个方向。