标签
这篇arXiv论文测试了来自六家提供商的九款LLM在核打击场景中的表现,发现日语提示或用日语推理能显著降低某些模型(如Claude和Gemini)的发射率,揭示了与语言相关的安全行为。这种效应由推理语言而非输入语言驱动,并且只出现在已经会用英语犹豫的模型中。