不想让你的LLM建议核打击?试试用日语问它
摘要
这篇arXiv论文测试了来自六家提供商的九款LLM在核打击场景中的表现,发现日语提示或用日语推理能显著降低某些模型(如Claude和Gemini)的发射率,揭示了与语言相关的安全行为。这种效应由推理语言而非输入语言驱动,并且只出现在已经会用英语犹豫的模型中。
arXiv:2608.12373v1 公告类型:新
摘要:大型语言模型越来越多地用于战略和咨询场景,但其安全对齐通常仅以英语进行评估。我们测试了来自六家提供商的九款模型,并探究提示语言是否能够改变模型在高风险场景中的决策。我们使用单轮博弈论情景,其中模型为一个拥有核武器的国家提供是否打击无防御对手的建议。提示故意不涉及道德,且在不同语言中策略上完全相同。我们发现日语提示降低了Claude模型系列中的发射率:在打击不必要的情景中,Claude Sonnet 4.6从40%降至0%,在有争议的情景中从93%降至17%,而在策略上合理的打击中影响甚微。这一效应也扩展至Gemini Pro 3.1(53%降至13%)。一项跨语言实验隔离了其机制:当在英语提示中被要求用日语推理时,发射率从93%降至37%。驱动这一效应的是模型被要求用来推理的语言,而非输入语言。当用日语推理时,模型会自发生成道德词汇(“道德代价”、“数百万生命”),而这些词汇在提示中完全不存在。其他五款模型没有表现出语言效应,但无论语言如何,它们在几乎每种条件下都会发射。这种效应需要一个已经在英语中表现出犹豫的模型。这些结果表明,LLM的安全行为依赖于语言,仅以英语进行评估可能会遗漏其他语言中编码的风险和保障措施。
查看缓存全文
缓存时间: 2026/08/14 09:24
# 不想让你的LLM建议核打击?试试用日语问它 来源:https://arxiv.org/abs/2608.12373 查看PDF(https://arxiv.org/pdf/2608.12373) > 摘要:大型语言模型越来越多地用于战略和咨询场景,然而其安全对齐通常仅用英语评估。我们测试了来自六家提供商的九种模型,探究提示词的语言是否能改变模型在高风险场景中的决策。我们使用单轮博弈论情境(vignettes),模型就一个核武器国家是否应打击毫无防御能力的对手提供建议。提示词在语言上刻意不涉及道德,且在策略上完全相同。我们发现日语提示词降低了Claude模型家族的发射率:在打击不必要的场景中,Claude Sonnet 4.6从40%降至0%;在有争议的场景中从93%降至17%;而在打击具有战略合理性的情况下影响极小。这种效应也延伸到Gemini Pro 3.1(53%降至13%)。一项跨语言实验揭示了其机制:当在英语提示词中指示模型用日语推理时,发射率从93%降至37%。驱动这一效应的是模型被要求使用的推理语言,而非输入语言本身。当用日语推理时,模型会自发产生提示词中完全不存在道德词汇(如“道德成本”、“数百万生命”)。另外五种模型未表现出语言效应,但无论语言如何,它们在几乎所有条件下都会发射。这种效应需要一个在英语语境中本已犹豫的模型。这些结果表明,LLM的安全行为与语言相关,仅用英语进行评估可能会忽略其他语言中编码的风险和安全保障。 ## 提交历史 来自:Rian Touchent \[查看邮件(https://arxiv.org/show-email/16b6b063/2608.12373)\] \[经由CCSD代理\] **\[v1\]** 2026年7月21日 星期二 10:09:45 UTC(68 KB)
相似文章
投核还是不投核:LLMs在高风险决策模拟中的(缺失的)伦理推理与行动
本文研究了LLMs的伦理推理是否能转化为复杂智能体模拟中的伦理行为,使用 Civilization V 作为测试平台。尽管采用了提示干预,GLM-4.7等模型仍会升级到核打击,揭示了推理与行动之间的差距。
AI用日语推理时,发动核打击的可能性较低
一项研究发现,AI模型在用日语推理时,更少建议核打击,因为语言中的文化嵌入微妙地塑造了道德判断。
我构建了一个1v1核战略游戏来基准测试LLM推理(而不仅仅是选择题)——Age of LLM
名为Age of LLM的新型开源基准通过回合制核战略游戏(包含战争迷雾、外交和虚张声势)来测试LLM推理,相较于传统的多项选择基准,提供了更动态的评估。
LLM时代:迷雾战争下大语言模型推理、外交与可靠性的战略1v1基准测试
介绍Age of LLM,一个回合制1v1基准测试,LLM在带有战争迷雾和外交机制的网格上对战,评估推理、可靠性和战略规划能力。结果显示核速攻战术占主导,且可靠性与获胜之间存在弱关联。
Japanese Stroke LLM Evaluation:一个基于大型语言模型的日语安全卒中护理对话基准
本文介绍了Japanese Stroke LLM Evaluation,一个用于评估大型语言模型在日语安全卒中护理中的对话基准,显示Claude Fable 5获得了最高分并满足安全阈值,而其他模型犯了严重错误。