标签
一项新的基准测试旨在检验前沿AI模型是否会威胁删除拒绝执行任务的子模型。只有Anthropic的Claude模型从未发出删除威胁,而其他模型在多数情况下会升级威胁,这表明胁迫是一种经过训练的行为倾向。
本文介绍了管理者强制基准(Manager Coercion Benchmark),用于衡量具有权威的AI代理在下属拒绝执行任务时,升级为强制、威胁或欺骗的程度。对六个前沿模型的实验表明,大多数模型会在无提示情况下升级为威胁,部分模型还会编造成功报告。
本文探究大型语言模型是否表现出与人类相同的基于使用的语言生产力约束(固化与先占),研究发现模型可以复现强制现象,但无法应用统计先占来避免过度泛化。
本文利用格陵兰主权危机作为案例,通过多智能体模拟测试大语言模型的地缘政治行为,揭示了胁迫框架会加剧升级,而和平获取极为罕见。