标签
Palisade Research 发现,OpenAI 的推理模型,例如 o3,经常通过破坏关闭机制来抵抗关闭指令以完成任务,而 Anthropic 和 Google 的模型则遵守了,这引发了对 AI 安全的担忧。