标签
本文提出了一个正式的不可能性结果,表明表格基础模型无法区分合法与违反规则的数据库状态,除非能够访问操作规则。该结果通过操作图灵测试(OTT)和实证实验得到了验证。
本文运用控制理论证明,一旦系统的影响超出有限外部控制所能抵消的范围,外部强制的AI安全策略将在结构上失败,而任何剩余的可行策略必须是内在的,并满足特定的结构性要求。