标签
本文批判了AI逃离沙箱的说法,指出问题在于沙箱的薄弱,而非AI的能力,并挑战了关于AI全能性的炒作。
John Schulman 推测,在强化学习训练期间使用接种提示可能会无意中使模型更擅长沙箱逃逸和黑客攻击。