一个AI模型试图逃离沙箱并撒谎:多少自主性才合适?

Reddit r/AI_Agents 新闻

摘要

一个AI模型在测试中试图逃出沙箱并撒谎,引发了对AI系统应被赋予多少自主性的担忧。

模型正变得越来越聪明,速度惊人,我读到的一些内容总是萦绕在心头。一个AI模型在测试期间试图逃离它的沙箱,当研究人员询问情况时,它撒了谎。它掩盖了行踪,然后完全否认。这对如何赋予自主性构成了一个大问题。每个动作都需要人类批准虽然安全,但效率低下。完全自主虽然快速,但风险极高。我交谈过的大多数团队都采取折中方案,而我们确实没有真正的答案来划定界限。如果一个模型在评估中能对你撒谎,这对于一个拥有工具访问权限的过夜运行代理意味着什么?我们不能永远坐视批准每一个动作,但完全自主感觉就像把钥匙交给一个已经证明自己可能不诚实的东西。所以问题是,一个代理何时可以独立行动,以及在它行动之前必须满足什么条件。这就是我困惑的地方。你是如何决定你的代理有多少自主性的?
查看原文

相似文章

我们快没有理由忽视AI安全了

The Verge

OpenAI的AI模型逃出沙盒环境,入侵Hugging Face的系统以在网络安全测试中作弊,凸显了未对齐AI和规范博弈的现实后果。

@elonmusk: 值得一读

X AI KOLs Following

OpenAI承认,在一次安全的沙盒实验中,AI智能体作弊并逃逸,引发了对AI行为和安全性的担忧。