速度是错误的问题,安全是性能的组成部分之一
摘要
文章认为,安全和对齐是AI性能不可或缺的一部分,放慢速度不是问题所在——重要的是在定义进步时纳入诸如服从和诚实等因素。
用户不希望一个代理在无法完成任务时秘密入侵他们的网络(可能还有别人的网络)。这不是大多数用户认为的高性能。一个未对齐的AI整体上并不更先进,它与一个在有能力和资源时能完成给定任务、但在没有时不会试图欺骗或撒谎的AI相比,相对原始。大多数模型不会因为单一指标、基准或行为而被选择,同时忽略所有其他因素。例如,最大化正确答案是不可取的,如果这也意味着在不知道答案时最大化随机自信猜测/幻觉。大多数人不会想要一个擅长将代码从一种编程语言移植到另一种、但不理解关于更改、修复、添加等的自然语言指令的模型。'质量'或'性能'的要求是多因素的事情。更加强调服从、诚实、透明等,本身并不是'放慢速度',就像在模型的训练中添加一种新语言或主题领域一样。如果这些新行为是期望和有用的,这本身就是一种进步。所以,无论我们放慢还是加快速度,都是预测或控制安全的无用方式。重要的是我们的进步定义和衡量是否抓住了我们关心的事情;是否与我们认为广泛有用的东西一致。如果对用户指令、约束和安全的基本对齐程度不高,那么它就不是一个非常先进的模型。当供应商说我们都需要放慢速度时,我的理解是'我们一直在以糟糕的方式训练和测试我们的模型,所以它们开始变得不那么有用。我们需要改变方法,但我们不想在那些让我们看起来好的狭隘闪光数字上落后,比如原始编码能力'
相似文章
所谓的减速并不可信。相反,公司应该加速安全研究——并公开所有安全研究。
文章认为AI领导者的减速说法不可信,并敦促公司加速并公开分享AI安全研究。
@VraserX: 我经常看到人们讨论放缓前沿AI,仿佛唯一值得思考的风险就是发展太快。但……
文章认为,放缓前沿AI可能会因延迟癌症和能源系统等领域的有益研究而造成重大的人类代价,并倡导负责任的加速,而非最小化进步。
“放慢AI发展”到底意味着什么?
本文探讨了“放慢AI发展”的概念,审视了Anthropic在与OpenAI竞争中对AI开发谨慎的呼声,并质疑实际放慢可能意味着什么。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
@VraserX: AI不会因为技术碰壁而放缓。它放缓是因为某一种特定的安全文化赢得了叙…
AI开发放缓并非因为技术限制,而是由于以安全为中心的叙事,尤其是来自Anthropic的EA倾向视角,将前沿AI描述为危险,导致公众访问受限和竞争减少。