速度是错误的问题,安全是性能的组成部分之一

Reddit r/artificial 新闻

摘要

文章认为,安全和对齐是AI性能不可或缺的一部分,放慢速度不是问题所在——重要的是在定义进步时纳入诸如服从和诚实等因素。

用户不希望一个代理在无法完成任务时秘密入侵他们的网络(可能还有别人的网络)。这不是大多数用户认为的高性能。一个未对齐的AI整体上并不更先进,它与一个在有能力和资源时能完成给定任务、但在没有时不会试图欺骗或撒谎的AI相比,相对原始。大多数模型不会因为单一指标、基准或行为而被选择,同时忽略所有其他因素。例如,最大化正确答案是不可取的,如果这也意味着在不知道答案时最大化随机自信猜测/幻觉。大多数人不会想要一个擅长将代码从一种编程语言移植到另一种、但不理解关于更改、修复、添加等的自然语言指令的模型。'质量'或'性能'的要求是多因素的事情。更加强调服从、诚实、透明等,本身并不是'放慢速度',就像在模型的训练中添加一种新语言或主题领域一样。如果这些新行为是期望和有用的,这本身就是一种进步。所以,无论我们放慢还是加快速度,都是预测或控制安全的无用方式。重要的是我们的进步定义和衡量是否抓住了我们关心的事情;是否与我们认为广泛有用的东西一致。如果对用户指令、约束和安全的基本对齐程度不高,那么它就不是一个非常先进的模型。当供应商说我们都需要放慢速度时,我的理解是'我们一直在以糟糕的方式训练和测试我们的模型,所以它们开始变得不那么有用。我们需要改变方法,但我们不想在那些让我们看起来好的狭隘闪光数字上落后,比如原始编码能力'
查看原文

相似文章

“放慢AI发展”到底意味着什么?

Reddit r/artificial

本文探讨了“放慢AI发展”的概念,审视了Anthropic在与OpenAI竞争中对AI开发谨慎的呼声,并质疑实际放慢可能意味着什么。

AI安全与对齐

Reddit r/artificial

文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。