对齐或许是人工智能领域最被滥用的词汇。
摘要
本文批判了人工智能中‘对齐’一词的滥用,质疑了哪些价值观和目标被优先考量,并突出了人工智能发展中国家战略的差异。
对齐。对齐。对齐。这可能是人工智能领域的年度词汇。人人都在谈论让人工智能与我们的价值观和目标对齐。但与谁对齐?朝向什么?在世界的一边,一个国家日益将人工智能视为国家基础设施,将其融入工业、科学、教育、医疗和公共服务。在另一边,另一个国家公开将人工智能描绘为争夺全球主导权、经济实力和军事优势的竞赛。两者都能构建完全‘对齐’的系统。但对齐的目标截然不同。我们谈论对齐,仿佛人类已经就目的地达成一致,剩下的唯一问题是让机器遵循道路。我们还没有。人工智能可以与一个国家、一支军队、一家公司、它的用户,或所谓的‘人类’对齐——但即便如此,谁来决定人类想要什么?所以,或许真正的问题并不只是人工智能是否对齐。我们将谁的目标注入了这台机器?
相似文章
AI对齐是我们将面临的最重要的问题。
本文认为AI对齐是人类面临的最关键问题,解决它可能带来乌托邦,否则将导致灾难,并批评当前的对齐方法不充分。
你不是对齐AI,而是与它对齐
本文批评了当前AI对齐领域的讨论,认为这场争论被研究人员和科技精英主导,他们排除了真正会受到AI系统影响的人群。文章对比了Eliezer Yudkowsky和Marc Andreessen的立场,指出他们共同持有一种假设:设计者才是唯一相关的参与者。
对齐(Alignment)
本文概述了Anthropic对齐团队的使命与研究重点,该团队通过评估、监督和压力测试等手段开发保障措施,以确保未来的AI系统始终保持有益、诚实和无害。
AI安全与对齐
文章讨论了对AI安全与对齐的担忧,随着AI变得更智能并融入社会,文章引用了Anthropic呼吁暂停以应对潜在的灾难性风险。
立场:对齐社区无意中正在构建审查工具包
本文认为,现代AI对齐技术尽管旨在防止有害输出,但属于双重用途技术,可能被滥用于审查和操纵,并敦促社区正视这一风险。