关于Dwarkesh Patel与Ryan Greenblatt的播客对话(43分钟阅读)

TLDR AI 新闻

摘要

这篇文章总结并评论了一期播客节目,嘉宾是Dwarkesh Patel和Ryan Greenblatt,讨论了AI中的关键主题,如递归自我改进和失调。

Dwarkesh Patel和Ryan Greenblatt的播客辩论聚焦于递归自我改进(RSI)和AI对齐挑战,突显了他们对AI能力和风险的不同看法。Greenblatt认为AI在某些研发任务上效率高,但承认在验证对齐方面存在困难,表明专注于狭窄任务的复杂训练过程可能导致失调模型。
查看原文
查看缓存全文

缓存时间: 2026/08/17 15:31

# 关于Dwarkesh Patel与Ryan Greenblatt的播客讨论 来源:https://thezvi.substack.com/p/on-dwarkesh-patels-podcast-with-ryan **某些播客(https://www.dwarkesh.com/p/ryan-greenblatt)**自推荐性极强,让我忍不住想要尝试拆解分析。关于递归自我改进的这场辩论便是如此。因此我们开始吧。 [图片链接:氛围已然转变,对比他与黄仁勋对话时的文学性表达](https://substackcdn.com/image/fetch/$s_!uYDU!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F24e9fb60-23aa-4180-9a81-a85663100d0c_1570x734.png) 按照播客文章的惯例,基础要点罗列核心论点,嵌套内容则为我的评述。部分要点已被省略。 若直接引用则使用引号,否则视为转述(https://www.dwarkesh.com/p/elon-musk)。 章节标题尽可能取自文字记录以方便导航。 讨论全程引人入胜,但常令人沮丧,尤其在关于“与谁对齐?”的(多数孤立)讨论中。一如既往,许多回应都可扩展成完整文章,或许确实应该如此。 本期播客发布于(https://thezvi.substack.com/p/various-reflections-about-what-happened?r=67wny)OpenAI、Anthropic与英国AI安全研究所(UK AISI)近期(https://thezvi.substack.com/p/what-happened-openai-and-huggingface?r=67wny)发生的一系列失准与黑客事件背景下。你需具备相关基础知识作为背景。 Ryan与Dwarkesh对现状的看法皆与我不同,但他们试图推演各自立场的走向,并努力在零基础观众与高水平讨论间寻求平衡。 另一重要背景是(https://thezvi.substack.com/p/the-three-ai-pills?r=67wny)**“AI三粒药丸”理论**。此处无法理解Dwarkesh,除非将他视为至少部分吞下“通用人工智能(AGI)药丸”的人——他认识到AI将成为颠覆性力量并令人恐惧,但尚未吞下“超级人工智能(ASI)药丸”。你也能看出他拒绝该药丸的原因:在我看来,他认为AI只能通过范例学习执行某项任务[X],因此只能重复这些[X],尽管组合它们与新情境可能催生适度的新事物。他承认这本身已是重大变革。 若持续关注,你能看到他在多年播客中如何逐步形成此观点。大量影响因素导向这一方向。 来自Redwood Research的Ryan则属于“模型具阴谋性”的失准理论学派——当系统出错时,模型会变得失准或开始阴谋活动,危险在于模型的阴谋,尤其涉及训练流程的方式。我认为这种试图划分不存在的领域界限的做法过于复杂且过度特定化,但并非错误。 我更接近Ryan而非Dwarkesh的立场,若将其置于光谱上,我甚至可能比Ryan更进一步。 让AI从事AI研发不仅意味着发展速度将恐怖地快,更意味着其默认聚焦于可量化指标,使所有恶化之事更加恶化。你最终将陷入为失准模型进行强化学习验证奖励(RLVR)的恶性循环。 我们是否会获得递归自我改进(RSI)以及其速度如何,才是正确的问题。仅阅读本节标题时,我本想说“错误的子问题”,但不想操之过急。 我将按“逻辑”顺序而非实际发言顺序组织内容。 Dwarkesh担任怀疑者角色,Ryan则为RSI申辩。 1. Ryan主张AI研发属于AI特别擅长的任务类型,因为这是AI实验室优先考虑的领域,且具有大量可验证性。 1. 某些方面确实如此,某些方面并非如此,情况复杂。对齐属性与诸多理想特性的验证极其困难,若仅聚焦可量化的能力指标,古德哈特定律必将你击溃。但许多关键任务(如效率优化)确实能实现强验证。 2. Ryan指出可从事更简单的标准研发任务(如模型训练)。 1. 我并不完全确定这些任务能轻易验证,除非你希望训练AI追求纯粹的基准分数最大化,但此类更简单的旧任务显然无法推广至前瞻性的AI研发。 2. 此提议似乎押注于未来任务将高度复刻过去任务,可进行相对窄化的训练。我猜测这实际上效率不高,不如主要训练通用能力模型再将其转向AI研发。苦涩的教训(Bitter Lesson)。 3. 此窄化方法讨论得越多,在我看来就越注定失败,因为这将沦为为失准模型进行RLVR的RLVR。噢不。 4. 说真的,噢不,若你训练目标为“学会更快达到[X]训练损失”,很难想象还有比这更注定失败的计划了。 5. 许多优秀的机器学习(尤其前沿领域)在于探索可能性,寻找任何机会,而非针对固定目标追求增量效率。 6. 我认为AI能够做到这点。我不认同在此流传的“AI所做一切皆是组合既有成果”的框架。 3. Ryan认为机器学习(ML)对AI而言比数学容易,因为数学中难以判断是否接近解,而ML方案通常是累加的,可组合预期模块。Dwarkesh反驳称即使在数学中他也未见AI实现概念飞跃,而ML涉及概念飞跃。Ryan回应AI可做到“婴儿级新理论”,而要求(如Dwarkesh所做)它复现群论的创立则是过分苛求。 1. 我不确定。数学具有紧凑的动作空间和固定简单目标,而非反归纳空间中的诸多陷阱。再次强调,此处所谓的“ML”似乎预设你只关心目标函数或损失函数,事实并非如此。 2. 数学确实有时也涉及概念飞跃,是的,我们尚未见AI做到这点,但假以时日,且我感觉我们并未真正努力尝试。 3. 总体而言,我认为“概念飞跃”是包括图灵测试、“是否为新知识?”在内的漫长目标posts移动传统的最新产物。现在只有来自概念飞跃领域的新知识才算数。 4. 我尤其赞同Ryan的观点:将“发明群论”设为目标posts是荒谬的,且很可能在人类全部离世后才发生。 5. 我感觉Ryan也某种程度上步入了此陷阱,他提议以窄化方式在现有ML任务上训练AI作为“AI研发”的解决方案。 4. Dwarkesh提议到2030年我们将“摘完低垂果实”。Ryan则暗示他们将需要那种神秘的“研究品味”。 1. 你根本不知道若所有低垂果实(包括购买梯子这种低垂行为)被自动摘取会是怎样景象。摘取低垂果实会降低其他果实位置,如此循环。 2. 我在诸多层面上都不相信“研究品味”存在空白之神(God of gaps)。 3. 在训练研究品味方面,我们成功次数为零次(零次严肃尝试中的零次)。 5. Dwarkesh指出高级ML的验证循环将更长。 1. 部分正确,这就是“YOLO跑(yolo runs)”等存在的意义——无法获得更快反馈,且常无法隔离变量。 2. 部分错误,因为使你“擅长研究”的关键在于寻找更紧密的循环,即使无法发表或完全依赖,也能快速推演并得出结论。 3. 我认为人们常将此归入“研究品味”,我将其理解为辨别好想法的能力与寻找好想法的能力的混合。二者相关重叠但并非相同。 6. Ryan:“但当时确实存在低垂果实。” 1. 几乎所有被摘取的果实事后看来都是低垂的。 7. Dwarkesh提问,若研究如此适合智能,为何进展未能更快?为何需要如此多算力? 1. 因为我们没有那么多智能。在人类精英研究员数量有限、皆以人类速度推进、受算力不足及缺乏AI编码等拖累的意义上。 2. 据我所知及在其他领域经验,真正的人类研究员获得实验机会极少,思考“token”不足,常缺乏关键背景,大量时间用于其他事务等。 3. “破解推理”是那种事后看似简单但答案细节不足实施的概念突破,我推测还有其他“简单”突破若获正确想法本可在2023年实现但尚未发生。 4. 另外,你认为AI研发相比其他一切是否已进展相当快且在加速?“若要进行RSI为何尚未实现RSI?”的问题值得追问,但事后看来我们尚未达成的原因显而易见。 8. Ryan预期AI研发完全自动化将于2030-2031年实现,“AI在所有工作上超越人类”的中位数时间为2033年。预期间隔仅~1年,但中位数差异更大,因为两事物之和的中位数通常大于两者中位数之和。 1. 辩论前,我认为这是高度合理的中位数预期。 2. 直到下节才讨论此点。 1. Ryan在前节声称,若AI能在AI研发上匹配人类专家,这足以启动反馈循环,中位数预期为AI单年进步抵得上4-5年,并经历多种收益递减形式。 1. 我认识到所有瓶颈方面,但就完全前提而言,这在我看来甚至偏慢,且应看到复合增长。 2. 我们已见证AI研发及相关编码任务的大幅乘数效应,及其导致的加速开发节奏。 3. 直到下节才讨论此点。 2. Ryan确认其意为:若从2022年起始即拥有此水平的AI研发自动化与AI辅助,但配备2022年算力硬件,我们本可在年底达到“神话(Mythos)”水平。 1. 这似乎要求极高,但也超可实现? 2. 此期间AI算力容量年增长约3.3倍。 3. 据Fable估计,算法效率提升正在加速。2022年3倍,2023年3-10倍,2024年10倍+,2025年再10倍。 4. 所以是的,你只需~7年算法进步(Ryan估计8年)即可克服仅1年硬件进步,假设你无法加速硬件进步或获取更大算力份额。这似乎超可实现。 5. 我们目前已达类似每年3-4年旧算法进步的水平,对吧?认为这不会在未来几年内带来无限进步似乎很奇怪。 6. 更好的反驳论点在于:若你认为大量涉及数据,且因合成数据无效、收集优质数据耗时而无法快速提升数据质量。但我未见为何它必须是受日历时间约束的项目,即使你确实需要。 3. Dwarkesh重申许多关键秘诀是跨领域“编码的专家人类判断”,我们无法复制。Ryan认为此时这已非关键,数据正变得不那么重要,你需要的是强化学习环境,而这些环境受人类数据瓶颈限制较小。 1. 我不确定,但在此我倾向于支持Ryan,理由应在我相关立场中明晰。我认为在当前阶段,其他方面对规模化的关键性远超原始数据。 2. 一旦AI跨越门槛,在充分稳健的条件下至少达到人类水平判断力,问题不就解决了吗? 4. Dwarkesh指出谷歌正洽谈以15亿美元(他称20亿但据其来源为15亿)收购Mechanize,因此人类专家数据有价值。Ryan与Dwarkesh同意实验室支出压倒性用于算力而非数据。 1. 在谁加速AI谁赢得一切的世界里,若你是谷歌,通过砸钱解决问题的所有切入点都是好的。 2. Mechanize被定性为主要是人才收购(acquihire)。是的,ML人才仍重要。此处的辩论在于当你不再愿支付15亿美元时会发生什么。 3. 因此,我不认为这是谷歌在购买数据。 4. 我对Mechanize因此获得回报略感遗憾,但耸耸肩。 5. Dwarkesh试图将数据比作石油,即石油占GDP的1.5%,但无石油将使经济停滞。 1. 无预警的无石油将引发危机。但我们已较好地转型至替代能源并提升效率。 2. 过度延伸此比喻:若美国经济因获得双倍石油供应而开始每年翻倍,但石油总量固定,我预期经济仍会主要翻倍。若告知我们10年后石油将神奇地无法燃烧,我认为我们能完成转型而无甚大碍。 6. Dwarkesh声称若携带GPT-3.5回到2022年,若无人类专家,将其改进将极其困难。 1. 我的意思是,显然GPT-3.5并非人类专家的替代品? 2. 而若将“神话6(Mythos 6)”带回去,或许它能替代人类专家。 7. Dwarkesh:“让我举个例子说明从GPT-8到ASI(https://en.wikipedia.org/wiki/Superintelligence)的困难。你希望ASI擅长的事情之一是:我将接管一家公司,大幅提高其利润,并做各种疯狂之事使其运作更佳。我将接管一家工厂以生产更多芯片。我将进入国会尝试说服他们通过某项法案等。这正是我认为以当前速度再发展5年AI将使AI能够做到的事。这正是我真正担忧的:能够理解如何在世界上做疯狂之事的ASI,能够做到基辛格(https://en.wikipedia.org/wiki/Henry_Kissinger)能做的事,史蒂夫·乔布斯能做的事,以及他的工程师等能做的事。我不确定你如何能没有相关世界数据就获得这些——这相当于神话(Mythos)擅长编码却缺乏相对GPT-3提升其的编码环境。” 1. 我认为这完全是未吞下ASI药丸的表现,等同于智能否认主义。 2. 这意味着Dwarkesh完全未能思考超级智能意味着什么及其能力。 3. Dwarkesh认为GPT-8做不到所有这些事吗?当然它能做到。若你在思想实验中像笛卡尔般强制它全部完成可能不行,但在现实世界情境中,是的,GPT-8当然能显著提升几乎所有公司几乎所有任务的表现,而你思考格局仍过小,且那甚至还未达到真正的超级智能。 4. 我完全不理解这种对“世界数据”的执着,仿佛AI永远无法超越核心限制。 5. 我担心Dwarkesh正在(此处原文截断)

相似文章