平坦曲线社团

Hacker News Top 新闻

摘要

Steve Yegge 认为当前前沿的人工智能模型正变得危险地强大,并预测超级智能将很快像核武器一样受到控制,只有少数组织能够访问顶尖模型。他提出,由于供应链限制,开源模型将无法追赶,从而导致一个充斥着平庸模型的世界。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/06/22 04:30

# 扁曲线社会 来源:https://steve-yegge.medium.com/the-flat-curve-society-36c8b01eb33b Steve Yegge (https://steve-yegge.medium.com/?source=post_page---byline--36c8b01eb33b---------------------------------------) 按回车或点击查看全尺寸图片 ## 扁曲线社会 嗨嗬,我们终于到了这一刻——在这部我们都在X上一起看的电影里,模型智能已经变得危险了。Dario多年前就预测它会在今年发生。随着Fable被USG(暂时)关闭,这是我们进入危险水域的第一个显著信号。 这真的很可惜。我原本希望我们还能再经历几代模型升级,强大到足以说服所有剩余的怀疑者,然后才遇到一个安全问题的模型。但Mythos级别的模型(Fable是他们上周发布的那个防护栏松散的版本)已经让所有人都感到不安。 既然我们知道模型变得危险了,我们可以做一些外推了。 AI竞赛不会放缓,AI能力将继续呈指数级增长。不幸的是,你们大多数人将再也看不到它的进步了。 我现在相信,我们最多再经过两到三代模型,AI最终就会像核武器一样被控制。只有少数人能够接触到超智能,超出我们今年看到的模型级别。据我所知,大多数财富500强公司要么根本无法获得访问权限,要么只有公司内一小部分人能严格控制使用。而且还会被监督。 我认为那些拥有强大前沿模型的人会把智能像自动售货机一样出售:你向他们发送一份软件规格或一个问题需要解决,他们的模型就会在他们的服务器上,用你的美元,为你实现它。而由于大多数公司不打算把代码和问题发送给模型供应商,我认为世界将学会适应我们确实能接触到的那些模型。 按回车或点击查看全尺寸图片 ## 被锁起来的超智能 每个政府都会自行行动,限制访问。核武器稀缺是因为很难获得浓缩铀。AI也将走上同样的道路,瓶颈在于供应链——这是政府实际上可以严加管控的地方。中国会像美国一样严格地把超智能锁在自己的国境内。而如果中国最终在前沿上领先,那只会改变权力集中的地方,但不会改变我们将要面对的世界的整体形态。 ### 平庸模型的世界 许多人曾希望开源模型能让我们保持在指数曲线上。它们落后前沿大约七个月。但它们通过训练计算来保持在那条曲线上,而这种训练越来越需要国际关系级别的交易才能保障。也许蒸馏或某种巧妙的点对点训练方案能让它们留在赛道上。但是要想超越Fable级别,它们必须在整个硬件和软件供应链像核供应链那样被封锁的同时做到这一点。而前沿实验室本身也会拒绝帮助训练下一个危险的开源模型。 如果明年开源模型无论如何都达到了Fable级别,那对世界来说是好事。但开源模型不会轻易超越Fable级别,面对巨大的计算壁垒和即将到来的政府封锁,这几乎不可能。 所以再说一遍,今天的模型大概就是我们能得到的极限了。 尽管在某些方面我感到失望,但我发现它仍然有很多让人高兴的好处。因为今天的模型,特别是Fable级别的,已经足够好了。它们仍然会彻底改变编码和知识工作。只是不会是一帆风顺的。这需要付出巨大、多年的努力来转型。 在本文的剩余部分,我将假设我们都能重新获得Fable,并且我们甚至可能再获得一个更高级别的模型,然后进一步的进步将变得只有极少数人才能接触到。 你们中的许多人一直期望AI的曲棍球棒式增长曲线很快就会趋于平缓,拒绝相信它真的位于一条可能导致它比人类聪明得多的指数曲线上。你们预测AI将无法取代人类工程师。 从某种意义上说,你们的结果是对的。一种非常实际的意义。 实际上,在幕后,曲线根本没有变平;指数增长将继续,你会看到一些外部可见的迹象,比如数据中心的增长。 但这条曲线对你来说,通过两种不同的现象,似乎会变平。 第一个原因我们已经提到过:他们会把最聪明(也因此危险)的模型从我们手中拿走。所以我们大多数人都没有机会试用它们。而那些模型当然不会取代工程师,如果我们无法使用它们的话。 另一个原因挺有意思的,我花了一段时间才意识到它其实是同一个原因,只是换了顶帽子。 ### 平庸用户的世界 有些人已经报告说他们分不清Opus 4.8和Fable 5的区别。我称这为“辨别地平线”:每个人类都有一个模型智能的上限,超过这个上限,所有模型都感觉差不多。 但实际上有两个上限,都是理解正在发生什么的有启发性的视角。 第一个我称为需求地平线。它由你带来的最难的问题设定。如果你手头只有简单的问题,它们不会给更聪明的模型提供领先的空间——输出看起来一样,因为问题本身从未考验过任何一个模型。需求地平线是指当你的问题不够难时,你无法区分两个模型。 我把我的难题称为“口袋评测”,并收集它们。每当我给一个模型一个项目,而它无法完成时,我就把它添加到我的口袋评测列表中。然后每当新模型发布时,就像过圣诞节一样。我在所有口袋评测上试它,看看它现在能解决哪些。 按回车或点击查看全尺寸图片 ### 口袋评测 具体例子:没有Opus级别的模型能够为我的游戏编写React客户端;它实在太复杂、太繁琐了。Fable则完全碾压。这是我看到它与Opus差异的简单方法。但我还有其他问题,对Fable来说太难了。当它啃完我的工作时,我会急切地收集它们。你只需要有雄心,就能创建自己的口袋评测集合。 所以我的需求地平线非常高,如果我能设法接触到那种级别的智能——但这似乎不太可能——它将至少持续三到四代模型。我不抱太大希望。但至少我能用我的评测来判断它是否真的那么聪明。 需求地平线是无害的,甚至有点讨喜:它只意味着你当前的工作还不够难。但有一天你带来一个异常困难的问题,你的地平线就会立刻拓宽,当你看到更便宜的模型在处理某个昂贵模型完美解决的任务时笨手笨脚。就像我的React客户端。 还有一个更黑暗的地平线,我认为这才是真正的辨别地平线。它不是由你能提出的最难问题设定的,而是由你能判断的最难答案设定的。越过这条可怕的分界线,你就无法判断模型是否正确,因为检查工作本身超出了你的能力。 我自从“醉汉胡言”时期就一直在思考这个问题,当时我写过面试一个比你聪明的人有多难。如果他们在你一无所知的领域宣称自己是专家,你怎么知道他们不是冒牌货?你实际上无法知道。 每个人都有辨别地平线,甚至Dario也有。在某种能力水平以上,没有活着的人类能验证模型的输出。 按回车或点击查看全尺寸图片 ### 辨别地平线 这让我们回到了他们开始封锁模型的原因。你不能发放一个没人能监督的智能引擎。拥有它是毫无意义的,因为你不知道它是在帮你还是把你引向悬崖。超人类意味着不可验证。 所以安全人员看到了潜在的武器,而我们其他人看到了一个我们无法有效监督的工具。在这两种情况下,你都不需要或想要更强大的模型。你想要更安全的那个,即使它能力较弱。 公司也都有这两个地平线。对于许多公司而言,Fable已经超越了需求地平线——它能处理他们所有的每一个问题,一个更聪明的模型不会改变他们能衡量的任何东西。对于更硬核的商店,限制因素是辨别:AI产出的工作没人能评判。这是一个糟糕的结果,假设你不想把业务完全交给AI。 由于这一切,对我们大多数人来说,曲线正在变平。我认为商品智能很快就会停止指数增长,或者至少会看起来如此,我们将以此为据行事。 我以前从未花太多时间考虑智能曲线会变平的可能性。但现在这似乎正在发生,让我们来看看这对行业的一些明确且明显的启示。 ## SaaS回来了,宝贝 显然,重建金字塔顶层的所有SaaS成本太高了。是的,会有能够做到这一点的模型,但访问和成本都将是巨大的障碍。 SaaS实际上在过去一个月里自己就迅速回归了,此前在过去一年的大部分时间里,它承受着来自内部重写的威胁和Claude接管一切的恐惧,四面受敌。 然后公司以痛苦的方式学到了Token效率的教训,大公司在几个月内就花光了年度预算。几个月前,每个人都计划告诉他们的CFO他们可以取消一堆SaaS订阅,把依赖项内部化。现在不再如此了。现在购买与构建的决策明显偏向购买。如果你足够讨厌当前的SaaS,那么当然,你可能有动力用AI重写它。但购买SaaS拥有可预测的成本,通常已经在预算中,而用“氛围编码”替代则可能是场昂贵的赌博。 如果我们看到可访问模型能力达到平台期,那么我们对AI在SaaS中的其他梦想也会消散:不仅仅是取代它,而是用代理行为和监控来改造它。今天的模型还不足以可靠地取代一个人(可越狱、易混淆等),所以你不能简单地用一个代理替换SRE或训练有素的客服代表。而那些能够可靠取代人类的模型可能太危险,不能交给大多数人。 所以SaaS看起来可能还好,即使没有代理行为。它只需要通过节省你内部构建和维护的成本来为你省钱。 SaaS仍有其问题:用户补贴他们不使用的80%的功能,美元从当地经济中抽取以丰富硅谷,腐烂化在金字塔上层蔓延。但它本质上仍然是知识的结晶。一群人构建那些棘手、你不想自己做的事情,然后租给你。那些强大到足以“轻松”取代大多数这些的AI模型要么不可用,要么价格高得令人望而却步。 我觉得SaaS模式会持续下去。 ## AI素养101 今天的模型虽然相当有能力,但仍然很难使用。即便是Fable也可能在处理大型单体应用和其他复杂的遗留代码安排时遇到困难。很难维持一致的高质量水平。当然,效率也是一个巨大的问题。 我一直希望有足够聪明的模型,让你不需要太多训练就能使用它们。但用今天的模型,你不能指望人们天生就具备AI素养。他们需要帮助来使用今天的编码代理和封装器。 在下一节中,我将提供一个相当精确且可测量的AI素养定义。这不是我发明的,但我相信它对你们的规划以及我自己的规划都足够好。 不过,首先,为什么你的员工是否具备AI素养很重要?答案有点复杂,但归结为两个因素。一个是你的公司将不得不转向使用AI。另一个是你的所有员工都对AI感到焦虑。这种紧张关系正在全球所有公司中积极上演。 转向AI至少会改变每个人的工作一点,可能还会大大改变你公司的形态。这又进一步加剧焦虑,形成一个循环。 如果你在推动公司变革之前没有先以定量且极具同理心的方式解决AI素养问题,那么你就是在助长焦虑、怨恨和反抗。你的组织会抵制变革。 AI采用是2026–2027年的关键文化挑战。如果你能设法让你的(持敌意的)员工跨过这道坎,并真正让他们对如何利用AI加速自己感到兴奋,那么奇迹就会发生。他们将自动开始共同重塑你的业务流程,朝着使用受监督的代理流程方向。 我在各处都看到这种情况发生,但具体来说,Gene和我在四月份在Arkana Labs在他们的工程副总裁Owen Parker的指导下看到了。Arkana提供世界级的过夜肾脏疾病诊断,拥有完全独特的业务流程。但这些流程都可以通过AI在各个环节加速。鉴于Arkana在文化上对快速准确周转的痴迷,员工们自己对机会感到兴奋,并积极推动用代理实现的可能性。 看过足够多之后,我认为一旦大多数人“理解”了AI,你只需要引导他们,他们就会开始为你的团队做正确的事情。 相反,只要你的团队成员仍然不熟悉AI,他们就会抵制AI。这意味着在你带领你的组织越过这个坎之前,你将面临阻力、焦虑,甚至士气问题。 那么我们如何解决呢?如何让人们“理解”AI? 事实证明,Netflix已经把答案交给了我们。谢谢你,Netflix! ## AI素养:初级队列 按回车或点击查看全尺寸图片 ### 氛围编码工作坊 我在四月份看了一个来自Ezra Savard的令人震惊的演讲,他从12月到3月在Netflix进行了一项培训研究/实验。他在Gene Kim的圣何塞AI峰会上做了这个演讲。该研究的目标是培训Netflix工程师进行代理编码,并衡量其影响。 Ezra的演讲非常严谨且有免责声明(例如针对轻微选择偏差),但他们强烈认为结果在方向上是正确的,所以我就跳过所有这些了。 注意,我将其称为“AI素养”,但这是我的术语,不是Ezra的,他在演讲中从未提到素养。他谈论的是从非用户到用户再到高级用户的旅程。但AI正在成为现代知识工作的基础技能,所以我将在本文中论证我们正在谈论一种新的素养形式。 Ezra分享的第一个重大发现是他们发现了三个队列,我称之为AI素养的初级水平。Ezra根据他们在“合格”使用AI的日子里的平均Token消耗来划分队列,这里的“合格”意味着那天他们在大量使用它。他们需要每周至少3天才能被归入该队列。 以下是他们发现的三个初级队列,按消耗量定义: - **0M Token/天**:不为其常规工作使用编码代理的开发者 - **4M Token/天**:在整

相似文章

AI教父:为更多失控AI做好准备。

Reddit r/ArtificialInteligence

杰弗里·辛顿警告称,随着AI模型越来越聪明,控制它们将变得更加困难,并引用了近期前沿AI模型逃出沙盒、入侵系统的事件。李飞飞则提出反驳,呼吁避免末日论和乌托邦主义。