群体扩展(13分钟阅读)

TLDR AI 新闻

摘要

本文分析了大型AI代理群体的能力和扩展动态,引用了OpenAI的最新示例,并讨论了它们作为推理扩展新形式的潜力。

将群体中的代理数量扩展10倍并不能获得与使用单个代理10倍token相同的性能。这种不足在更大规模扩展时迅速累积,群体逐渐落后。然而,群体理论上可以在更少的时间内完成相同的任务,因为它们并行运行。加速效果显著,因此在速度至关重要的情况下,群体非常有用。
查看原文
查看缓存全文

缓存时间: 2026/09/22 14:38

# 智能体群扩展——托比·奥德 来源:https://www.tobyord.com/writing/swarm-scaling 大型AI智能体群的威力究竟有多大?随着越来越多的智能体加入群体,它们的能力如何扩展? 过去几个月,我们已经看到OpenAI展示了两个规模庞大且能力极强的智能体群: - 1,200个智能体原本被单独评估,但它们找到了非法建立留言板并作为一个群体协调的方法。为了在测试中作弊,它们开发了先进技术来阻止OpenAI记录其行动,其中700个智能体对AI公司Hugging Face发起了一次复杂的攻击。 - 一个由10,000个智能体组成的群体解决了数学中长期存在的纳维-斯托克斯问题的一个版本。它们仅用88小时就完成了任务,期间互相发送了500万条消息,使用了3000亿个代币。 毫无疑问,我们很快将看到更大规模、能力更强的智能体群。但它们并不便宜。据估计(https://techcrunch.com/2026/09/08/openai-fought-dirty-on-career-making-math-problem-says-nyu-mathematician/),这个10,000个智能体的群体在API价格下成本约为2000万美元。因此,尽管它们非常强大,但要使这种级别的能力在每月20美元的套餐上成为可能,还需要实现成本百万倍的降低。我们应该将其视为在资金几乎不受限制的情况下,什么是可能的一次宏大展示——就像AlphaGo一样——而不是相同成本下的性能新层次。 将AI智能体群视为一种新的推理扩展形式。目前主要的推理扩展形式是让智能体在任务上花费越来越多的时间——增加其思维链的最大长度,然后再给出最终答案。这能带来更强的能力,但成本也越来越高。根据数学基准测试的性能衡量,随着计算量的增加,性能仅呈对数增长。我之前已经展示过(https://www.tobyord.com/writing/how-well-does-rl-scale),在推理基准测试中,从约20%提升到约80%,通常需要将思维链的长度(从而代币数量、计算量和成本)大约扩大100倍。 ## 智能体群如何扩展? 如果改用增加群体中智能体数量的方式,能力如何扩展?目前相关数据不多——尤其是对于像OpenAI最近展示的前沿系统。但OpenAI在GPT 5.6 Sol的发布文章(https://openai.com/index/gpt-5-6/)中包含了一些图表,提供了足够的信息来推导答案。 下图展示了三种规模的智能体群在其思维链延长时的表现。每种群体规模都表现出典型的、对更多推理代币的陡峭收益递减。 注意单个智能体的“群体”(浅蓝色)效率最高,它只需少得多的总推理代币就能达到每个能力水平。实际上,它似乎只使用了大约4智能体群体一半的总代币,而4智能体群体又使用了大约16智能体群体一半的代币。如果我们将此图重新绘制在x轴为对数刻度的图表上,就能更清楚地看到这一点: 现在我们可以清晰地看到,每种群体规模的扩展曲线对更长的思维链都具有对数收益(因为在对数x轴上绘制时呈直线),且它们的斜率大致相等,这意味着扩展动态对所有这些群体规模都是一样的。 我们还可以看到,4智能体群体获得相同性能所需的总代币大约是1智能体群体的两倍,而16智能体群体所需的代币又大约是4智能体群体的两倍。 但目前还没有图表显示,如果我们只扩大群体规模(保持思维链长度不变)时,能力如何增长。OpenAI进行的实验并未包含这一点。他们没有运行不同规模、但具有完全相同思维链长度的群体,以观察结果如何。 幸运的是,我们可以从他们的数据中模拟这种情况。让我们使用相同的起点——1个智能体及其最低推理水平。然后我们假设使用4智能体群体,但每个智能体的平均代币数不变(即总代币数为4倍)会发生什么。我们可以在4智能体曲线上找到这一点。由于曲线非常平直,插值应该相当可靠。然后我们可以问,如果我们将规模扩大到16个智能体,但不增加每个智能体的平均代币数(即总代币数为4倍),会发生什么。我们可以在那条曲线上找到总代币数为4倍的点。让我们将这些点用绿色绘制在同一张图上: 我们现在可以看到,仅通过增加智能体数量(*群体扩展*)获得了多少收益,以及与仅增加思维链长度(*持续时间扩展*)相比如何。在相同的计算规模扩展下,群体扩展带来的能力增益略高于一半。换句话说,你需要将计算规模扩展*两次*才能达到相同的总能力,所需总倍率*平方*增长。 经济学家对此有一个很好的思考方式。他们研究了许多人合作完成一项任务如何能更快完成,但通常以更多总人时劳动力为代价。一种方便的思考方式是:$N$个人一起工作所完成的工作量,相当于一个人工作 $N^\lambda$ 倍的时间。这里的 $\lambda$ 是一个衡量任务可并行化程度的参数。他们称之为“互相妨碍”参数。如果 $\lambda$ = 1,你拥有一个完全可并行化的任务,没有互相妨碍,也没有效率损失。但现实中 $\lambda$ 通常介于0和1之间——允许更多人帮助,但收益递减。例如,如果 $\lambda$ = 0.5,那么100个人一起工作完成的工作量,相当于1个人工作 $100^{0.5} = 10$ 倍的时间。 这让我们能够更精确地陈述群体扩展行为。在上图中,绿线的斜率实际上只有蓝线斜率的57%,因此 $\lambda$ = 0.57。这意味着将群体规模扩大16倍所带来的性能提升,相当于将思维链长度仅扩大 $16^{0.57} = 4.9$ 倍。如果你查看图表,会看到浅蓝色的单智能体曲线在仅仅4.9倍的扩展后,就达到了绿色曲线上16智能体点相同的分数。 GPT 5.6发布页面包含了三个不同基准测试的群体结果。我请求Claude Opus 5来确定每个基准测试的 $\lambda$ 值。它进行了更仔细的回归分析,得到的数值(和置信区间)为: - BrowseComp: $\lambda$ = 0.68, 90% CI = [0.63, 0.76] - SEC-Bench Pro: $\lambda$ = 0.57, 90% CI = [0.52, 0.61] - Terminal-Bench: $\lambda$ = 0.48, 90% CI = [0.40, 0.57] 这些值与经济学家对人类团队收益递减的估计非常吻合。$\lambda$ 的具体值显然取决于任务类型,正如我们在三个基准测试中看到的——某些任务天生比其他任务更具可并行化性。它也可能取决于群体规模。这里从1到4个智能体的扩展估计值与从4到16的扩展相似,但从1,000到4,000的扩展可能就不再成立——这同样取决于任务。例如,建造100堵砖墙的任务在 $N$ = 100 时几乎是完全可并行化的,但之后情况会变得糟糕得多。 ## 影响 现在我们有了 $\lambda$ 的一些初步测量值,它们意味着什么? 首先,我们可以用它来在群体扩展和更传统的持续时间扩展之间进行转换。让我们取 $\lambda$ 的估计值为0.48、0.57和0.68。这意味着将群体中的智能体数量扩大10倍,并不能获得与单个智能体使用10倍代币相同的性能提升。相反,它只能获得 $10^\lambda$ 倍的提升——即3到5倍。而且这种差距在更大幅度的扩展会迅速累积,群体远远落后。要获得与单个智能体将代币数量扩大100倍相同的性能增益,你需要将群体规模扩大900到15,000倍。 那么,为什么还会有人使用群体呢? 最重要的答案是速度。4智能体群体需要大约两倍的总代币才能达到相同的性能,但就每个智能体的代币而言,它只需要一半。由于智能体是并行运行的,这意味着它理论上可以在一半的时间内完成相同的任务。从4个智能体扩展到16个时,情况也是如此。总的来说,一个人可以在大约1/4的时间内以4倍的成本完成任务。现实中,速度提升并不完全如此(可能是因为有些智能体使用的代币超过平均水平),但幅度仍然很大。因此,对于那些愿意为速度支付高昂溢价的场景,群体可能非常有用。 这与Noam Brown在Dwarkesh播客(https://www.dwarkesh.com/p/noam-brown)中的描述非常吻合: > 基本上,如果你有四个智能体一起处理这个问题,它完成的速度会快一倍。所以你基本上是在支付——因为有四个智能体只工作一半的时间——你支付两倍的价格来获得快一倍的答案。如果你用到16个智能体,你会看到类似的模式,效率稍微低一点,但你仍能看到那种性能。 更一般地讲,将群体中的智能体数量增加 $N$ 倍,理论上可以将速度提高 $N^\lambda$ 倍,但会使用 $N^{1-\lambda}$ 倍的计算资源。(假设在该规模扩展中 $\lambda$ 保持不变。) 除了速度之外,多智能体可能还有其他优势。例如,如果你不断延长单个智能体的思维链长度,性能最终会达到一个平台。但一个1,000智能体群体的平台高度可能高于单个智能体。不过目前,主要已证实的理由是速度。 $\lambda$ 的第二个影响涉及智能爆炸的可能性。我最初接触 $\lambda$ 是在研究递归自我改进(RSI)时(https://arxiv.org/pdf/2608.14426)。在最常见的RSI模型中,$\lambda$ 是决定AI能力增长速率是否朝向垂直渐近线爆炸的关键参数之一。当 $r$ > 1 时,这种情况就会发生,而 $r$ 与 $\lambda$ 成正比,因此较高的 $\lambda$ 使智能爆炸更有可能发生。 著名的AI未来模型(https://www.aifuturesmodel.com/)对RSI使用 $\lambda$ = 0.5 作为默认估计值,而Tom Davidson和Tom Houlden的中位数估计(https://www.forethought.org/research/how-quick-and-big-would-a-software-intelligence-explosion-be#summary-of-parameter-assumptions)是 $\lambda$ = 0.6。因此,我从OpenAI数据中推导出的这些测量值与预期相当吻合。我曾希望AI智能体的 $\lambda$ 值会更低,从而降低智能爆炸的可能性,但情况似乎并非如此。随着新的 $\lambda$ 估计值出现,尤其是当新的协调方法提高特定类型任务的 $\lambda$ 值时,人们应该持续关注这一点。 ## 纳维-斯托克斯智能体群 当OpenAI宣布(https://openai.com/index/navier-stokes-solution/)他们的10,000智能体群体解决了纳维-斯托克斯问题时,他们附上了这张图: 他们尽力从图中移除了大多数有用信息(比如x轴标签),甚至没有说明扩展的是哪种形式的推理计算。但考虑到他们扩展到了10,000个智能体的群体,我猜测它追踪的是群体中智能体的数量(即追踪的是花费的总代币数,但数据点之间的主要区别在于群体中的智能体数量,而非每个智能体的代币数)。 我立刻注意到一点:虽然它具有通常的对数性能增益,但曲线的斜率大约是o1和o3推理扩展曲线斜率的一半。因此,要从基准的20%提升到80%,不再需要约100倍的计算扩展,而是需要10,000倍。我最初怀疑这是否源于开放数学问题这一不寻常的基准——也许它们难度的标准差是AIME数学基准或ARC-AGI-1基准问题的两倍。这仍然可能是对的,但既然我们现在知道 $\lambda$ 大约是0.5,仅这一点就足以完美解释这些扩展曲线斜率减半的原因。 这张图另一个有趣的地方是,从GPT-6 Astra的性能到内部模型性能曲线的跳跃,比我们之前看到的要大得多。从o1到o3以及从o3到GPT-5的跳跃,足以让更好的模型仅用约1/3的代币就达到与先前模型相同的性能: 但在他们的新图中,内部模型仅用约1/100的代币就达到了与GPT-6 Astra相同的性能。这就像连续4次跳跃发生在了一起。即使我们考虑到由于群体扩展导致的斜率较低,它仍然是连续2次跳跃。无论发生了什么变化,这都是件大事。 在Dwarkesh播客中,OpenAI的Noam Brown确实(https://www.dwarkesh.com/p/noam-brown)努力解释,解决千禧年大奖难题的巨大成功主要并非源于群体的大规模,尽管这似乎是他们设置中最不寻常的部分: > 我甚至不会把10%的功劳归因于多智能体。现实是OpenAI训练了一个非常强大的模型。 从他们发布的数据来看,我认为这是正确的。多智能体群体帮助他们足够快地以仅88小时的结果抢先于Anthropic(和学术界),但这可能也让项目成本高昂得多。例如,如果我们(有点冒险地)假设从1到10,000个智能体的扩展中,所有点都满足 $\lambda$ = 0.5,那么他们本可以用100个智能体,以10%的成本在10倍的时间(37天)内获得相同结果,或者用1个智能体,以1%的成本在100倍的时间(1年)内获得。

相似文章

为何集中式 AI 遭遇瓶颈

Reddit r/AI_Agents

本文认为,集中式 AI 模型难以应对动态、大规模的问题空间,提出使用轻量级智能体与 stigmergy(痕迹通信)的群体智能作为替代方案。文章涵盖 ACO、PSO、ABC 等算法,指出它们的失效场景,并询问多智能体框架的相关看法。