我们如何构建多智能体研究系统

Anthropic Engineering 模型

摘要

Anthropic 详细介绍了其全新多智能体研究系统背后的架构与工程原则,重点阐述了采用 Claude Opus 4 和 Sonnet 4 的并行子智能体如何在复杂研究任务中显著优于单智能体方案。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/05/08 09:40

# 我们如何构建多智能体研究系统 来源:https://www.anthropic.com/engineering/multi-agent-research-system Claude 现已具备 Research 能力(https://www.anthropic.com/news/research),能够跨网络、Google Workspace 及各类集成进行搜索,以完成复杂任务。 这个多智能体系统从原型到生产的历程,让我们学到了关于系统架构、工具设计和提示工程的关键经验。多智能体系统由多个智能体(在循环中自主使用工具的 LLM)协同工作组成。我们的 Research 功能包含一个智能体,它根据用户查询规划研究流程,然后使用工具创建并行智能体同时搜索信息。多智能体系统在智能体协调、评估和可靠性方面带来了新的挑战。 本文将拆解对我们行之有效的原则——希望对你构建自己的多智能体系统有所帮助。 ### 多智能体系统的优势 研究工作涉及开放式问题,很难提前预测所需步骤。无法为探索复杂主题硬编码固定路径,因为过程本质上是动态的、路径依赖的。人们进行研究时,往往会根据发现持续更新方法,追踪调查过程中出现的线索。 这种不可预测性使 AI 智能体特别适合研究任务。研究需要灵活性,以便在调查展开时转向或探索切线关联。模型必须自主运行多轮,基于中间发现决定追求哪些方向。线性的单次流水线无法处理这些任务。 搜索的本质是压缩:从海量语料中提炼洞见。子智能体通过并行运行、各自拥有上下文窗口来促进压缩,同时探索问题的不同方面,然后为首席研究智能体浓缩最重要的 token。每个子智能体还提供了关注点分离——不同的工具、提示和探索轨迹——这减少了路径依赖,实现了彻底、独立的调查。 一旦智能达到阈值,多智能体系统就成为扩展性能的关键方式。例如,尽管个体人类在过去 10 万年中变得更加智能,但信息时代的人类社会因为集体智能和协调能力而指数级地更有能力。即使通用智能智能体作为个体运行时也会面临限制;智能体群体可以完成更多任务。 我们的内部评估显示,多智能体研究系统在广度优先查询方面表现尤为出色,这类查询需要同时追求多个独立方向。我们发现,以 Claude Opus 4 作为首席智能体、Claude Sonnet 4 作为子智能体的多智能体系统,在内部研究评估中比单智能体 Claude Opus 4 高出 90.2%。例如,当被要求识别信息技术标普 500 指数公司所有董事会成员时,多智能体系统通过将任务分解给子智能体找到了正确答案,而单智能体系统则未能找到答案,只能进行缓慢的顺序搜索。 多智能体系统有效的主要原因是它们有助于投入足够的 token 来解决问题。在我们的分析中,三个因素解释了 BrowseComp(https://openai.com/index/browsecomp/)评估中 95% 的性能方差(该评估测试浏览智能体定位难以找到信息的能力)。我们发现,仅 token 使用量就解释了 80% 的方差,另外两个解释因素是工具调用次数和模型选择。这一发现验证了我们的架构:通过跨智能体分配工作、使用独立的上下文窗口来增加并行推理容量。最新的 Claude 模型在 token 使用上起到了巨大的效率倍增作用,因为升级到 Claude Sonnet 4 的性能提升比将 Claude Sonnet 3.7 的 token 预算翻倍还要大。多智能体架构有效地为超出单智能体限制的任务扩展了 token 使用量。 但也有缺点:实际上,这些架构会快速消耗 token。在我们的数据中,智能体通常使用比聊天交互多约 4 倍的 token,而多智能体系统使用比聊天多约 15 倍的 token。为了经济可行性,多智能体系统需要任务的价值足够高,以支付增加的性能成本。此外,某些需要所有智能体共享相同上下文或涉及智能体间大量依赖的领域,目前并不适合多智能体系统。例如,大多数编码任务中真正可并行化的任务比研究少,而且 LLM 智能体尚不擅长实时协调和委派给其他智能体。我们发现,多智能体系统擅长涉及大量并行化、信息超出单一上下文窗口、以及与众多复杂工具交互的高价值任务。 ### Research 的架构概览 我们的 Research 系统采用多智能体架构,使用协调器-工作者模式,其中首席智能体协调流程,同时委派给并行运行的专业子智能体。 多智能体架构实际运行:用户查询流经首席智能体,它创建专业子智能体并行搜索不同方面。 当用户提交查询时,首席智能体分析查询、制定策略,并生成子智能体同时探索不同方面。如上图所示,子智能体作为智能过滤器,迭代使用搜索工具收集信息(本例中为 2025 年 AI 智能体公司),然后向首席智能体返回公司列表,以便其编制最终答案。 传统的检索增强生成(RAG)方法使用静态检索。即,它们获取与输入查询最相似的一些块,并使用这些块生成响应。相比之下,我们的架构使用多步搜索,动态查找相关信息,适应新发现,并分析结果以形成高质量答案。 流程图展示了我们多智能体 Research 系统的完整工作流。当用户提交查询时,系统创建一个 LeadResearcher 智能体,进入迭代研究过程。LeadResearcher 首先思考方法并将计划保存到 Memory 以持久化上下文,因为如果上下文窗口超过 200,000 token 将被截断,保留计划很重要。然后它创建具有特定研究任务的专业子智能体(图中显示两个,但可以是任意数量)。每个子智能体独立执行网络搜索,使用交错思考(https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking#interleaved-thinking)评估工具结果,并将发现返回给 LeadResearcher。LeadResearcher 综合这些结果并决定是否需要更多研究——如果是,它可以创建额外的子智能体或优化策略。一旦收集到足够信息,系统退出研究循环,将所有发现传递给 CitationAgent,该智能体处理文档和研究报告以确定引用的具体位置。这确保所有主张都正确归因于其来源。最终的研究结果,附带引用,然后返回给用户。 ### 研究智能体的提示工程与评估 多智能体系统与单智能体系统有 key 差异,包括协调复杂性的快速增长。早期智能体犯的错误包括:为简单查询生成 50 个子智能体、无休止地搜索不存在的来源、以及因过多更新而互相干扰。由于每个智能体都由提示引导,提示工程是我们改善这些行为的主要杠杆。以下是我们学到的提示原则: 1. **像你的智能体一样思考。** 要迭代提示,必须理解其效果。为帮助我们做到这一点,我们在 Console(https://console.anthropic.com/)中使用系统的确切提示和工具构建模拟,然后逐步观察智能体工作。这立即揭示了故障模式:智能体在已有足够结果时继续运行、使用过于冗长的搜索查询、或选择错误的工具。有效的提示依赖于开发对智能体的准确心智模型,这能让最具影响力的改变变得显而易见。 2. **教导协调器如何委派。** 在我们的系统中,首席智能体将查询分解为子任务并描述给子智能体。每个子智能体需要目标、输出格式、工具和来源使用指导,以及清晰的任务边界。没有详细的任务描述,智能体会重复工作、留下空白或找不到必要信息。我们最初允许首席智能体给出简单简短的指令,如"研究半导体短缺",但发现这些指令往往足够模糊,导致子智能体误解任务或执行与其他智能体完全相同的搜索。例如,一个子智能体探索 2021 年汽车芯片危机,而另外 2 个重复工作调查 2025 年当前供应链,没有有效的劳动分工。 3. **根据查询复杂度调整投入。** 智能体难以判断不同任务的适当投入,因此我们在提示中嵌入了扩展规则。简单事实查找只需 1 个智能体进行 3-10 次工具调用,直接比较可能需要 2-4 个子智能体各进行 10-15 次调用,复杂研究可能使用 10 个以上子智能体并有明确分工。这些明确指南帮助首席智能体高效分配资源,防止在简单查询上过度投入——这是我们早期版本的常见故障模式。 4. **工具设计和选择至关重要。** 智能体-工具接口与人类-计算机接口同等关键。使用正确的工具是高效的——通常,这是严格必要的。例如,智能体在网络上搜索仅存在于 Slack 中的上下文,从一开始就注定失败。随着 MCP 服务器(https://modelcontextprotocol.io/introduction)让模型访问外部工具,这个问题更加复杂,因为智能体会遇到从未见过的工具,其描述质量参差不齐。我们给智能体明确的启发式规则:例如,先检查所有可用工具,将工具使用与用户意图匹配,通过网络进行广泛的外部探索,或优先选择专业工具而非通用工具。糟糕的工具描述会让智能体完全走错路,因此每个工具都需要明确的用途和清晰的描述。 5. **让智能体自我改进。** 我们发现 Claude 4 模型可以成为出色的提示工程师。当给定提示和故障模式时,它们能够诊断智能体失败的原因并提出改进建议。我们甚至创建了一个工具测试智能体——当给定有缺陷的 MCP 工具时,它尝试使用该工具,然后重写工具描述以避免失败。通过数十次测试工具,该智能体发现了关键细微差别和 bug。这个改进工具人体工程学的流程使未来使用新描述的智能体任务完成时间减少了 40%,因为它们能够避免大多数错误。 6. **先广后窄。** 搜索策略应模仿专家人类研究:先探索全貌,再深入细节。智能体往往默认使用过长、过于具体的查询,返回结果很少。我们通过提示智能体从简短、广泛的查询开始,评估可用信息,然后逐步缩小范围来对抗这种倾向。 7. **引导思考过程。** 扩展思考模式(https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking)引导 Claude 在可见的思考过程中输出额外 token,可作为可控的草稿纸。首席智能体使用思考来规划其方法,评估哪些工具适合任务、确定查询复杂度和子智能体数量、定义每个子智能体的角色。我们的测试显示,扩展思考改善了指令遵循、推理和效率。子智能体也进行规划,然后在工具结果后使用交错思考(https://docs.anthropic.com/en/docs/build-with-claude/extended-thinking#interleaved-thinking)来评估质量、识别差距并优化下一次查询。这使子智能体能更有效地适应任何任务。 8. **并行工具调用改变速度和性能。** 复杂研究任务自然涉及探索多个来源。我们的早期智能体执行顺序搜索,速度极慢。为提高速度,我们引入了两种并行化:(1)首席智能体并行启动 3-5 个子智能体而非串行;(2)子智能体并行使用 3 个以上工具。这些改变将复杂查询的研究时间减少了高达 90%,使 Research 能在几分钟内完成更多工作,而非几小时,同时比其他系统覆盖更多信息。 我们的提示策略侧重于灌输良好的启发式而非僵化规则。我们研究熟练人类如何对待研究任务,并将这些策略编码到我们的提示中——诸如将难题分解为小任务、仔细评估来源质量、根据新信息调整搜索方法、以及识别何时关注深度(详细调查一个主题)vs. 广度(并行探索多个主题)等策略。我们还通过设置明确的 guardrails 主动缓解意外副作用,防止智能体失控。最后,我们专注于具有可观测性和测试用例的快速迭代循环。 ### 智能体的有效评估 良好的评估对于构建可靠的 AI 应用至关重要,智能体也不例外。然而,评估多智能体系统带来了独特的挑战。传统评估通常假设 AI 每次都遵循相同的步骤:给定输入 X,系统应遵循路径 Y 产生输出 Z。但多智能体系统并非如此运作。即使起点相同,智能体也可能采取完全不同的有效路径来达到目标。一个智能体可能搜索三个来源,另一个可能搜索十个,或者它们可能使用不同工具找到相同答案。因为我们并不总是知道正确的步骤是什么,通常无法仅检查智能体是否遵循了我们预先规定的"正确"步骤。相反,我们需要灵活的评估方法,判断智能体是否达成了正确结果,同时也遵循了合理的过程。 **立即用少量样本开始评估。** 在智能体开发早期,变化往往产生巨大影响,因为有大量低垂的果实。一个提示调整可能将成功率从 30% 提升到 80%。如此大的效果量,只需几个测试用例就能发现变化。我们从约 20 个代表真实使用模式的查询开始。测试这些查询通常能让我们清楚看到变化的影响。我们经常听到 AI 开发团队推迟创建评估,因为他们认为只有包含数百个测试用例的大型评估才有用。然而,最好立即用少量例子进行小规模测试,而非推迟到能构建更全面的评估。 **LLM-as-judge 评估在做得好时能扩展。** Researc

相似文章

@Voxyz_ai: https://x.com/Voxyz_ai/status/2062246736257556654

X AI KOLs Timeline

本文详细介绍了如何构建用于投资研究的多智能体AI团队,使用了像TradingAgents和Bloome平台这样的开源项目。它强调,有效智能体协作的关键在于组织架构,而非模型智能。

@SuJinyan6: https://x.com/SuJinyan6/status/2073955240349770069

X AI KOLs Timeline

这篇由SuJinyan6撰写的博文探讨了AI Agent从简单的LLM加工具使用,向上下文工程和长时间运行框架的演变。文中引用了Anthropic的最新研究,讨论了Agent能力如何成为一种系统级属性,涉及多个组件。