GraphBit:一种基于图的非线性代理编排框架

arXiv cs.AI 论文

摘要

GraphBit是一种基于图的代理框架,采用Rust引擎实现确定性DAG编排,消除了幻觉和无限循环。在GAIA基准测试中,它达到了67.6%的准确率,且零框架诱导错误、低延迟。

arXiv:2605.13848v1 公告类型:新 摘要:依赖提示编排的代理LLM框架(即模型自主决定工作流转换)常出现路由幻觉、无限循环和执行不可复现等问题。我们提出GraphBit,一种引擎编排框架,将工作流明确定义为有向无环图(DAG)。与提示编排不同,GraphBit中的代理作为类型化函数运行,而基于Rust的引擎负责路由、状态转换和工具调用,确保可复现性和可审计性。该引擎支持并行分支执行、基于结构化状态谓词的条件控制流以及可配置的错误恢复。三层内存架构(包括临时暂存空间、结构化状态和外部连接器)隔离了各阶段的上下文,防止长链管道中上下文膨胀导致推理退化。在涵盖零工具、文档增强和网络驱动工作流的GAIA基准任务中,GraphBit优于六种现有框架,取得了最高准确率(67.6%)、零框架诱导幻觉、最低延迟(11.9毫秒开销)和最高吞吐量。消融研究表明,每个内存层对性能均有可衡量的贡献,其中确定性执行在代表实际部署的工具密集型任务上提升最大。
查看原文
查看缓存全文

缓存时间: 2026/05/15 06:18

# GraphBit:一种基于图的非线性智能体编排框架

来源: https://arxiv.org/html/2605.13848
Yeahia Sarker¹, Md Rahmat Ullah², Musa Molla², Shafiq Joty³  
¹MTSU ²InfinitiBit GmbH ³Salesforce Research  
[email protected], [email protected], [email protected], [email protected]

###### 摘要

依赖提示编排(即让模型自身决定工作流转换)的智能体大语言模型框架,常出现幻觉路由、无限循环和不可复现执行等问题。我们提出 GraphBit,一种由引擎编排的框架,它将工作流明确且确定性地定义为有向无环图(DAG)。与提示编排不同,GraphBit 中的智能体作为类型化函数运行,而基于 Rust 的引擎则负责路由、状态转换和工具调用,确保可复现性和可审计性。该引擎支持并行分支执行、基于结构化状态谓词的条件控制流以及可配置的错误恢复。三层记忆架构——临时暂存空间、结构化状态和外部连接器——将各阶段的上下文隔离,防止在长时间运行的流水线中因上下文膨胀而损害推理能力。在涵盖零工具、文档增强和基于 Web 的工作流的 GAIA 基准测试任务中,GraphBit 优于六个现有框架,实现了最高准确率(67.6%)、零框架引发的幻觉、最低延迟(11.9 ms 开销)以及最高吞吐量。消融研究表明,每一层记忆架构对性能都有可衡量的贡献,其中确定性执行在工具密集型任务(代表实际部署场景)中带来的提升最大。

代码: github.com/InfinitiBit/graphbit

GraphBit:一种基于图的非线性智能体编排框架

Yeahia Sarker¹, Md Rahmat Ullah², Musa Molla², Shafiq Joty³  
¹MTSU ²InfinitiBit GmbH ³Salesforce Research  
[email protected], [email protected], [email protected], [email protected]

## 1 引言

基于大语言模型(LLM)的智能体的出现标志着 AI 领域的范式转变,它将基础模型的推理能力与环境感知、决策制定和自主行动执行相结合 (Yao et al. 2022; Ke et al. 2025)。多智能体系统已迅速从研究原型演进为生产部署,应用领域涵盖软件工程 (Hong et al. 2023)、科学发现 (Boiko et al. 2023) 和企业自动化 (Wu et al. 2024)。这些系统将复杂任务分解为专门的子任务,分配给协作的智能体,通过协调实现集体目标 (Guo et al. 2024)。这些系统在实际操作中的一个核心挑战是**工作流编排**——即指定调用哪些智能体、以何种顺序调用、使用哪些工具以及数据如何在各阶段传播。底层框架必须可靠、高效且可复现地执行此工作流 (Gu et al. 2025; Tran et al. 2025)。

图 1:GraphBit 基于引擎的编排概览。给定用户定义的工作流图,执行引擎确定性地控制所有路由和状态转换,而智能体仅在其分配节点内专注于领域特定推理。

尽管前景广阔,但大多数现有的多智能体框架存在一个根本性的架构局限:它们依赖**提示编排**,即由 LLM 自身决定工作流转换。这包括 LangChain (Annam et al. 2025)、CrewAI (Duan and Wang 2024) 和 AutoGen (Wu et al. 2024) 等框架,其中智能体接收关于可用工具和下游智能体的自然语言描述,然后通过上下文学习选择下一个动作。这种设计引入了三种关键故障模式 (Cemri et al. 2025; Patil et al. 2024):(1) 幻觉路由,即 LLM 虚构不存在的智能体或工具,导致静默失败;(2) 无限循环,即智能体在没有架构终止条件的情况下反复调用对方;(3) 非确定性执行,即相同的输入产生不同的执行轨迹,破坏了监管领域中的可审计性。此外,每次编排决策都需要一次完整的 LLM 推理过程,且记忆随累积上下文增长,导致效率低下,这在严格延迟预算的企业环境中往往变得尤为严重 (Sculley et al. 2015; Barua 2024)。

我们提出 GraphBit,一种**由引擎编排**的智能体框架,通过基于图的非线性执行范式进行多智能体编排。在 GraphBit 中,用户将工作流定义为类型化的有向无环图(DAG),指定智能体节点、工具节点和控制流逻辑。然后,框架确定性地执行此工作流:智能体作为类型化函数运行,仅负责其领域特定的推理,而执行引擎则根据用户指定的图来控制所有工作流转换、状态管理和工具调用。这种分离确保了对于任何给定的工作流,无论 LLM 输出的随机性如何,执行都是可预测、可审计和可复现的 (Qiu et al. 2025)。

GraphBit 的架构基于三个基本原则:(1) **图形原生执行**,工作流被表达为带有类型化边(表示数据依赖和控制流)的 DAG,从而允许独立分支的并行执行;(2) **引擎主导编排**,执行引擎基于显式条件做出所有路由决策,从根本上消除了幻觉路由和无限循环;(3) **层级化记忆隔离**,三层记忆模型将临时暂存空间、结构化工作流状态和外部连接器接口隔离开,防止上下文污染。这在图 1 中进行了说明。我们基于 Rust 的执行核心以及 Python 绑定实现了 11.9 ms 的平均处理延迟和每分钟 5025 次操作的吞吐量,比最快的可比基线提升了 3 倍。

本文的贡献有四方面:(1) 一种基于引擎的编排架构,采用三层记忆模型,确定性执行引擎在用户定义的工作流图中控制所有转换,从根本上消除了幻觉路由;(2) 对七个 LLM 智能体框架在精心策划的 68 个任务 GAIA 基准测试子集 (Mialon et al. 2023) 上的全面评估,涵盖三种工作流类型,所有框架执行等效的工作流配置;(3) 证明在等效工作流下,GraphBit 达到了 67.6% 的准确率和 0% 的幻觉率,比最强基线高出 14.7 个百分点;(4) 消融研究,分离每个架构组件对整体性能的贡献。

## 2 相关工作

我们将 GraphBit 置于智能体架构、多智能体框架和工作流编排系统的背景中。

**智能体架构。** ReAct 范式 (Yao et al. 2022) 通过将推理轨迹与行动执行交织,为现代 LLM 智能体奠定了基础,这建立在思维链提示 (Wei et al. 2022; Masterman et al. 2024) 之上。后续工作通过思维树 (Yao et al. 2023; Ranaldi et al. 2024) 实现并行推理路径,以及通过 Reflexion (Shinn et al. 2023) 实现自我反思改进。Toolformer (Schick et al. 2023) 展示了 LLM 可以通过微调学习工具调用,而后续工作表明,对于能力强大的模型,上下文学习就足够了 (Qin et al. 2024, 2023)。GraphBit 建立在这些见解之上,将智能体视为专门的工具调用函数,但关键之处在于将工具选择(由智能体执行)与工作流编排(由引擎执行)分离开。

**多智能体框架。** MetaGPT (Hong et al. 2023) 通过标准操作程序协调智能体,用于软件工程角色。ChatDev (Qian et al. 2024) 将智能体组织成一个具有定义通信协议的虚拟软件公司。AutoGen (Wu et al. 2024) 提供了一个以对话为中心的框架,支持智能体之间的自然语言交互。LangChain (Annam et al. 2025) 及其面向图的扩展 LangGraph (Wang and Duan 2024) 代表了最广泛采用的编排框架;LangGraph 引入了显式的图结构,但在条件边上仍保留了基于 LLM 的路由。最近关于并行函数调用的工作 (Kim et al. 2024) 将工具分发形式化为 DAG,但未涉及多智能体编排。LlamaIndex (Liu 2022) 专注于检索增强生成流水线,而 Pydantic AI¹ 提供了类型安全的智能体定义和结构化输出验证。这些框架都有一个共同的假设:LLM 参与编排决策,而最近的经验分析表明,这会导致系统性的故障模式,包括任务验证差距和智能体间对齐不足 (Cemri et al. 2025)。GraphBit 偏离了这一范式,将 LLM 限制在领域特定推理,将所有编排任务委托给确定性执行引擎。Yu 等人 (Yu et al. 2025) 提出了 DynTaskMAS,一个用于基于 LLM 的多智能体系统的动态任务图框架,支持自适应分解、并行执行、上下文共享和工作流优化。它在复杂、演化的任务中提高了可扩展性和效率。然而,增加的编排和同步开销可能降低其在更简单或对延迟敏感场景中的实用性。

**工作流编排。** 传统的工作流引擎如 Apache Airflow (Haines 2022) 和 Prefect (Narayanan 2024) 提供确定性执行,但缺乏原生 LLM 智能体支持。Temporal² 提供持久执行,带有自动重试和状态持久化,但需要大量的集成工作。DSPy (Khattab et al. 2023) 将声明式语言程序编译为优化提示,LMQL (Beurer-Kellner et al. 2023) 引入了受约束的 LLM 生成。这些方法提高了单个智能体的可靠性,但未解决多智能体编排问题。GraphBit 通过提供一个可靠的编排层来补充这些技术,该层可以集成任何智能体实现。

## 3 系统架构

GraphBit 由四个集成组件组成:工作流图规范、基于 Rust 的执行引擎、三层记忆系统以及用于智能体开发的 Python 绑定(图 2)。

图 2:GraphBit 详细架构。基于 Rust 的执行引擎遍历类型化的工作流 DAG,调度智能体、工具和控制节点,而三层记忆系统(临时暂存、结构化状态、外部连接器)将各执行阶段的上下文隔离。

### 3.1 工作流图规范

GraphBit 中的工作流被表达为有向无环图(DAG),其中节点代表计算单元,类型化边编码数据依赖和控制流 (Qiao et al. 2024)。三种节点类型组合起来表达复杂的多智能体工作流 (Thost and Chen 2021)。

**智能体节点**封装基于 LLM 的推理单元,每个节点指定输入/输出模式、系统提示和可选的工具集。执行引擎仅在满足所有输入依赖时才调用底层 LLM,节点边界处的类型强制防止模式违规传播到工作流中。

**工具节点**表示确定性函数(网络搜索、数据库查询、API 调用),这些函数无需 LLM 推理即可执行,提供可预测的延迟。工具节点可以组合成子图,封装复杂的检索或转换逻辑。

**控制节点**实现工作流逻辑,包括条件分支、并行扇出和聚合。关键的是,控制节点决策由执行引擎根据结构化状态谓词评估,而非通过 LLM 推理。例如,条件分支会评估工作流状态变量上的布尔表达式,而不是提示 LLM 选择下一步。边在节点之间携带类型化数据,自动序列化以实现跨语言互操作性,以及可选的转换函数可在数据传输期间实现轻量级预处理。

### 3.2 执行引擎

执行引擎实现了一种针对 LLM 工作负载优化的数据流模型 (Dennis 2005)。引擎用 Rust 编写以确保性能和内存安全,它维护一个就绪队列(其中输入依赖已满足的节点),在线程池中并行调度独立节点,同时按顺序执行依赖节点,并在阶段之间自动传输数据 (Bugden and Alahmar 2022)。引擎强制执行正确性不变量,消除了提示编排系统中常见的故障模式。终止保证源于 DAG 结构:在图构建时拒绝环,并跟踪执行进度以检测停滞。确定性路由来自于对照结构化状态而不是 LLM 输出评估控制谓词。类型安全通过节点边界处的运行时模式验证 (Polyzotis et al. 2019; Habib et al. 2019) 得到加强,违反时会引发显式错误。错误处理遵循快速失败理念,带有可配置的恢复策略,范围从立即终止到带有指数退避的自动重试,以及检查点功能可从中间状态恢复长时间运行的工作流。

相似文章

试验一种无 Leader 与消息传递机制的多智能体系统

Reddit r/AI_Agents

作者详细介绍了一种基于有向无环图(DAG)的实验性多智能体编排框架,将核心智能集中在 Planner 和 RePlanner 组件中,而 Worker 智能体仅负责机械化执行。作者希望获取社区反馈、基准测试数据及相关研究,以验证该架构相较于传统消息传递方案的实际可行性。