Eluna:一个用于自动化仓库操作、具备推理与任务执行能力的智能体LLM系统

arXiv cs.AI 论文

摘要

Eluna是一个图引导的多智能体框架,用于自动化仓库标准操作流程。它采用非对称情节蒸馏技术,微调出一个更小的模型,该模型性能可与更大的基线模型媲美甚至超越,在工单处理任务上达到了94%的专家一致性。

arXiv:2607.08960v1 Announce Type: cross 摘要:仓库操作受标准操作流程(SOP)管理,SOP编码了复杂的多系统决策逻辑,必须在严格的时间限制下可靠执行。然而,LLM智能体缺乏强制遵循流程的机制,并且在完整SOP规范带来的上下文过载下性能下降。我们提出了Eluna,这是一个已投入生产的智能体系统,用于可靠执行SOP。Eluna是一个图引导的多智能体框架,它将SOP编码为有向无环图,采用渐进式披露,并将独立任务委托给并行的子智能体,每个子智能体具备持久代码执行和实时数据访问能力。为满足生产环境的延迟和精度需求,我们采用非对称情节蒸馏技术:通过情节错误记忆改进强大的教师模型,然后对较小的学生模型进行微调,使用去除记忆的校正轨迹,从而内化修正而不增加推理时间开销。在13项任务基准测试和两个生产应用中,我们微调后的模型性能与教师模型相当甚至更优,超越了所有更大的现成基线模型,并在工单处理应用上达到了94%的专家一致性。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:56

# Eluna: 一个用于自动化仓库操作、具备推理与任务执行的智能体LLM系统

来源:https://arxiv.org/html/2607.08960
Ning Liu††Equal contribution. Kalle Kujanpä䆆Equal contribution. Zhaoxuan Zhu††Equal contribution. P Aditya Sreekar††Equal contribution. Kaiwen Liu Chuanneng Sun Jorge Marchena Menendez Matthew Bales Tianyu Yang Shahnawaz Alam Rose Yu Baoyuan Liu Kristina Klinkner Shervin Malmasi

Amazon.com, Inc. Fulfillment Technologies and Robotics \{ningliun,malmasi\}@amazon.com

###### 摘要

仓库操作受标准操作规程(SOP)管理,这些SOP编码了复杂的、多系统的决策逻辑,必须在严格的时间限制下可靠执行。然而,LLM智能体缺乏强制执行程序合规的机制,并且会在完整SOP规范引入的上下文过载下性能下降。我们提出Eluna,一个在生产环境中部署的、用于可靠SOP执行的智能体系统。Eluna是一个图引导的多智能体框架,它将SOP编码为具有渐进式信息揭示的有向无环图,并将独立任务委托给并行的子智能体,每个子智能体拥有持久的代码执行和实时数据访问能力。为了满足生产环境的延迟和准确性需求,我们使用非对称情景式知识蒸馏,其中强大的教师模型通过情景错误记忆得到改进,然后一个较小的学生模型在去除记忆的修正轨迹上进行微调,将情景修正内化到其权重中,而无需推理时的额外开销。在一个13项任务基准测试和两个生产应用中,我们微调的模型达到或超过了其教师模型,击败了所有更大的现成基线模型,并在工单处理应用中达到了94%的专家一致性。

Eluna: 一个用于自动化仓库操作、具备推理与任务执行的智能体LLM系统

Ning Liu††Equal contribution. Kalle Kujanpä䆆Equal contribution. Zhaoxuan Zhu††Equal contribution. P Aditya Sreekar††Equal contribution. Kaiwen Liu Chuanneng Sun Jorge Marchena Menendez Matthew Bales Tianyu Yang Shahnawaz Alam Rose Yu Baoyuan Liu Kristina Klinkner Shervin Malmasi Amazon.com, Inc. Fulfillment Technologies and Robotics \{ningliun,malmasi\}@amazon.com

## 1 引言

现代仓库操作需要在数十个系统之间进行持续监控、多步骤诊断和及时干预,从机器人输送操作员在几分钟内将阈值违规追溯到根本原因,到库存工单处理,需要查询状态、验证约束,并且每个工单跨多个系统提交物理物品拣选。机器人输送诊断和工单处理是众多此类流程中的两个,每个都遵循标准操作规程(SOP):有向决策路径,包含必须忠实遵循的规定步骤、依赖关系、量化阈值和约束。目前,这些执行的很大一部分是手动的、缓慢且容易出错的,诊断延迟会直接降低吞吐量,这使得自动化SOP执行成为迫切的业务需求。

大语言模型推理能力出色Wei等人 (2022); Kojima等人 (2022),但诸如ReActYao等人 (2023)和ReflexionShinn等人 (2024)这样的智能体框架依赖于结构松散的提示,缺乏强有力引导SOP合规的机制,因此一个强大的模型仍可能偏离规定的决策路径。最近的基准测试在流程引导任务Xiao等人 (2024); Wang等人 (2025)、工业SOP遵循Nandi等人 (2025)以及操作诊断中确认了这一差距,即使SOP增强的多智能体系统性能也停滞不前Pei等人 (2025)。一个核心瓶颈是上下文过载:当完整SOP在视野中时,复杂流程会压倒模型选择相关操作的能力,导致性能下降Xiao等人 (2024); Pei等人 (2025)。这种停滞与模型规模无关,并且仅靠提示是不足的,还需要领域特定的训练Nandi等人 (2025)。

我们提出一个图引导的智能体框架,通过统一的执行模型来解决这些挑战。SOP被编码为有向无环图,渐进式信息揭示仅按需展示可达子图和节点级别的规范。一个主智能体协调遍历,并将独立的节点评估委托给隔离上下文中的并行子智能体,每个子智能体拥有持久的代码解释器(Wang等人的CodeAct范式 (2024))并通过模型上下文协议访问实时数据Anthropic (2024),在提供上下文隔离和并行性的同时,引导智能体走向程序合规。共同地,渐进式信息揭示和子智能体隔离解决了上下文过载问题。每个操作用例都打包为一个自包含的*技能*¹¹https://agentskills.io/: 一个包含决策图、用例特定工具、节点规范和执行指令的包,按需加载,因此新流程无需定制系统。由于仅靠提示不足Nandi等人 (2025),我们将该框架与一个以轨迹为中心的训练流水线配对,其中情景学习在不更新权重的情况下纠正强大教师模型的轨迹,然后一个更小、低延迟的学生模型在没有情景记忆的情况下进行微调(非对称情景式知识蒸馏),将情景修正内化到其权重中,而不是在推理时依赖它们。我们做出三项贡献:

- •一个**图引导的、基于技能的智能体框架**,将SOP编码为具有渐进式信息揭示的有向无环图,并使用分层多智能体执行和并行子智能体委托,以实现跨多个操作用例的可扩展、程序合规的推理。
- •一个**以轨迹为中心的、具有非对称情景式知识蒸馏的训练流水线**:情景学习迭代地提升教师轨迹质量,学生模型则在经过拒绝采样过滤的按轮次分解轨迹上进行微调,剥离情景记忆,将情景修正内化到其权重中,消除推理时的记忆依赖。
- •在13项任务操作推理基准测试和两个生产仓库应用(机器人输送和工单处理)上的**真实世界性能**,表明微调的32B模型优于所有基线,包括其教师和更大的现成模型。微调的355B模型在工单处理应用上达到了94%的人类匹配率。

## 2 相关工作

#### 工具增强的智能体与多步骤推理。

LLM智能体已配备代码执行Gao等人 (2023); Wang等人 (2024)、APIsPatil等人 (2023); Qin等人 (2024)和标准化工具协议Anthropic (2024)。多步骤推理方法包括思维链Wei等人 (2022)、思维树Yao等人 (2024)、交织推理与行动Yao等人 (2023)以及层次化分解Khot等人 (2023); Besta等人 (2024)。这些方法改进了通用推理,但依赖于结构松散的提示,缺乏强制实施确定性程序约束的机制。

#### 结构化推理与操作AI。

诸如AutoGenWu等人 (2023)和MetaGPTHong等人 (2024)等框架实现了跨专门智能体的任务分解。SOPStructGar等人 (2025)将非结构化SOP转换为DAG,但仅关注结构化而非执行。Agent-SKulkarni (2025)通过提示驱动的状态机导航SOP,但缺少图引导的渐进式信息揭示、代码执行和后训练。我们的工作将SOP图集成到推理和训练中。

#### 以轨迹为中心的训练。

ReflexionShinn等人 (2024)和Self-RefineMadaan等人 (2024)使用迭代反馈在推理时改进轨迹。FireActChen等人 (2023)和AgentTuningZeng等人 (2024)表明,在智能体轨迹上进行微调可以提升泛化能力。我们的流水线有两个不同之处:情景学习改进了用于蒸馏的*教师*轨迹,而非部署模型;并且训练是与图结构的程序逻辑对齐的,而非自由形式的任务。

## 3 图引导的操作智能体

Eluna是一个分层多智能体框架,通过图结构化的渐进式信息揭示、并行子智能体委托和技能打包来解决上述两个挑战(上下文过载和用例通用性)。图1 (https://arxiv.org/html/2607.08960#S3.F1)提供了概况。

参见图注图 1: Eluna框架概述。**左图**:训练策略,结合了用于教师轨迹改进的情景学习与用于通过LoRA进行监督微调的轮次级分解。**右图**:系统架构,展示了图结构的SOP表示、具有并行子智能体委托的分层多智能体设计,以及通过持久代码执行和基于MCP的数据访问实现的工具增强推理。### 3.1 图结构的SOP表示

每个SOP是一个有向无环图G=\(V,E\),包含五种节点类型:**观察项**(可检测条件)、**根本原因**(诊断原因)、**计算**(指标分析)、**约束**(前置条件)和**行动**(修复措施)。每个节点有一个参数化规范,定义了其评估过程,产生一个结构化结果:布尔值、分类(例如,路由下游遍历的类别)或计算值。边编码有向依赖关系:单节点边根据一个父节点的布尔结果激活子节点(成立,或对于回退路径不成立),而多节点边需要多个父节点同时成立。一个节点可以有多个出边。

#### 渐进式信息揭示。

呈现完整图会降低遍历准确性Liu等人 (2024),尤其是在并行路径上,智能体会混淆分支、遗漏节点或探索无关子树。我们在两个层级上揭示图。首先,一个检索工具从触发节点运行BFS,仅返回可达子图(节点类型、边关系、简要描述)。其次,每个节点的完整程序规范(评估逻辑、所需工具调用、阈值)仅在智能体开始评估该节点时才被获取,将工作上下文限制为每次一个节点。

### 3.2 分层多智能体架构

Eluna使用两级层次结构:主智能体协调遍历,而子智能体并行评估各个节点。主智能体持有检索到的子图,根据边依赖关系选择下一个要评估的节点,并发出委托调用;每个子智能体接收一个全新的上下文,只包含分配节点的程序规范、角色指令和工具。行动节点保留给主智能体,因为它们需要图级别的状态来进行排序和约束检查。

一轮中发出的多个委托调用并行执行,将挂钟时间减少到大约最慢的单个评估时间。只有每个子智能体的结构化结论被返回,因此主智能体的上下文每节点仅增长一个摘要,而不是完整的调查历史;子智能体会话持久存在,因此主智能体可以查询其中一个以获取详细信息而无需重新运行,并且子智能体无法生成更多子智能体。这隔离了子智能体会话中的工具输出和中间计算,从根本上解决了上下文过载问题,同时主智能体仅持有图结构和节点结论。在一项并行工作中,我们通过在构建时将重复的SOP步骤编译为可重用工具来减少每节点子智能体的开销Kujanpää等人 (2026)。

### 3.3 技能打包

每个仓库流程需要其自己的决策逻辑、提示、数据源和行动。为每个用例定制智能体会复制执行引擎和训练流水线,而一个加载所有用例的单一智能体会遭受上下文过载和工具空间冲突。流程是一个更自然的打包单元:我们将每个流程的工件打包成一个在运行时加载的自包含*技能*,遵循模型逐渐训练使用的标准化技能格式。框架保持用例无关,因此相同的智能体和执行逻辑可以服务于任何加载的技能,添加一个流程意味着创作一个技能,而不是修改智能体。

一个技能包含五个组件:(1) 将SOP编码为DAG的决策图,(2) 通过模型上下文协议Anthropic (2024)访问的、用于查询数据和执行行动的用例特定工具,(3) 包含每个节点评估逻辑的节点细节规范,(4) CodeAct函数Wang等人 (2024),以及(5) 指导遍历策略的执行指令(例如,何时委托,如何处理约束);用于知识检索的参考文档Schick等人 (2024)被捆绑为可读文件。当触发器被激发时,技能加载工具在命名空间前缀下注册技能的工具,将其CodeAct函数作为可导入模块注入到持久解释器中,并附加其执行指令,之后智能体就拥有了当前用例所需的精确工具和指令。

### 3.4 工具生态系统

该智能体操作五种工具:一个用于程序化数据处理和指标计算的持久代码解释器;一个任务跟踪列表,兼具引导机制,使遍历保持在预期路径上;基于MCP的数据和行动访问Anthropic (2024)以连接操作仪表板;用于按需知识检索的智能体RAGSchick等人 (2024);以及一个跨调用持久存在的操作记忆,积累知识并实现对冗余调查的去重。附录A (https://arxiv.org/html/2607.08960#A1)详细描述了每一个。

表 1: 操作基准测试:相对于GLM-4.5-Air基线在13项任务上的改进百分比。

## 4 训练策略

图引导框架(第3节)与模型无关,但即使是最大的可用模型也无法在图结构化程序推理上达到可靠精度Nandi等人 (2025)。

相似文章

Agora:通过基于拍卖的任务分配增强LLM智能体推理

arXiv cs.AI

Agora引入了一种基于拍卖的任务分配机制,用于LLM智能体,将推理步骤视为可交易物品,并使用校准后的置信度将任务路由到最有能力的专家模型,从而在多个基准测试中提升推理性能。