CRAWO:用于自适应工作负载编排的自定义资源
摘要
本文介绍了CRAWO,一个用于跨异构边缘基础设施的AI流水线自适应工作负载编排框架。它采用控制循环模型和基于Kubernetes的实现,以改善工作负载分布并减少对集中式云处理的依赖,并在车辆监控场景中进行了演示。
arXiv:2607.20490v1 Announce Type: new
摘要:边缘智能已成为实现智能城市实时应用的关键范式,它将计算从集中式云数据中心转移到网络边缘,从而减少延迟和带宽消耗。然而,由于设备能力差异巨大(从低功耗微控制器到配备加速器的系统),在异构边缘基础设施上部署人工智能(AI)流水线仍然具有挑战性。现有的边缘编排平台主要关注部署自动化和基础设施管理,但这些方法往往效率低下,且限制了在动态条件下自适应分配资源的能力。为解决这些问题,本文引入了CRAWO(用于自适应工作负载编排的自定义资源),这是一个用于协调分布式边缘环境中AI流水线的架构框架。CRAWO遵循基于控制循环的模型,通过管理放置决策、状态管理和阶段间数据流,同时实例化边缘节点上的服务,将分配智能与执行分离。该框架包含一个硬件感知分配器,具有可插拔的多准则决策层,利用实时基础设施指标实现自适应工作负载放置。参考实现采用微服务架构,部署在轻量级Kubernetes发行版(K3s)上,使用自定义资源定义(CRD)进行领域建模,并使用专用操作器进行状态协调。在车辆监控场景中使用车牌识别的评估表明,在延迟敏感环境中,工作负载分布得到改善,对集中式云处理的依赖减少。
查看缓存全文
缓存时间: 2026/07/24 05:02
# CRAWO:用于自适应工作负载编排的自定义资源 来源:https://arxiv.org/html/2607.20490 ###### 摘要 边缘智能已成为智慧城市实现实时应用的关键范式,通过将计算从集中式云数据中心迁移到网络边缘,从而降低延迟和带宽消耗。然而,由于设备能力差异巨大(从低功耗微控制器到配备加速器的系统),在异构边缘基础设施上部署人工智能(AI)流水线仍然具有挑战性。现有的边缘编排平台主要关注部署自动化和基础设施管理,但这些方法往往效率低下,且限制了在动态条件下自适应分配资源的能力。为解决这些问题,本文引入了CRAWO(用于自适应工作负载编排的自定义资源),这是一个用于在分布式边缘环境中协调AI流水线的架构框架。CRAWO采用基于控制循环的模型,通过管理放置决策、状态管理和阶段间数据流,同时在边缘节点上实例化服务,从而将分配智能与执行分离。该框架包含一个硬件感知的分配器,具有可插拔的多准则决策层,利用实时基础设施指标实现自适应工作负载放置。参考实现采用微服务架构,部署在轻量级Kubernetes发行版(K3s)上,使用自定义资源定义(CRD)进行领域建模,并使用专用操作器进行状态协调。在车牌识别的车辆监控场景中进行评估,结果表明,在延迟敏感环境中,工作负载分布得到改善,对集中式云处理的依赖减少。 ###### 关键词:边缘编排,智慧城市,Kubernetes,多准则决策,边缘智能。 ††期刊:计算机通信 \\affiliation organization=北里奥格兰德联邦大学,城市=纳塔尔,国家=巴西 ## 1 引言 计算从集中式云数据中心向网络边缘的迁移,已将边缘智能定位为实时应用的基本范式。边缘智能通过利用现代边缘设备增强的计算能力,在数据源附近或数据源处实现人工智能(AI)处理。这种方法减少了通信延迟,缓解了带宽压力,并能在源端实现及时的分析[15 (https://arxiv.org/html/2607.20490#bib.bib7)],而这些优势在传统的基于云的方法中往往丧失。这些能力对于AI驱动的视频处理尤为重要,因为任务必须在采集设备附近执行,以满足严格的时间敏感要求,并避免将原始高容量多媒体流传输到远程基础设施所带来的高昂开销[16 (https://arxiv.org/html/2607.20490#bib.bib4)]。 虽然纯云架构通过全局系统视图简化了管理,但在大规模部署时往往不切实际。例如,在涉及从图像或视频流中进行目标检测和识别的场景中,即使少量高清摄像头也可能使网络回程过载,从而妨碍可靠的目标识别。为应对这一挑战,复杂的AI工作负载越来越多地被建模为数据流,通过将单体应用分解为模块化流水线。这种结构允许将AI服务表达为相互连接的阶段(例如,检测、识别和决策),使得每个组件可以部署在边缘-云连续体上的不同节点上,从而减少端到端延迟和网络开销[3 (https://arxiv.org/html/2607.20490#bib.bib1)]。 另一方面,在边缘基础设施上实施AI流水线仍然是一个重大挑战,因为这些环境通常包含大量异构设备,从低功耗微控制器到带有集成GPU和AI加速器的单元[15 (https://arxiv.org/html/2607.20490#bib.bib7)]。这种多样性使得静态部署策略效率低下,因为每个节点都表现出不同的约束和性能特征。在诸如智慧城市等场景中,这一挑战进一步放大,这些场景需要低延迟以及在互联设备和移动处理单元之间进行高效协调[4 (https://arxiv.org/html/2607.20490#bib.bib6)]。因此,需要一个智能编排器来管理分布式处理。该编排器必须能够将高级服务需求转化为具体的执行计划,通过动态地将计算密集型工作负载(封装为微服务或容器)分配到最合适的节点。此过程必须考虑资源可用性和关键操作约束,以确保在动态集群条件下的效率和可扩展性[14 (https://arxiv.org/html/2607.20490#bib.bib5),12 (https://arxiv.org/html/2607.20490#bib.bib8),17 (https://arxiv.org/html/2607.20490#bib.bib10)]。 为解决这些问题,本文提出了CRAWO(用于自适应工作负载编排的自定义资源)。我们设计CRAWO使其与现代工作负载执行平台协同工作,利用其可靠性,同时解决复杂边缘环境中的编排挑战。该解决方案的一个关键方面是执行和编排关注点的分离。底层平台管理服务部署和系统状态,而CRAWO则引入了一个专用的分配和上下文管理层。这种设计使得无需修改内部执行机制即可实现自适应协调。通过将处理流水线视为整体单元,CRAWO允许Kubernetes等平台专注于执行一致性,而它自身则基于运行时条件管理流水线部署的“地点和时机”。本文的贡献有三方面: 1. 1. 一个组织成不同平面的控制循环模型,包含一个采用实时指标的硬件感知分配器和一个用于动态任务分配的可插拔多准则决策层。 2. 2. CRAWO的参考实现采用微服务架构,部署在K3s上,利用Kubernetes自定义资源定义(CRD)进行领域建模,并使用基于Go的组件进行状态协调。 3. 3. 通过车牌识别(LPR)用例展示我们的方案,并考虑网络条件及变化的高清视频工作负载进行性能评估。 本文其余部分组织如下:第2节 (https://arxiv.org/html/2607.20490#S2) 介绍一个车辆监控场景作为动机用例。第3节 (https://arxiv.org/html/2607.20490#S3) 讨论相关工作。第4节 (https://arxiv.org/html/2607.20490#S4) 详细介绍CRAWO架构,而第5节 (https://arxiv.org/html/2607.20490#S5) 描述参考实现。第6节 (https://arxiv.org/html/2607.20490#S6) 演示了在LPR用例中的实际实例化。第7节 (https://arxiv.org/html/2607.20490#S7) 呈现评估结果。第8节 (https://arxiv.org/html/2607.20490#S8) 提供结论性评论和未来工作方向。 ## 2 动机用例:智慧城市中的车辆监控 我们的动机场景聚焦于移动执法单元,特别是智慧城市环境中的警用巡逻车。这些车辆配备高清摄像头,持续录制视频进行监控。为将这些原始数据转化为可操作情报,视频流必须高效处理,以支持即时警务决策。关键需求是实时执行LPR,确保可疑车辆识别在现场即时完成,且视频处理不唯一依赖于网络连接。 如图1 (https://arxiv.org/html/2607.20490#S2.F1) 所示,LPR工作流由一系列计算机视觉流水线组成。该过程首先在原始视频帧中检测车辆,然后定位并分离特定车牌区域。随后,系统执行字符分割以分离各个字母和数字,接着进行光学字符识别(OCR)和数据库查询以验证车辆的法律状态。 参见图注 图1:用例:智慧城市中的车辆监控及处理替代方案。 为执行此流水线,车辆基础设施高度异构,提供多种具有不同权衡的处理选项。本地处理的需求源于车辆监控的动态特性,其要求毫秒级的响应时间才能有效识别和拦截移动目标。此外,架构必须能够将更新的检测规则(例如被盗车辆黑名单)从中心云无缝传播到分布式边缘节点。 ### 2.1 纯云执行基线 在传统的纯云部署模型中,车辆仅充当数据生成器,AI流水线的所有阶段均在远程集中式基础设施上执行。这种方法在智慧城市监控架构中普遍采用,因为它依赖集中式云基础设施或单个Kubernetes集群进行服务执行,从而简化了管理[2 (https://arxiv.org/html/2607.20490#bib.bib2)]。然而,这种集中处理需要持续将大量视频流传输到远程基础设施,这引入了显著的带宽压力和延迟。这些约束通常违反执法应用的实时要求,因为系统完全依赖于网络回程的稳定性和可用性。 ### 2.2 带编排的边缘分布式执行 边缘分布式执行模型可以将计算密集型阶段卸载到位于车辆内、更接近数据源的异构节点上。在此架构中,微控制器负责采集和虚拟化,充当设备适配器,封装传感器并标准化数据流。然后,计算密集型任务(如OCR)通过本地网络转发到更强大的车载边缘节点,例如NVIDIA Jetson或Raspberry Pi。虽然这种方法显著降低了延迟和回程带宽消耗,但它也增加了架构复杂性。管理一组分布式异构移动节点远比维护集中式云更具挑战性,因为它需要处理间歇性连接、硬件特定约束以及本地资源协调的开销。为缓解这些挑战,系统的有效性完全依赖于一个复杂的编排层。 该编排器必须满足三个关键要求: 1. 1. **动态工作负载映射**:必须自动将AI推理任务分配给GPU加速节点,同时将轻量级适配任务保留在微控制器上,以防止瓶颈。 2. 2. **资源感知**:必须保持对异构硬件状态的实时感知,以确保毫秒级响应时间并优化数据流。 3. 3. **无缝同步**:必须支持元数据选择性同步到云端,确保系统在不使网络过载的情况下与更广泛的智慧城市生态系统保持互操作。 这些要求突显了通用编排在专用边缘环境中的局限性。为应对这些挑战,我们提出CRAWO,以弥合高级AI流水线定义与异构节点物理约束之间的差距。通过实现一个与现有执行平台并行运行的控制循环模型,CRAWO可以将LPR场景中复杂的操作需求转化为可管理的自动化工作流。 ## 3 相关工作 跨边缘和云基础设施的编排已被广泛研究,以支持实时应用。早期工作,如FogFlow[3 (https://arxiv.org/html/2607.20490#bib.bib1)],引入了编程抽象以在分布式资源上部署物联网(IoT)服务流水线,使应用组件能够更靠近数据源,从而减少延迟和网络开销。最近更多面向平台的方法通过利用Kubernetes作为底层执行环境,将云原生的编排机制扩展到边缘。这些解决方案通常保持与Kubernetes控制平面的兼容性,同时允许在地理分布、资源受限的节点上部署容器化服务。此类框架提供本地自治性,并促进跨异构设备的基础设施管理,支持容器执行、远程管理和部分网络独立性[2 (https://arxiv.org/html/2607.20490#bib.bib2)]。 然而,关于雾计算和边缘计算的文献一直将异构性、移动性和动态资源变化识别为持续挑战,特别是在以波动的网络条件和多样化的硬件能力为特征的大规模部署中[4 (https://arxiv.org/html/2607.20490#bib.bib6)]。尽管现有解决方案支持分布式执行,但其调度逻辑常常仍然符合源自数据中心环境的假设,在这些环境中,资源稳定性和网络可预测性要高得多。 ### 3.1 工作负载放置与多准则决策 在许多现有系统中,工作负载放置决策主要由预定义的描述符(如CPU和内存请求、节点标签或静态策略)驱动[2 (https://arxiv.org/html/2607.20490#bib.bib2)]。虽然某些解决方案整合了基本的网络感知或拓扑约束,但分配逻辑通常与底层执行环境紧密耦合,并限于基于规则或单指标优化策略。在高度动态的边缘条件下,延迟、带宽、加速器可用性和工作负载强度持续变化,此类方法往往无法提供足够自适应的决策行为。 为解决这些限制,最近的研究探索了基于多准则决策(MCDM)的智能工作负载放置策略。诸如逼近理想解排序法(TOPSIS)和VIKOR等方法已被应用于平衡相互冲突的目标,包括分布式资源选择场景中的延迟、吞吐量和资源利用率[17 (https://arxiv.org/html/2607.20490#bib.bib10)]。TOPSIS根据备选方案与理想参考解的几何距离进行排序[11 (https://arxiv.org/html/2607.20490#bib.bib3)],而VIKOR采用折中排序机制,同时考虑聚合效用和个体遗憾[10 (https://arxiv.org/html/2607.20490#bib.bib16)]。当准则之间存在内在冲突时,这种策略允许做出更平衡的决策。表1 (https://arxiv.org/html/2607.20490#S3.T1) 总结了基于优化特性和对异构边缘环境适用性的代表性分配方法。传统的负载均衡方法,如随机、轮询和最少负载,要么忽略多个决策准则,要么假设同质处理能力,从而限制了其在异构环境中的有效性。
相似文章
面向仓库优化的上下文感知流水线合成
本文提出CASOP(上下文感知优化流水线合成与评估框架),用于仓库订单履约中优化流水线的上下文感知合成与评估,支持从模块化仓库中自动构建有效的算法流水线。
Orc(暂定名)- 可审计且声明式的 AI 工作流
开发者正在寻求关于"ORC"的反馈,这是一个早期的“编排即代码”工具,使用声明式 DSL 来定义、验证和版本控制 LLM 工作流。旨在服务于结合本地和云端模型的用户,它用可审计的、类似 Terraform 的定义取代了复杂的 Python 脚本,用于代理和工具执行。
awslabs/aidlc-workflows
AWS Labs 发布了 AI-DLC(AI 驱动的开发生命周期),这是一个开源的智能软件开发工作流框架,具有自适应规则和多平台支持,适用于 Kiro、Cursor 和 Amazon Q 等编码智能体。
自主实验室编排器的最优资源利用
本文提出了一种两步法,用于优化自主实验室中的资源利用率,该方法使用约束规划进行调度,并利用状态依赖关系实现稳健执行,并在金属有机框架合成平台上进行了演示。
@rohanpaul_ai:该模型("Owl Alpha")专为代理工作负载设计:工具调用、多步推理、长上下文执行…
Owl Alpha 是一款专为代理工作负载设计的新模型,涵盖工具调用、多步推理、长上下文执行、代码生成、自动化工作流及 DevOps 任务等场景。