RS-Claw: 通过层次化技能树实现的渐进式主动工具探索——面向遥感智能体
摘要
RS-Claw 提出了一种用于遥感智能体的主动工具探索范式,利用层次化技能树,支持按需顺序决策,在Earth-Bench上实现了高达86%的输入令牌压缩,并且性能优于被动选择基线。
arXiv:2605.13391v1 公告类型:新论文
摘要:多模态大语言模型(MLLMs)的兴起正在将遥感(RS)智能从‘看见’转向‘行动’,因为OpenClaw风格的框架使智能体能够自主操作大量的RS图像处理工具来完成复杂任务。现有的RS智能体采用被动选择范式进行工具调用,要么依赖完整工具注册(Flat),要么依赖检索增强生成(RAG)。然而,在大规模且多源异构的RS工具生态系统中,这种被动机制难以在任务推理过程中动态平衡‘上下文负载’和‘工具集完整性’,因此表现出固有的局限性:完整工具注册在长程任务中会引发上下文空间不足,而RAG检索可能会遗漏关键步骤中的关键工具。为克服这些瓶颈,本文重新定义了工具选择,主张智能体应作为工具空间的主动探索者。基于此观点,我们提出了RS-Claw,一种新颖的RS智能体架构。通过利用工具端的技能封装技术,该架构将工具描述层次化,使智能体能够执行按需顺序决策:首先通过仅阅读工具摘要选择相关技能分支,然后动态加载详细描述,最终实现精确调用。这种主动范式不仅显著解放了智能体的上下文空间,还有效确保了长程推理中关键工具的准确命中率。在Earth-Bench基准上的系统实验表明,RS-Claw的主动探索机制有效过滤了语义噪声,大幅释放了推理空间,实现了高达86%的输入令牌压缩比,并在复杂推理评估中全面优于现有的Flat和RAG基线。
查看缓存全文
缓存时间: 2026/05/14 06:16
# RS-Claw:通过层级技能树实现遥感智能体的渐进式主动工具探索 **来源:** https://arxiv.org/html/2605.13391 梁天流、王泽源、李紫玉、欧阳凯、唐子超、刘成富、李海峰、余瀚文、杨文涛、杨成、侯东阳(*通讯作者:杨成、侯东阳*) 梁天流、王泽源、李紫玉、欧阳凯、唐子超、刘成富、李海峰、杨成、侯东阳:中南大学地球科学与信息物理学院,长沙 410083(电子邮件:[email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected]; [email protected]) 余瀚文:电子科技大学资源与环境学院,西安 710071(电子邮件:[email protected]) 杨文涛:湖南科技大学地球科学与空间信息工程学院,湘潭 411201,同时任职于湖南科技大学三亚研究院,三亚 572024(电子邮件:[email protected]) ###### 摘要 多模态大语言模型(MLLM)的兴起引发了遥感(RS)智能向新范式的转变,即从“看”到“行动”,特别是OpenClaw式框架展现出自主操作海量遥感图像处理工具以执行复杂任务的迷人能力。现有的遥感智能体在工具调用中采用被动选择范式,要么依赖全量工具注册(Flat),要么依赖检索增强生成(RAG)。然而,当面对大规模、多源异构的遥感工具生态时,这种被动机制难以在任务推理过程中动态平衡“上下文负载”与“工具集完备性”,因此表现出固有的局限性:全工具注册会在长程任务中引发上下文空间不足,而RAG检索则会导致关键步骤中重要工具的遗漏。为克服这些瓶颈,本文重新定义了工具选择范式——主张智能体应该成为工具空间中的主动探索者。基于这一视角,我们提出了RS-Claw,一种新颖的遥感智能体架构。通过在工具端利用技能封装技术,该架构对工具描述进行层级化组织,使智能体能够执行按需的顺序决策:首先仅读取工具摘要以选择相关技能分支,然后动态加载并读取详细描述,最终实现精确调用。这种主动范式不仅显著解放了智能体的上下文空间,还有效确保了长程推理中关键工具的准确命中率。在Earth-Bench基准上的系统性实验表明,RS-Claw的主动探索机制能有效过滤语义噪声并大幅释放推理空间(输入Token压缩率最高达86%),在各种复杂推理评估中全面优于现有的Flat和RAG基线方法。 ## I. 引言 近年来,随着大语言模型(LLM)在意图理解、自主决策和工具利用方面的持续进步,研究人员开发了基于LLM的智能体,配备专门的工具集以自主执行复杂推理任务。这些智能体能够解析自然语言指令,并通过自主规划和调用外部工具来执行任务[39, 31, 33, 40]。在通用领域,例如OpenClaw[27]等智能体已展示了通过动态工具调用完成任务的重要潜力。利用这些智能体的自主任务执行能力,遥感(RS)领域的研究人员利用它们根据各种定制需求处理获取的影像。例如,RS-Agent[42]通过任务分解和多个工具的协同调度,实现了包括场景分类、视觉问答(VQA)和对象计数在内的多种场景下的遥感任务自动化执行。此外,Earth-Agent[7]集成了用于指数反演、目标识别和统计分析等领域的专业工具,从而促进了多模态定量时空推理和科学分析。 大多数现有的遥感智能体采用通用领域普遍存在的“全工具注册(Flat)”范式,即将所有候选工具的功能描述直接拼接到系统提示中。然而,遥感数据处理流程的复杂性以及多源异构数据的快速迭代[5],要求这些智能体配备包含数百个功能的海量且动态扩展的工具库,例如QGIS、GDAL、Google Earth Engine和Orfeo ToolBox[8, 9]。面对如此超大规模的工具集,传统的Flat范式不可避免地在大语言模型内部引发上下文空间瓶颈[29],导致智能体在任务推理过程中出现两个关键挑战: 1. 1. 长程任务中的推理空间受限。以Earth-Bench评估基准为例,其104个专用遥感工具及其参数规格的完整注册本身就要消耗超过2万个Token。尽管一些最先进的大语言模型支持扩展上下文,但冗长的工具描述不可避免地占据了上下文空间的很大一部分。这显著压缩了智能体在长程任务中存储中间状态数据、进行多步试错以及执行ReAct推理所需的关键上下文空间[14, 2, 43]。 2. 2. 多源工具空间内的语义混淆。由于不同传感器相关的物理机制和算法各不相同,大量且语义相似的工具描述产生了大量的“语义噪声”。因此,模型会出现“注意力分散”和“中间迷失”现象,使其在解析用户意图时极易产生“工具幻觉”[24, 28]。 图1:智能体工具选择范式对比。(a) 被动范式:现有方法将智能体定义为被动的工具接收者。具体来说,“Flat”策略全局注入所有工具,导致上下文空间溢出,严重压缩推理空间;“RAG”策略虽然释放了一些空间,但容易在长程推理中导致关键工具的遗漏。(b) 主动范式:RS-Claw将智能体定义为主动的工具探索者。利用层级技能树,智能体通过顺序决策逐步按需发现和加载工具。这种将动态工具加载与ReAct推理交替进行的机制,同时保证了充足的上下文推理空间和准确的工具命中率。 为了缓解Flat范式带来的上下文瓶颈,现有研究主要探索了基于外部检索增强(RAG)的工具注册范式[16]。通过在任务执行前从大规模工具库中过滤出一部分候选工具,这类方法在一定程度上减少了工具描述所占用的上下文空间(例如,ToolReAgt[3])。然而,这种方法在遥感场景中仍然表现出显著的局限性。遥感任务通常涉及多阶段任务分解和依赖于状态的工具需求。仅仅依靠初始任务描述和表层语义相似性进行一次性的检索,很难充分覆盖后续推理阶段所需的关键工具。因此,尽管RAG范式缓解了上下文负载问题,但它可能牺牲工具集的完备性,使得智能体难以在大规模工具空间中同时平衡上下文效率和多步推理的完整性。因此,现有方法仍然难以同时平衡大规模工具空间中的探索效率、推理完备性和系统可扩展性。 为了突破这些瓶颈,我们认为智能体的工具调用应该模仿人类的认知逻辑:工具的获取既不应是全局静态的被动检索,也不应是盲目的代码生成过程。相反,它应该是一个基于上下文推理的、任务驱动的主动探索和按需发现过程。为了实现这一机制,本文从根本上重构了智能体的工具端架构,提出了一种名为RS-Claw的新框架。受“渐进式披露”概念的启发,我们摒弃了传统的扁平化工具列表。相反,利用专家知识,我们将海量的遥感工具集语义封装成“技能”,从而构建了一个结构化的层级技能树[1]。在此架构下,我们创新性地将工具的发现和选择建模为智能体执行的自主顺序决策过程。智能体不依赖于外部预定义的程序逻辑进行局部注册,而是将“工具探索”作为其决策空间内的一种内在行动。因此,它被引导在层级树内进行渐进的自主搜索和动态加载。这种“主动探索”范式有效地解决了上述两个挑战:首先,工具的按需加载将上下文消耗从全局的O(N)降低到局部的O(K),从而释放了充足的空间,使智能体能够维护复杂的中间地理空间状态并执行多步逻辑推理。其次,意图驱动的层级探索在决策路径的早期就过滤掉了无关信息,从而消除了多源工具空间中的“语义噪声”。这有效缓解了注意力分散和工具幻觉的问题。 本文的主要贡献总结如下: 1. 1. 我们引入了一个关于遥感智能体工具选择的开创性视角。受人类认知逻辑启发,我们将工具选择过程重新定义为“主动探索”,从而将智能体从被动的工具接收者转变为结构化工具空间中的主动探索者。通过这一理论转变,我们系统地分析并解决了传统Flat范式下智能体面临的推理空间受限和语义混淆这两个关键挑战。 2. 2. 受渐进式披露概念的启发,我们在工具层级设计了一个层级技能树,创新性地将工具选择行动内化到智能体的自主顺序决策过程中。该架构使智能体能够按需动态加载工具子集,这不仅释放了推理上下文空间,还有效过滤了多源工具集中固有的语义混淆和信息噪声。 3. 3. 我们在Earth-Bench基准上进行了系统性实验。所提出的RS-Claw在所有模型和评估模式下全面优于Flat和RAG基线,在Qwen3-32b AP模式下比Flat基线提升了12.45%。在上下文空间优化方面,与Flat范式相比,RS-Claw显著减少了每轮的输入Token数量,在Qwen3-32b AP模式下实现了最高达86%的输入Token压缩率。大量的消融和可扩展性实验进一步验证了我们所提出方法的结构合理性和鲁棒性。 ## II. 相关工作 由LLM驱动的自主智能体正逐步重塑科学计算和地球观测任务的自动化范式。现有研究集中于以语言模型为核心控制器的系统架构,集成了多步规划、状态记忆和工具调用机制。这些系统在复杂的开放式任务中展示了强大的推理和决策能力,推动智能体从单一模型推理向多工具协同执行演化。这一范式为构建垂直领域的智能体提供了重要基础;相应地,遥感任务已从多模态语言模型适配转向具备工具调度能力的自主系统。然而,随着可用工具规模的持续扩大,在任务执行过程中有效组织并高效检索大规模工具已成为影响推理效率和任务完成质量的关键因素。在工具集不断增长、任务链日益复杂的背景下,工具获取过程仍然主要依赖预定义范围或静态单步决策,对执行过程中工具需求的动态演变支持有限。这一挑战在以高度专业化工具生态和复杂任务依赖为特征的遥感领域尤为突出。随着遥感智能体朝着越来越复杂的长期任务演进,可用工具的快速扩张进一步使得高效的工具组织和获取成为关键挑战。为解决这一问题,我们的工作进一步聚焦于大规模工具空间中的动态工具发现,以支持复杂遥感任务的按需工具探索。 ### II-A. 从通用智能体系统到遥感任务自动化 近年来,以LLM为核心控制器构建自主智能体的范式发展迅速,已成为复杂任务自动化的主流技术路线。在此框架下,LLM充当统一的决策中枢,通过子目标分解、任务规划和协调外部工具调用来推进任务执行[40]。ReAct[43]框架引入了推理轨迹和行动决策的交错生成,使模型能够在动态环境中持续更新计划并检索外部信息,从而显著增强了复杂任务的问题解决能力。在此基础上,Reflexion[34]引入了语言自我反思机制,允许智能体通过总结过去的失败轨迹来制定改进策略,而Tree of Thoughts[44]则研究了中间推理步骤的显式搜索。
相似文章
@omarsar0: // OpenClaw-Skill: 搜索智能体技能树 // 如果你为智能体构建可复用的技能库,这篇值得一看…
本文介绍了集体技能树搜索(CSTS)这一框架,它利用多个模型的集体智慧,为LLM智能体构建结构化、多样且可泛化的技能树。由此产生的模型OpenClaw-Skill在长程规划、工具使用和泛化能力方面展现了更优的智能体性能。
SpatialClaw: 重新思考智能体空间推理的动作接口
SpatialClaw是一个无需训练的框架,它采用代码作为动作接口,使视觉语言模型能够进行灵活、有状态的空间推理,在多种3D/4D空间推理任务上取得了卓越性能。
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
Embodied-BenchClaw:一种用于具身空间智能基准构建的自主多智能体系统
本文提出Embodied-BenchClaw,一种自主多智能体系统,能够通过包含过程质量控制与可扩展技能库的五阶段流水线,根据用户意图自动构建具身空间智能基准。
AutoResearchClaw:自我强化的自主研究与人机协作
AutoResearchClaw是一个多智能体自主研究系统,通过结构化辩论、自我修复执行和人机协作来改进科学发现,在ARC-Bench基准上比之前的系统高出54.7%。