GeoSkill:经验驱动的层级技能学习与协作修订在地理空间智能体中的应用
摘要
GeoSkill引入了一个层级技能学习框架,用于地理空间智能体,将执行经验提炼为可重用技能,通过协作修订提高任务准确性和工具可靠性。
arXiv:2609.13667v1 宣布类型:新
摘要:地理空间智能体日益被期望支持重复和演进的分析任务,而非执行孤立的工作流。在此类设置中,有效的智能体必须将先前的执行经验提炼为可重用的地理空间程序知识,以指导未来的规划和工具使用。然而,现有的记忆增强范式难以总结地理空间分析中长期工具链编排经验和工具级调用约束,同时直接依赖LLM自我反思更新经验常导致错误归因和不可靠的修订。为应对这些挑战,我们提出GeoSkill,一个经验驱动的层级技能学习框架,用于地理空间智能体。GeoSkill包含两个核心组件:(i) 层级技能库(HSB),由规划技能库和工具技能库组成,分别提炼高级任务规划经验和工具使用约束,实现历史执行经验的结构化表示和跨任务重用;以及 (ii) 协作跟踪驱动的技能修订(CTSR)机制,其中Judge、Critic和Refiner协作执行错误识别、技能级缺陷定位和定向修改,防止错误归因和不可靠的修订污染技能库。GeoSkill在开发期间从历史执行中学习和验证技能,在部署期间冻结技能库用于检索式指导处理未见任务。在EarthBench和ThinkGeo上的大量实验证明,GeoSkill有效将历史执行经验转化为可重用的层级技能,提高地理空间任务中的端到端任务准确性和工具执行可靠性。
查看缓存全文
缓存时间: 2026/09/15 08:58
# GeoSkill:面向地理空间智能体的体验驱动分层技能学习与协作修订 来源:https://arxiv.org/html/2609.13667 ###### 摘要 地理空间智能体日益需要支持重复性和演进式的分析任务,而非仅执行孤立的工作流。在此场景下,有效的智能体必须将先前的执行经验提炼为可复用的地理空间程序知识,以指导未来的规划与工具使用。然而,现有的记忆增强范式难以同时总结地理空间分析中长期的工具链编排经验与工具级调用约束,而直接依赖大语言模型(LLM)自我反思来更新经验,常导致错误归因和不可靠的修订。为应对这些挑战,我们提出了GeoSkill,一种面向地理空间智能体的体验驱动分层技能学习框架。GeoSkill包含两个核心组件:(i)一个分层技能库,包括规划技能库和工具技能库,分别提炼高层任务规划经验和工具使用约束,实现历史执行经验的结构化表示与跨任务复用;(ii)一个基于协作追踪的技能修订机制,其中评审员、批评家和改进者协同执行错误识别、技能级缺陷定位和针对性修改,防止错误归因和不可靠的修订污染技能库。GeoSkill在开发阶段从历史执行中学习和验证技能,并在部署阶段冻结技能库,仅用于未知任务的检索式指导。在EarthBench和ThinkGeo上的大量实验表明,GeoSkill有效地将历史执行经验转化为可复用的分层技能,提高了地理空间任务的端到端任务准确性和工具执行可靠性。 1武汉大学 [email protected], [email protected], [email protected], [email protected] 参考图1:智能体范式比较,以地表温度分析任务为例。(a)独立执行:每个任务从零开始运行一个独立的ReAct循环;经验丢失,错误的数据/工具选择在任务间重复。(b)任务内反思:通过口头反思修复当前尝试,但经验未转移到未来任务。(c)任务间记忆:经验被提取到扁平池中(例如,“使用地表温度产品”),但缺失了空间分辨率和时间要求等关键约束,导致下游失败。(d)分层技能演进(我们):分层技能库将规划技能(地表温度分析工作流)与工具技能(地表温度产品约束)分离,同时通过因果追踪驱动的技能修订,以经过验证的编辑方式演进它们,保留了工作流结构和执行约束。 ## 引言 地理空间分析正从静态预测转向多步骤分析工作流,这需要对数据、工具和地理空间状态进行协调推理。近期研究主要利用通用大语言模型结合类似ReAct的工具调用框架。如图1(a)所示,这些方法独立执行每个任务,不保留可复用经验。然而,遥感分析对经验复用有着强烈需求:同一区域需要跨季节监测,不同灾害事件共享相似的数据处理流程,复杂的领域知识(如传感器规格、空间参考系统和分析规则)必须被反复应用。这些重复性分析产生了可迁移的任务规划模式以及与特定工具、数据状态和执行约束相关的操作经验。因此,使地理空间智能体能够积累、抽象和复用历史执行中的有效经验,是构建长期可靠的地理空间智能系统面临的一项关键挑战。 一种自然的解决方案是使智能体能够从经验中学习。早期的经验增强方法侧重于任务内反思(图1(b)):反思失败以修复当前尝试,但产生的经验并未转移到未来任务。这推动了任务间记忆(图1(c))的发展:从历史任务中提取案例、规则或工作流来指导未知任务。然而,这种扁平的经验池缺乏分层表示和可靠的修订机制。 一个有前景的方向是将经验组织为“技能”——具有明确适用条件和验证标准的可复用程序知识单元。然而,将技能学习应用于地理空间智能体仍具挑战性,原因在于地理空间工作流的两个基本特性。 首先,地理空间经验需要分层的技能表示。地理空间工作流包含异构知识,具有不同的迁移需求。高层规划知识决定“做什么”——任务分解和工具链组织——表现出很强的跨任务迁移性(例如,洪水制图始终遵循数据选择、预处理、水体提取和面积估算)。相比之下,工具级知识决定“如何执行”——参数约束、输入输出依赖性和物理可行性条件——并强烈依赖于特定的数据状态(例如,兼容的坐标参考系统和分辨率匹配)。这两种知识类型具有冲突的表示需求:过多的执行细节会降低规划的可迁移性,而过度的抽象则会移除可靠工具执行所需的约束。 其次,地理空间技能需要可靠的演进机制。地理空间操作修改具有长程依赖性且有时不可逆的结构化空间状态。重投影、重采样和时间过滤会改变中间产品,并可能影响所有后续分析。执行失败难以归因:一个不正确的结果可能源于早期规划错误、无效的工具参数或环境变化,错误信号仅在多次下游操作后显现。直接要求大语言模型根据失败轨迹重写完整技能,可能会覆盖先前已验证的部分,并逐渐污染技能库。 为应对这些挑战,我们提出了GeoSkill,一种面向地理空间智能体的体验驱动分层技能学习框架。如图1(d)所示,GeoSkill通过检索-反应-修订-保留循环,将历史执行经验转化为可复用的程序技能。GeoSkill包含两个核心组件:(i)分层技能库,将地理空间经验解耦为规划技能和工具技能,分别建模可迁移的工作流结构和受数据状态与工具规格约束的可执行工具约束;(ii)基于因果追踪的技能修订,包含用于失败归因的评审员、用于因果缺陷定位的批评家和用于约束保持的针对性修订的改进者。每个候选修订在提交到技能库之前,都必须通过重新执行验证,防止错误归因的修订污染技能库。GeoSkill在不更新底层大语言模型参数的情况下,持续演进分层地理空间技能。 我们的主要贡献包括: - 我们提出了GeoSkill,一种体验驱动的分层技能学习框架,它将历史执行经验转化为可复用、可验证和持续演进的程序技能,使地理空间智能体能够在不更新LLM参数的情况下跨任务积累能力。 - 我们设计了分层技能库,将经验分解为规划技能和工具技能,分别建模跨任务可迁移的工作流结构和受数据状态与工具规格约束的执行知识。 - 我们提出了基于追踪的技能修订,一种将失败归因、缺陷定位和针对性修改解耦为三个顺序决策的修订机制,并在环境重新执行验证后才提交修订,防止因错误归因导致的不可靠技能积累。 在EarthBench和ThinkGeo上的实验表明,GeoSkill有效地将历史执行经验转化为可复用的分层技能,提高了端到端任务准确性和工具执行可靠性。 ## 相关工作 ### 基于LLM的地理空间智能体 LLM的最新进展推动地理空间智能体从特定任务模型转向交互式系统,这些系统能够规划分析流程并调用外部工具。早期工作将LLM与遥感模型结合:Change-Agent将语言模型与变化检测集成;RS-ChatGPT和RS-Agent实现了语言驱动的场景理解和物体检测。随着任务复杂性增加,ThinkGeo和Earth-Agent探索了用于端到端分析的可执行地理空间工作流。HTAM通过分层任务抽象增强了长期分解,而苍灵-KnowFlow和RSMeM引入了过程知识库和记忆机制用于故障后恢复。然而,现有智能体专注于完成单个任务。由于遥感具有高度重复性——同一区域需要长期监测,不同事件共享处理流程,领域知识必须被反复应用——如何将历史执行抽象为可复用和可改进的程序知识仍有待探索。 ### LLM智能体的经验与记忆学习 经验学习使LLM智能体能够利用历史交互。任务内方法如Reflexion和CRITIC使用自我反思和工具反馈在当前任务内进行错误纠正。对于跨任务复用,ExpeL从历史轨迹中提取可迁移见解;AWM通过工作流记忆组织动作模式;A-MEM通过结构化记忆管理长期经验。工具增强研究进一步探索了学习工具调用模式。近期工作还将全局规划知识与局部分执行知识分离以提高智能体性能。然而,现有表示——轨迹摘要、文本规则或案例——提供语义级指导,但没有建模结构化的执行约束。对于地理空间分析,有效的经验必须编码对数据状态、空间参考系统、分辨率和工具参数的严格约束。此外,现有方法缺乏诊断和修订错误或过时知识的机制。 ### 技能学习与智能体能力演进 近期工作提出将经验组织为“技能”——具有明确触发条件和执行程序的程序知识单元。除了技能获取,SkillHone在修改过程中保留诊断信息和决策历史以实现渐进优化。与此同时,自动失败归因已成为一个关键挑战:即使最先进的推理模型在精确定位失败步骤方面仅达到14.2%的准确率,并且单个根源错误通过后续决策传播的级联失败仍然是一个根本性瓶颈。然而,现有方法主要针对通用软件或网络任务,将技能视为独立资产,未考虑领域特定的依赖关系。对于地理空间工作流,技能既包含规划模式也包含工具级执行约束,局部错误可能通过多个中间产品传播,然后才表现为故障。GeoSkill通过分层表示解耦规划与工具知识,并通过基于因果追踪的技能修订执行追踪驱动的缺陷定位、针对性修改和重新执行验证,从而解决了这些空白。 ## 方法 参考图2:GeoSkill框架概览。在开发阶段(顶部),GeoSkill通过检索-反应-修订-保留循环迭代演进分层技能库。该库将程序记忆分解为规划技能和工具技能。执行失败时,基于因果追踪的技能修订管道——评审员(失败归因)、批评家(追踪分析和缺陷定位)和改进者(约束保持的针对性修订)——诊断并修复有缺陷的技能。修订后的候选方案仅在成功重新执行后才被保留。在部署阶段...
相似文章
SkillGraph:通过动态演进的技能图增强智能体的强化学习
SkillGraph 是一个框架,将可复用技能表示为有向图中的节点,使大型语言模型智能体能够通过结构化的技能检索和持续演进,更有效地处理组合任务。
Skill-3D:面向智能体3D空间推理的进化式场景感知技能
Skill-3D是一个框架,通过自我进化的记忆与技能库使AI智能体学习场景感知技能,在3D空间推理任务中显著提升工具使用能力(例如,在VSI-Bench上从39%提升至78%)。
SkillHEX:通过假设驱动的自主探索与利用提升智能体技能
SkillHEX提出了一种用于大语言模型智能体自主技能演化的闭环框架,利用假设驱动的自我验证和证据引导的树搜索来克服稀疏奖励挑战。在有限交互预算下,它在SkillsBench上优于现有自演化方法。
Google推出WikiSkill用于持久智能体学习(阅读需22分钟)
WikiSkill是一个框架,与持久知识库共同进化智能体技能,持续超越最先进的方法,并实现跨模型的有效技能转移。
反思、修订、复用:面向GUI代理的无需训练技能进化
本文介绍了EvoSkill-GUI,一个无需训练的框架,允许GUI代理通过执行中的反思、修订和复用来改进技能,在多个基准测试中展示了无需重新训练的性能提升。