GeoForge:面向地球观测推理的非参数自进化智能体
摘要
GeoForge 是一个无需训练、自进化的地球观测推理框架,它将已完成的轨迹组织成非参数记忆,以改进 LLM 智能体的规划和工具使用,而无需更新骨干模型。
查看缓存全文
缓存时间: 2026/08/12 08:24
# GeoForge:面向地球观测推理的非参数化自进化智能体
Source: https://arxiv.org/html/2608.10494
Xin Xiao1, Jiang Zhong1†, Junnan Zhu2, Yingchao Feng3, Peijin Wang3, Yidan Zhang3, Kaiwen Wei1†
###### 摘要
地球观测(EO)智能体需要构建科学有效的工具工作流,并将结论锚定于当前地理空间证据。这具有挑战性,因为 EO 工作流受到感知语义、产品依赖、空间与时间兼容性以及参数要求的约束。现有智能体往往针对每个查询在广阔的操作空间中搜索,而近期的自进化系统并未将异构 EO 轨迹充分组织为跨不同决策层级的可复用知识。为解决这一问题,我们提出 GeoForge——一个免训练、自进化的框架,将已完成的轨迹转换为结构化的非参数化执行状态。GeoForge 首先根据感知上下文约束操作空间,然后从三个互补的记忆中检索任务条件化先验。工作流图记忆捕获全局操作顺序,动作级经验提供局部修正,适应性技能标准操作规程(SOP)保留过程与数据约束。检索到的先验指导工具执行,同时最终答案仍以当前观测为基础。在每次任务之后,安全门控的蒸馏过程将经过实证锚定的轨迹转换为可复用的执行知识,以供未来检索。这种执行-蒸馏-复用循环在不更新骨干 LLM 的情况下改进规划能力。在多个地理空间基准上的实验表明,GeoForge 在不同 LLM 骨干上持续提升任务准确率和工具使用轨迹质量,同时显著减少大多数 LLM 的工具规划与推理错误。
## 引言
大语言模型(LLM)智能体能够理解用户请求、规划复杂的中间动作,并与外部工具交互以解决复杂任务(Yao et al. 2022; Wu et al. 2023; Shinn et al. 2024)。这一能力对于地球观测(EO)尤其具有前景,因为科学分析需要对多模态观测、地理空间产品和专业工具进行协调推理(Wang et al. 2024; Xiao et al. 2025)。EO 智能体通过选择观测数据、生成产品并利用地理空间证据支撑结论,能够自动化多样化的真实分析流程,从而加速科学发现(Van de Weghe et al. 2025; Wang et al. 2026b)。
图 1:传统 EO 智能体与 GeoForge 的比较。(a) 传统智能体会因工具不匹配和轨迹中断而失败。(b) GeoForge 使用自进化和任务感知过滤实现可靠的 EO 任务执行。
可靠的 EO 分析受感知语义、观测条件和工作流依赖的约束(Xiao et al. 2025; Wang et al. 2024)。与通用工具使用场景不同,EO 工作流依赖于可用观测、感知模态和中间产品,而非仅依赖任务描述(Zhu et al. 2017)。缺少此类领域约束时,智能体可能选择无关操作、误用输入或产品,并构建无效工作流。由于这些规则在不同任务和感知情境中各不相同,难以在静态提示中编码,因此需要任务条件化的执行知识,以捕获科学兼容性,并能在任务间复用,同时持续适应新遇到的感知场景。
现有 EO 智能体通常采用通用推理与动作框架,LLM 通过迭代推理和工具交互来构建工作流(Xu et al. 2024; Feng et al. 2025)。近期基准展示了这种范式的潜力,但也揭示了工具选择、执行顺序、参数依据和工作流完成方面的持续局限(Shabbir et al. 2025; Li et al. 2025)。如图 1 所示,在没有明确执行指导的情况下,将智能体暴露于大型异构 EO 工具空间,可能导致操作不匹配、参数无效和轨迹中断。缺少关于科学兼容性和有效操作顺序的可复用先验时,智能体必须针对每个查询探索广泛的动作空间,从而导致冗余调用、不兼容操作和不完整工作流。
相关的自进化地理空间系统探索了如何在不更新骨干 LLM 的情况下,通过外部知识和交互经验改进地理空间问题求解。GeoEvolve(Luo et al. 2025)使用知识引导的代码进化来发现并完善任务特定的地理空间算法;GeoEvolver 则将成功交互和失败归因蒸馏为一个不断演化的经验库,用于细粒度 EO 工具执行(Dai et al. 2026)。这些研究展示了自进化的两条互补路径:GeoEvolve 进化算法实现,而 GeoEvolver 累积交互层面的工具专长。一个独特的挑战仍然存在:如何将完整 EO 工作流中的可复用执行知识组织起来,从全局操作顺序、局部动作修正到过程约束。原始轨迹保留过多实例特定细节,而紧凑的文本摘要可能遗漏决定工作流有效性的产品依赖、参数条件和执行结构。因此,关键挑战是将已完成的轨迹转换为领域有效、结构化、任务条件化且可安全更新的执行先验。
为解决这一挑战,我们提出 GeoForge——一个免训练、自进化框架,在骨干 LLM 之外维护结构化的非参数化执行状态。给定一项任务,GeoForge 首先推断感知上下文以约束操作空间并提供执行指导。随后,它从三个互补记忆中构建任务条件化执行先验:工作流图记忆捕获全局工作流结构,动作级经验提供局部修正,适应性技能 SOP 保留可复用流程、数据要求和参数约束。这些组件共同指导操作选择与组合,同时将最终答案基于当前观测和地理空间产品。在每次任务后,GeoForge 将经过实证锚定的轨迹蒸馏为可复用工作流结构、动作级教训和程序性知识,从而在不更新模型参数的情况下实现持续改进。在多个地理空间基准上的实验表明,GeoForge 相比现有 EO 智能体显著提高了任务准确率和工具使用轨迹质量,并在大多数骨干 LLM 上减少了工具规划和推理错误。贡献总结如下:
- 我们提出 GeoForge,一个免训练、自进化的地球观测智能体框架。通过持续将遥感执行轨迹蒸馏为结构化知识表示,GeoForge 能够在不扰动骨干 LLM 权重的情况下,在异构地理空间模态上实现持续的规划与工具使用能力提升。
- 我们引入了三级非参数化记忆以及一种任务感知执行策略,结合模态感知工具过滤、工作流图记忆、动作级经验和适应性技能 SOP,提供结构化规划先验并支持持续自进化。
- 在多个地球观测智能体基准上的大量实验表明,GeoForge 在不同 LLM 骨干上持续提升任务准确率和执行轨迹质量,验证了其在可靠 EO 工具使用方面的有效性。
## 相关工作
### 面向地球观测的智能体
近期大语言模型的进展推动了面向地理空间和地球观测应用的工具增强智能体。早期工作如 Remote Sensing ChatGPT(Guo et al. 2024)和 RS-Agent(Xu et al. 2024)展示了在 LLM 规划器下链接感知与分析模块,但它们仅报告最终准确率,并未对工具使用轨迹进行结构化评估。随后的基准提高了评估严谨性:ThinkGeo(Shabbir et al. 2025)引入了需要检测、分割和地理空间推理的任务;OpenEarthAgent(Shabbir et al. 2026)通过更广泛的工具生态系统扩展了这一方向。TerraBench(Nguyen et al. 2026)将 EO 影像、网格化环境数据、GIS 推理和模拟统一到具有过程级指标的框架中,揭示了参数依据和数值推理是瓶颈。方法学创新包括 Geo-OLM(Stamoulis and Marculescu 2025),其采用状态驱动推理,将任务推进与工具调用解耦;以及 Earth-Agent(Feng et al. 2025),其采用集成专用工具的 ReAct 风格框架。层次化任务抽象(Li et al. 2025)也得到了探索。TerraLogic(Yan et al. 2026)引入了一个跨光学、SAR 和红外模态的层次化推理与错误感知重规划基准。
### 自进化智能体
另一条平行研究路线探索了在不进行参数更新的情况下,从交互经验中改进智能体。ReAct(Yao et al. 2022)展示了迭代推理-行动循环,相关综述对该领域进行了梳理(Tao et al. 2024)。Memento 引入了读写反思学习,其中情景记忆存储结果,检索使策略改进得以实现(Zhou et al. 2025);Memento-Skills 将可复用技能视为通过反思性修订而演化的工件(Zhou et al. 2026)。MemSkill 将记忆提取重构为可学习技能,采用控制器-选择器-设计器架构(Zhang et al. 2026)。轨迹信息记忆生成从执行轨迹中提取可操作经验(Fang et al. 2026)。SAGE 引入了自进化图记忆引擎(Wang et al. 2026a),XSkill 则提出了多模态智能体中的经验持续学习(Jiang et al. 2026)。这些方法表明,持续学习不必存在于模型权重中;自我改进的记忆或技能库可以充当持久智能。近期工作开始将这些思想扩展到地球观测,包括 GeoEvolve——通过多智能体协作自动化地理空间模型发现(Luo et al. 2025),以及经验驱动多智能体系统(Dai et al. 2026)。然而,它们并未针对异构 EO 推理显式优化工具空间探索和工作流复用。GeoForge 通过任务感知工具约束、检索增强规划和持续非参数化记忆更新弥补了这一空白。
## 方法
### 概述
如图 2 所示,我们提出 GeoForge——一种自进化 EO 智能体,在不更新骨干权重的情况下学习遥感分析的程序性知识。工作流图记忆、动作级经验和适应性技能 SOP 共同指导 EO 数据检查、地理空间产品构建、时空推理和参数依据。每次回合后,安全门控的轨迹蒸馏会更新这一外部状态。
图 2:GeoForge 的流程。该框架包含三个模块:基于 ReAct 的自进化闭环;具有轨迹过滤和混合相似度匹配的非参数化记忆构建;以及用于任务技能和动作经验的多级知识抽象。
### 问题形式化
一个 EO 任务为 \(x=(q,d,\mathcal{Y})\),包含科学请求、数据集合和答案空间。给定操作库 \(\mathcal{T}=\{T_i\}_{i=1}^{n}\),智能体选择 \(a_t=(T_i,\theta_t)\),其中 \(\theta_t\in\Omega_i\),或者选择预测 \(y\in\mathcal{Y}\)。一条轨迹为
\[
\tau=(q,a_1,o_1,\ldots,a_m,o_m,y),\quad o_t=T_i(\theta_t),
\tag{1}
\]
观测包括 EO 数据清单、导出的地理空间产品、感知输出、区域或时间统计以及执行错误。有效轨迹必须遵循遥感数据流:在生成产品之前识别相关观测和模态,将返回的产物传递到下游工具,并且仅在检查空间和时间兼容性后进行聚合。最终答案必须由当前 EO 数据支持,而非由检索到的记忆支持。
设 \(z=[T(a_1),\ldots,T(a_m)]\) 和 \(\Theta_\tau=[\theta_1,\ldots,\theta_m]\) 分别表示操作轨迹和参数轨迹。我们评估最终正确性、操作覆盖率和顺序、参数依据、重复以及不兼容转换。在推理时没有专家轨迹的情况下,GeoForge 通过其外部状态近似这些执行先验。
### 工作流图记忆
我们将高层执行知识表示为一个有向、可靠性感知的图 \(\mathcal{G}=(\mathcal{W},\mathcal{A},\mathcal{U})\),包含工作流节点、工具转换边和使用统计。与通用 API 图不同,它编码 EO 依赖关系,例如:数据发现 \(\rightarrow\) 模态感知输入组织 \(\rightarrow\) 地理空间产品生成 \(\rightarrow\) 空间或时间聚合 \(\rightarrow\) 科学解释。节点为
\[
w_i=(c_i,r_i,\mathbf{z}_i,\mathbf{p}_i,\mathbf{b}_i,Q_i,n_i^+,n_i^-),
\tag{2}
\]
其中 \(c_i\) 是任务类型,\(r_i\) 是工作流描述,\(\mathbf{z}_i\) 是保持顺序的压缩工具序列,\(\mathbf{p}_i\) 是参数提示,\(\mathbf{b}_i\) 是注意事项,\(Q_i\) 是来源,\(n_i^+,n_i^-\) 是成功/失败计数。去除重复工具名可以将可复用工作流结构与数据扩展后的重复区分开。
对于检索,每个工作流被转换为一个异构 text-sy相似文章
FORGE:通过群体广播实现无需权重更新的自演化智能体记忆
FORGE是一种协议,使LLM智能体能够通过群体广播无需权重更新地演化其记忆,将失败轨迹转化为可复用的知识构件。在CybORG CAGE-2网络防御任务中,相较于零样本和Reflexion基线,该协议在多个LLM家族上显著提升了性能。
地理空间基础模型的新兴范式:从预训练到智能体推理
本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。
MemoryForge:为类人LLM智能体合成终身记忆
本文介绍了MemoryForge,一个从简短目标人设中合成终身自传体记忆的框架,使冻结的LLM能够在角色扮演和用户模拟中表现出更类人的行为,优于描述性条件化基线。
ExpGraph:面向LLM智能体的模型无关经验学习与图结构记忆
ExpGraph是一个模型无关的框架,通过自进化的技能与失败经验图,使LLM智能体能够复用过往经验,在不重新训练执行器的情况下将任务性能提升12%-21%。
Agent-World:面向演进式通用智能体的现实世界环境合成扩展
# 论文页面 - Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 来源:[https://huggingface.co/papers/2604.18292](https://huggingface.co/papers/2604.18292) 发布于 4 月 20 日 · 提交者[https://huggingface.co/dongguanting](https://huggingface.co/dongguanting) [](https://huggingface.co/dongguanting) [KABI](https://huggingface.co/donggua