无人知晓地理空间基础模型的最新进展
摘要
本文对152篇关于地理空间基础模型的论文进行了审查,发现严重缺乏标准化,导致无法确定最先进水平。作者提出了六项具体期望,以提高可重复性和可比性。
查看缓存全文
缓存时间: 2026/05/18 22:28
论文页面 - 无人知晓地理空间基础模型的最新技术水平
来源:https://huggingface.co/papers/2605.12678
摘要
地理空间基础模型缺乏标准化的评估和报告实践,导致性能比较不一致,并限制了跨研究的可重复性。
地理空间基础模型(https://huggingface.co/papers?q=Geospatial%20foundation%20models)(GFMs)被提出作为通用骨干网络,用于灾害响应(https://huggingface.co/papers?q=disaster%20response)、土地利用制图(https://huggingface.co/papers?q=land-cover%20mapping)、粮食安全监测(https://huggingface.co/papers?q=food-security%20monitoring)以及其他高风险地球观测任务。然而,关于这些模型的已发表工作并未向审稿人或用户提供足够的信息来判断哪个模型适合特定任务。我们认为,目前无人知晓地理空间基础模型(https://huggingface.co/papers?q=geospatial%20foundation%20models)的最新技术水平。这些方法可能有用,但GFM文献并未充分标准化评估、训练和测试协议、已发布权重或预训练控制(https://huggingface.co/papers?q=pretraining%20controls),使任何人都无法对它们进行比较或排名。在一项涉及152篇论文的审计中,我们发现了46处同一模型、基准和协议下至少10个百分点的跨论文分歧;在可提取预训练数据的126篇论文中,有94篇使用的配置是其他论文从未使用过的;39%的GFM论文未发布模型权重(https://huggingface.co/papers?q=model%20weights)。这种社区标准的缺失是可以解决的。我们提出了六项具体期望:具名许可协议的权重发布、共享核心评估、复制与重跑基线的标注、方差报告、一个共享评估框架,以及数据、架构与算法的控制变量。这些差距是协调失败造成的,而非任何单个实验室的过错;本文作者与GFM社区中的许多其他人一样,也对此有所贡献。我们不仅仅批评社区,更旨在提供具体步骤,以期达成对如何创新GFM的共识。
查看 arXiv 页面(https://arxiv.org/abs/2605.12678)查看 PDF(https://arxiv.org/pdf/2605.12678)GitHub13(https://github.com/taylor-geospatial/gfm-leaderboard)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.12678)
在你的agent中获取此论文:
hf papers read 2605.12678
没有最新CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型0
无模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2605.12678 以从此页面建立链接。
引用此论文的数据集0
无数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.12678 以从此页面建立链接。
引用此论文的 Spaces0
无 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2605.12678 以从此页面建立链接。
包含此论文的收藏0
无收藏包含此论文
将此论文添加到一个收藏(https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
地理空间基础模型的新兴范式:从预训练到智能体推理
本文综述了地理空间基础模型(GeoFMs)的新兴范式,这些模型在海量地理空间数据集上进行预训练,以实现对卫星和航空影像的快速微调和零样本分析。内容涵盖范式转变、模型适配策略,以及以大语言模型(LLMs)为编排器的智能体地理空间推理的前瞻性愿景。
可扩展且可信的地球观测基础模型
本章回顾了地球观测基础模型的设计原则和当前格局,强调了领域特定适应、物理上合理的表示以及一致评估基准的必要性。包含关于有害藻华预测和自适应监测站点选择的案例研究。
大型语言模型的地理空间概念探测:抽象性、组合性与接地
本文引入了一个以概念为中心的基准,用于探测LLM对方向、距离和拓扑等地理空间概念的理解,测试不同模型架构和规模下的抽象性、组合性与接地性。研究结果揭示了当前LLM在概念理解上的明显局限。
SpatialBench: 你的空间基础模型是全能选手吗?
SpatialBench是一个综合基准,用于评估跨不同领域和任务的空间基础模型,揭示了当前模型的局限性,并引入了DA-Next-5M和DA-Next以推动空间表示学习。
立场:当前模型卡片不足以支持开放权重基础模型的下游治理
本立场论文分析了Hugging Face上的500份模型卡片,认为当前模型卡片不足以支持开放权重基础模型的下游治理,并提出了一个整合模型卡片、可接受使用政策和许可证的框架。