TESSERA v2:扩展像素级地球基础模型

Hugging Face Daily Papers 论文

摘要

该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。

像素级地球观测(EO)基础模型现已通过生成空间嵌入达到最先进性能。然而,这些模型如何扩展以及如何最优地分配预训练预算仍鲜为人知。我们进行了迄今为止最大的EO可控扩展研究:在固定的像素级Barlow Twins框架内,使用1,024个GH200超级芯片进行了395次训练运行,每次运行在15项下游任务上评估。我们发现预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),因此根据损失选择模型会浪费大量算力。我们还发现,随着训练预算增长,编码器和数据应同步增长,而投影器保持不变,这给出了一个简单的算力分配规则。利用该规则,我们训练了一系列像素级模型(0.5B和1B参数,2B模型正在训练中),并将其蒸馏为紧凑的学生模型,用于以嵌入作为数据的部署。参数量为2100万的蒸馏版TESSERA v2-1B-M在总体上优于所有经过测试的开源和专有模型,其中一些模型规模大数个数量级。这些学生模型产生套娃式表示,服务成本低廉:一个16维的前缀保留了完整128维性能的92%,而存储量仅为后者的1/8。训练完成后,我们计划发布覆盖2017-2025年的v2全球嵌入。综合来看,这些结果为扩展像素级EO基础模型提供了具体且基于经验的实用方案:训练大型编码器,根据下游性能进行选择,并蒸馏为灵活的学生模型。所有代码将在https://github.com/ucam-eo/tessera发布。
查看原文
查看缓存全文

缓存时间: 2026/07/09 23:41

论文页面 - TESSERA v2:扩展像素级地球基础模型

来源:https://huggingface.co/papers/2607.03949 作者:

  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,
  • ,

摘要

大规模受控实验揭示了地球观测基础模型的最优扩展策略,通过编码器增长、下游性能选择和模型蒸馏,实现了高效训练和部署。

像素级地球观测(https://huggingface.co/papers?q=Pixel-wise%20Earth-observation)(EO) 基础模型(https://huggingface.co/papers?q=foundation%20models) 目前正通过生成的空间嵌入(https://huggingface.co/papers?q=spatial%20embeddings) 取得最先进性能。然而,这些模型如何扩展以及如何最佳分配预训练预算(https://huggingface.co/papers?q=pretraining%20budget) 仍然知之甚少。我们提出了迄今为止规模最大的 EO 受控扩展研究(https://huggingface.co/papers?q=scaling%20study):在 1,024 个 GH200 超级芯片上运行了 395 次训练实验,均属于固定的像素级 Barlow Twins(https://huggingface.co/papers?q=Barlow%20Twins) 模型族,每次实验在 15 个下游任务(https://huggingface.co/papers?q=downstream%20tasks) 上进行评估。我们发现预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),因此按损失选择模型会浪费很大一部分计算资源。我们还发现,随着训练预算的增加,编码器(https://huggingface.co/papers?q=encoder) 和数据集应同步增长,而投影器(https://huggingface.co/papers?q=projector) 保持固定,这为分配计算资源提供了简单规则。利用这一规则,我们训练了一系列像素级模型(0.5B 和 1B,2B 模型正在训练中),并将其蒸馏为紧凑的学生模型,用于嵌入即数据部署。参数量为 2100 万的蒸馏模型 TESSERA v2-1B-M 在总体性能上超越了所有测试过的开源和商业模型,其中一些模型规模大了数个数量级。这些学生模型生成的 Matryoshka 表示(https://huggingface.co/papers?q=Matryoshka%20representations) 服务成本低廉:一个 16 维前缀即可保留完整 128 维性能的 92%,而存储量仅为后者的 1/8。训练完成后,我们计划发布覆盖 2017-2025 年的 v2 全局嵌入。综合而言,这些结果为扩展像素级 EO 基础模型(https://huggingface.co/papers?q=foundation%20models) 提供了具体、经验验证的配方:训练大型编码器(https://huggingface.co/papers?q=encoder),根据下游性能进行选择,并蒸馏为灵活的学生模型。所有代码将在 https://github.com/ucam-eo/tessera 发布。

查看 arXiv 页面 (https://arxiv.org/abs/2607.03949) 查看 PDF (https://arxiv.org/pdf/2607.03949) 项目页面 (https://geotessera.org/) GitHub635 (https://github.com/ucam-eo/tessera) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03949)

在你的代理中获取本论文:

hf papers read 2607.03949

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型 0

无模型链接到此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。

引用本论文的数据集 0

无数据集链接到此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。

引用本论文的 Space 0

无 Space 链接到此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。

包含本论文的收藏集 0

无收藏集包含本论文

请将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。

相似文章

可扩展且可信的地球观测基础模型

arXiv cs.LG

本章回顾了地球观测基础模型的设计原则和当前格局,强调了领域特定适应、物理上合理的表示以及一致评估基准的必要性。包含关于有害藻华预测和自适应监测站点选择的案例研究。

AlphaEarth Foundations 助力以前所未有的细节映射我们的星球

Google DeepMind Blog

Google DeepMind 推出 AlphaEarth Foundations,一个将数十亿字节的地球观测数据整合为统一嵌入的 AI 模型,可以以 10×10 米的分辨率对地球进行映射和监测。该模型的紧凑表示形式能够实现高效的全球规模分析,应用于粮食安全、森林砍伐追踪和环境监测。