TESSERA v2:扩展像素级地球基础模型
摘要
该论文介绍了迄今为止最大的地球观测基础模型可控扩展研究,展示了预训练损失对下游性能的预测能力较差,并提供了最优计算资源分配规则。它训练了扩展的像素级模型(0.5B和1B参数),并将其蒸馏为紧凑的学生模型,这些模型优于更大的开源和专有模型。
查看缓存全文
缓存时间: 2026/07/09 23:41
论文页面 - TESSERA v2:扩展像素级地球基础模型
来源:https://huggingface.co/papers/2607.03949 作者:
- ,
- ,
- ,
- ,
- ,
- ,
- ,
- ,
- ,
- ,
- ,
- ,
摘要
大规模受控实验揭示了地球观测基础模型的最优扩展策略,通过编码器增长、下游性能选择和模型蒸馏,实现了高效训练和部署。
像素级地球观测(https://huggingface.co/papers?q=Pixel-wise%20Earth-observation)(EO) 基础模型(https://huggingface.co/papers?q=foundation%20models) 目前正通过生成的空间嵌入(https://huggingface.co/papers?q=spatial%20embeddings) 取得最先进性能。然而,这些模型如何扩展以及如何最佳分配预训练预算(https://huggingface.co/papers?q=pretraining%20budget) 仍然知之甚少。我们提出了迄今为止规模最大的 EO 受控扩展研究(https://huggingface.co/papers?q=scaling%20study):在 1,024 个 GH200 超级芯片上运行了 395 次训练实验,均属于固定的像素级 Barlow Twins(https://huggingface.co/papers?q=Barlow%20Twins) 模型族,每次实验在 15 个下游任务(https://huggingface.co/papers?q=downstream%20tasks) 上进行评估。我们发现预训练损失几乎无法预测下游性能(|Pearson r| < 0.2),因此按损失选择模型会浪费很大一部分计算资源。我们还发现,随着训练预算的增加,编码器(https://huggingface.co/papers?q=encoder) 和数据集应同步增长,而投影器(https://huggingface.co/papers?q=projector) 保持固定,这为分配计算资源提供了简单规则。利用这一规则,我们训练了一系列像素级模型(0.5B 和 1B,2B 模型正在训练中),并将其蒸馏为紧凑的学生模型,用于嵌入即数据部署。参数量为 2100 万的蒸馏模型 TESSERA v2-1B-M 在总体性能上超越了所有测试过的开源和商业模型,其中一些模型规模大了数个数量级。这些学生模型生成的 Matryoshka 表示(https://huggingface.co/papers?q=Matryoshka%20representations) 服务成本低廉:一个 16 维前缀即可保留完整 128 维性能的 92%,而存储量仅为后者的 1/8。训练完成后,我们计划发布覆盖 2017-2025 年的 v2 全局嵌入。综合而言,这些结果为扩展像素级 EO 基础模型(https://huggingface.co/papers?q=foundation%20models) 提供了具体、经验验证的配方:训练大型编码器(https://huggingface.co/papers?q=encoder),根据下游性能进行选择,并蒸馏为灵活的学生模型。所有代码将在 https://github.com/ucam-eo/tessera 发布。
查看 arXiv 页面 (https://arxiv.org/abs/2607.03949) 查看 PDF (https://arxiv.org/pdf/2607.03949) 项目页面 (https://geotessera.org/) GitHub635 (https://github.com/ucam-eo/tessera) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.03949)
在你的代理中获取本论文:
hf papers read 2607.03949
没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用本论文的模型 0
无模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。
引用本论文的数据集 0
无数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。
引用本论文的 Space 0
无 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.03949 以从此页面链接。
包含本论文的收藏集 0
无收藏集包含本论文
请将本论文添加到收藏集 (https://huggingface.co/new-collection) 以从此页面链接。
相似文章
可扩展且可信的地球观测基础模型
本章回顾了地球观测基础模型的设计原则和当前格局,强调了领域特定适应、物理上合理的表示以及一致评估基准的必要性。包含关于有害藻华预测和自适应监测站点选择的案例研究。
AlphaEarth Foundations 助力以前所未有的细节映射我们的星球
Google DeepMind 推出 AlphaEarth Foundations,一个将数十亿字节的地球观测数据整合为统一嵌入的 AI 模型,可以以 10×10 米的分辨率对地球进行映射和监测。该模型的紧凑表示形式能够实现高效的全球规模分析,应用于粮食安全、森林砍伐追踪和环境监测。
关于PEFT的规模化:迈向万亿参数的百万个性化模型
本文探索将参数高效微调(PEFT)用作持久化个性化模型的紧凑基底,研究了向上、向下和向外扩展,并介绍了用于管理适配器的MinT。
ScaleToT: 泛化结构化LLM推理以用于十亿级低活跃用户建模
ScaleToT提出了一种方法,旨在将结构化LLM推理泛化到十亿级低活跃用户建模中,通过思维树(ToT)精炼和训练学生模型来降低成本。在广告部署中的在线A/B测试显示,LT30提升了6.738%。
@ClementDelangue: 缩放定律终于适用于时间序列基础模型了吗?今天,@datadoghq 正在发布 Toto 2.0 权重……
Datadog 发布 Toto 2.0,这是一个开源权重的时间序列基础模型系列,参数规模从 4M 到 2.5B,在三个基准测试上取得了最先进的结果。这些模型展示了时间序列的缩放定律,随着参数数量的增加性能可预测地提升。