星系的分词器指南:科学基础模型的基准测试
摘要
本文在统一的transformer框架内,比较了四种分词方法(Affine、AIM、JetFormer、VQ-VAE)用于天文图像,使用64万张星系图像评估重构质量、物理属性预测和形态保持能力。研究发现,没有单一方法在所有任务中表现最佳,突显了表示学习中的权衡。
查看缓存全文
缓存时间: 2026/06/29 18:04
论文页面 - 《银河系分词器指南:科学基础模型的基准测试》
来源:https://huggingface.co/papers/2606.25610
摘要
针对天文图像的四种分词方法在重建质量、物理属性预测及形态保留方面展现出不同的优势,没有任何单一方法能在所有任务上表现卓越。
分词(https://huggingface.co/papers?q=Tokenization)是将科学数据适配到基于变换器的基础模型(https://huggingface.co/papers?q=transformer-based%20foundation%20models)的核心环节,但其对学习表征的影响仍不明确。我们在一套统一的变换器框架内,针对天文成像(https://huggingface.co/papers?q=astronomical%20imaging)任务,比较了四种分词(https://huggingface.co/papers?q=tokenization)策略:Affine、AIM、JetFormer 和 VQ-VAE(https://huggingface.co/papers?q=VQ-VAE)。利用来自 DESI 遗产巡天(https://huggingface.co/papers?q=DESI%20Legacy%20Survey)的 64 万张星系图像,并共享同一 AstroPT 骨干网络(https://huggingface.co/papers?q=AstroPT%20backbone),我们评估了每种方法在重建保真度(https://huggingface.co/papers?q=reconstruction%20fidelity)和物理属性(https://huggingface.co/papers?q=physical%20properties)预测方面的表现。我们的结果揭示了各方法之间的权衡:基于流的 JetFormer(https://huggingface.co/papers?q=flow-based)实现了更高的重建质量,而 VQ-VAE(https://huggingface.co/papers?q=VQ-VAE)在星系物理属性(https://huggingface.co/papers?q=physical%20properties)的探针性能上表现强劲。Affine 和 AIM 则更好地保留了局部形态信息(https://huggingface.co/papers?q=morphological%20information)。我们发现重建质量与表征质量是解耦的,没有任何单一方法能够在我们所考虑的所有任务上持续表现最佳。通过将评估建立在独立测量的物理量基础上,我们希望本研究能凸显科学数据作为构建可解释基础模型基准的潜力。
查看 arXiv 页面(https://arxiv.org/abs/2606.25610)查看 PDF(https://arxiv.org/pdf/2606.25610)GitHub48(https://github.com/smith42/astropt)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.25610)
在您的 Agent 中获取此论文:
hf papers read 2606\.25610
没有最新 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型:0
没有模型链接到此论文
请在模型 README.md 中引用 arxiv.org/abs/2606.25610 以从此页面建立链接。
引用此论文的数据集:0
没有数据集链接到此论文
请在数据集 README.md 中引用 arxiv.org/abs/2606.25610 以从此页面建立链接。
引用此论文的 Spaces:0
没有 Space 链接到此论文
请在 Space README.md 中引用 arxiv.org/abs/2606.25610 以从此页面建立链接。
包含此论文的收藏集:0
没有包含此论文的收藏集
请将此论文添加到一个收藏集(https://huggingface.co/new-collection)以从此页面建立链接。
相似文章
优质令牌狩猎:视觉几何变换器中令牌选择的搭车指南
本文提出了一种用于视觉几何变换器的两阶段令牌选择框架,通过在全局注意力中限制键/值令牌来降低计算成本,在包含500张图像的场景上实现了超过85%的加速,同时保持了基线性能。
KVAE:用于多模态生成模型的系列分词器
本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。
从二维网格到一维标记:改革多模态图像融合的共享表示
本文提出了一种多模态图像融合方法,该方法使用来自预训练图像标记器的一维标记接口,通过选择性标记编辑(STE)来增强全局外观一致性,同时保留局部细节。在四个基准上的实验表明,该方法在全局一致性和局部保真度方面均达到了最先进性能。
场景即对象,而非基元:来自无位姿视图的实例结构化3D令牌化
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
当分词与语言建模联合优化时,会学习到哪些词元?
本文研究了当分词与语言建模联合优化时所学习到的词元,比较了跨多种语言的无分词器方法,发现它们为自然语言处理生成了独特而高效的词汇表。