面向语言智能的可扩展视觉预训练

Hugging Face Daily Papers 论文

摘要

本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。

大型基础模型的快速发展主要得益于在大规模文本语料库上的预训练。然而,许多形式的知识通过视觉表征传递,其中图表、排版公式和页面布局蕴含着丰富的信息,这些信息无法仅通过文本忠实或完整地捕捉。然而,当前的预训练方法通过将文档和网页等视觉丰富的来源转换为纯文本来学习语言智能,从而丢弃了这些视觉线索。本文挑战了语言模型必须基于纯文本表示进行训练的默认假设,并展示了Visual Pretraining是基础模型智能的一种可扩展学习器。为此,我们对无监督视觉预训练范式进行了系统研究,这些范式直接利用视觉文档而无需文本提取。在多个主干网络和基准测试中,相同底层语料库上的视觉预训练持续优于纯文本预训练,为可扩展的语言智能提供了一条高效路径。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:50

论文页面 - 面向语言智能的可扩展视觉预训练

来源:https://huggingface.co/papers/2607.09657 发布于 7月10日

#3 今日论文 (https://huggingface.co/papers/date/2026-07-13) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

大型基础模型的快速进展主要得益于大规模文本语料库上的预训练。然而,许多形式的知识是通过视觉表征传递的——图表、排版公式和页面布局承载着丰富的信息,单靠文本无法忠实地或完整地捕捉。但当前的预训练方法丢弃了这些视觉线索,通过将视觉丰富的来源(如文档和网页)转换为纯文本来学习语言智能。本文挑战了语言模型必须在纯文本表示上训练的默认假设,并展示了视觉预训练是一种可扩展的基础模型智能学习器。为此,我们系统地研究了无监督视觉预训练范式,该范式直接利用视觉文档而不进行文本提取。在多种骨干网络和基准测试中,基于相同语料库的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效的路径。

查看 arXiv 页面 (https://arxiv.org/abs/2607.09657)
查看 PDF (https://arxiv.org/pdf/2607.09657)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09657)

引用此论文的模型0

没有模型链接此论文

请在模型 README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。

引用此论文的数据集0

没有数据集链接此论文

请在数据集 README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。

引用此论文的 Space0

没有 Space 链接此论文

请在 Space README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。

包含此论文的合集1

相似文章

通过无监督学习改进语言理解

OpenAI Blog

OpenAI 提出了一种两阶段方法来改进语言理解:首先在大规模无监督数据集上使用语言建模对 transformer 模型进行预训练,然后在较小的有监督数据集上针对特定任务进行微调。该方法在包括常识推理、语义相似度和阅读理解在内的多种任务上取得了最先进的成果,同时需要的超参数调优工作最少。

@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。

X AI KOLs Following

LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。

MonkeyOCRv2: 用于文档AI的视觉-文本基础模型

Hugging Face Daily Papers

MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。

Stateful Visual Encoders for Vision-Language Models

Hugging Face Daily Papers

本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。