面向语言智能的可扩展视觉预训练
摘要
本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。
查看缓存全文
缓存时间: 2026/07/13 07:50
论文页面 - 面向语言智能的可扩展视觉预训练
来源:https://huggingface.co/papers/2607.09657 发布于 7月10日
#3 今日论文 (https://huggingface.co/papers/date/2026-07-13) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
大型基础模型的快速进展主要得益于大规模文本语料库上的预训练。然而,许多形式的知识是通过视觉表征传递的——图表、排版公式和页面布局承载着丰富的信息,单靠文本无法忠实地或完整地捕捉。但当前的预训练方法丢弃了这些视觉线索,通过将视觉丰富的来源(如文档和网页)转换为纯文本来学习语言智能。本文挑战了语言模型必须在纯文本表示上训练的默认假设,并展示了视觉预训练是一种可扩展的基础模型智能学习器。为此,我们系统地研究了无监督视觉预训练范式,该范式直接利用视觉文档而不进行文本提取。在多种骨干网络和基准测试中,基于相同语料库的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了一条高效的路径。
查看 arXiv 页面 (https://arxiv.org/abs/2607.09657)
查看 PDF (https://arxiv.org/pdf/2607.09657)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2607.09657)
引用此论文的模型0
没有模型链接此论文
请在模型 README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。
引用此论文的数据集0
没有数据集链接此论文
请在数据集 README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。
引用此论文的 Space0
没有 Space 链接此论文
请在 Space README.md 中引用 arxiv.org/abs/2607.09657 以将其链接至此页面。
包含此论文的合集1
相似文章
通过无监督学习改进语言理解
OpenAI 提出了一种两阶段方法来改进语言理解:首先在大规模无监督数据集上使用语言建模对 transformer 模型进行预训练,然后在较小的有监督数据集上针对特定任务进行微调。该方法在包括常识推理、语义相似度和阅读理解在内的多种任务上取得了最先进的成果,同时需要的超参数调优工作最少。
@lukaskuhn77: 我们推出了LeVLJEPA:首个完全非对比的端到端视觉语言预训练方法,性能可与C…相竞争。
LeVLJEPA是首个完全非对比的端到端视觉语言预训练方法,无需负样本、温度参数或动量编码器,性能即可与CLIP和SigLIP相媲美。它通过跨模态预测(使用停止梯度目标)和每模态分布正则化进行学习,为下游任务(如VLM主干网络和语义分割)提供更强的密集语义特征。
哪种预训练范式更能服务于空间智能?视觉语言模型与视频生成模型的实证比较
本文通过系统性的冻结特征探测研究,比较了视觉语言模型(VLMs)和视频生成模型(VGMs)在空间智能任务上的表现。研究发现,VLMs在语义标签和实例分组方面表现优异,而VGMs则提供更好的密集几何和相机运动信号。两种模型的简单融合在所有维度上均展现出强劲性能。
MonkeyOCRv2: 用于文档AI的视觉-文本基础模型
MonkeyOCRv2是一个用于文档AI的视觉-文本基础模型,在涵盖17种语言的1.13亿张图像的大规模语料库上进行了预训练,采用联合图像到文本生成和像素级文档重建。它在文档解析和理解任务上取得了最先进的结果,以更小的视觉编码器超越了之前的模型。
Stateful Visual Encoders for Vision-Language Models
本文介绍了一种用于视觉-语言模型的有状态视觉编码器,该编码器基于先前的特征来调节视觉表示,从而在多图像和智能体设置中实现更好的视觉比较。该方法在跨图像空间聚合、纵向放射学等任务上展现出一致的改进。