VLMs 是阅读还是改写?关于视觉语言模型转录忠实性的研究
摘要
本文揭示了视觉语言模型在面对错别字或视觉伪影等扰动时,往往会改写文本而非忠实转录,并引入了 FaithC4 基准来评估多种模型和语言中的这种行为。
arXiv:2607.21617v1 Announce Type: cross
摘要:视觉语言模型(VLMs)越来越多地被用于替代传统 OCR 流程进行文档理解。本文表明,它们并不总是充当忠实的转录者:当文本不完美时,它们往往倾向于将其改写成更合理的形式——这一行为是干净文本 OCR 基准无法检测到的。我们引入了 FaithC4,一个多语言扰动基准,包含 1,455 份单页文档(英文、中文、韩文),涵盖三种扰动类型:乱序、随机替换和视觉相似替换。我们使用该基准评估了 15 个系统,涵盖通用 VLMs、OCR 专用 VLMs 和传统 OCR 流程。这三类系统在扰动下的 WER 退化程度不同:在英文上,通用 VLMs 最多退化 4.5 个百分点,OCR 专用 VLMs 退化 0.2-2 个百分点,传统 OCR 退化不到 0.6 个百分点。通过对 Qwen3-VL-4B 进行逐层探查,我们识别出一个一致的模式:只有当扰动词的最后一层 FFN 表示保持接近原始编码时,重写才会触发;当表示足够偏离时,模型会忠实转录。单词长度影响重写率:短词(4-6 个字符)被重写的概率高达 10%,而在 8 个字符以上时,重写率急剧降至 0%。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 视觉语言模型是读取还是重写?——论视觉语言模型中的转录忠实性
**来源:** https://arxiv.org/html/2607.21617
**作者:** Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis
Amazon.com
{gglee, kenanea, jaymoht, yanxuml, dbdim}@amazon.com
###### 摘要
视觉语言模型(VLM)正越来越多地被用于替代传统 OCR 流水线以进行文档理解。在本文中,我们展示它们并非总是忠实的转录者:当文本不完美时,它们常常倾向于将其重写为更合理的形式——这种行文是清洁文本 OCR 基准无法检测到的。我们提出了 **FaithC4**,一个多语言扰动基准,包含 1,455 份单页文档(英语、中文、韩语),带有三种扰动系列:乱序、随机替换和视觉相似替换。我们使用该基准评估了 15 个系统,涵盖通用 VLM、OCR 专用 VLM 和传统 OCR 流水线。这三类在扰动下的词错误率(WER)下降程度不同:在英语上,通用 VLM 下降最多达 4.5 个百分点,OCR 专用 VLM 下降 0.2–2 个百分点,传统 OCR 下降小于 0.6 个百分点。通过逐层探测 Qwen3-VL-4B,我们识别出一个一致的模式:只有当扰动词的最后一层 FFN 表示保持接近原始编码时,重写才会触发;当表示充分偏离时,模型会忠实地转录。单词长度影响重写率:短词(4–6 个字符)被重写的概率高达 10%,在 7 个字符以上时重写率陡降至 0%。
**视觉语言模型是读取还是重写?——论视觉语言模型中的转录忠实性**
Gwang Gook Lee, Kenan Emir Ak, Jay Mohta, Yan Xu, Dimitrios Dimitriadis
Amazon.com
{gglee, kenanea, jaymoht, yanxuml, dbdim}@amazon.com
## 1 引言
视觉语言模型(VLM)[Liu et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib20); [Chen et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib18); [Bai et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib12) 将视觉编码器与大型语言模型(LLM)配对,正越来越多地用于文档理解。在标准光学字符识别(OCR)基准上,VLM 常常匹配或超越传统 OCR 流水线 [Du et al. (2020)](https://arxiv.org/html/2607.21617#bib.bib38); [Mindee (2021)](https://arxiv.org/html/2607.21617#bib.bib42); [Kay (2007)](https://arxiv.org/html/2607.21617#bib.bib31),并且单个 VLM 可以在一个模型内处理文本识别、布局分析和下游任务(如文档问答)。因此,从业者正在越来越多地在一系列文档处理应用中用 VLM 替代传统 OCR 流水线。然而,这种转变引入了一个标准 OCR 基准无法捕捉的问题。
**VLM 倾向于重写文本而不是转录它。** 当输入存在拼写错误、视觉伪影或字符不清晰时,VLM 常常输出它预期看到的内容,而不是实际写的内容。例如,向 VLM 展示拼写错误“prbolem”,它通常返回“problem”。这让人联想到人类阅读中的**字形认知症**(typoglycemia)效应,读者从打乱的字母中恢复含义 [Grainger and Whitney (2004)](https://arxiv.org/html/2607.21617#bib.bib6)。传统 OCR 系统不受此影响,它们可以逐字符转录,并且没有语言模型来覆盖视觉证据。虽然重写行为有助于恢复某些真实错误,但在一些需要逐字转录的领域可能是有问题的,例如法律文档、医疗记录和历史手稿。尽管重要性,这种重写行为在 VLM 研究中很大程度上被忽视了。现有的 OCR 基准 [Liu et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib23); [Ouyang et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib26) 专注于清洁文本识别,因此不足以调查模型如何处理不完美输入。
在这项工作中,我们进行了一个受控的扰动研究,以系统地调查 VLM 中的重写行为。我们的贡献可列举如下:
- • 我们评估了 15 个系统,发现扰动文本会降低转录准确性,其幅度因系统类型而异:通用 VLM(英语上 WER 最多增加 4.5 个百分点)、OCR 专用 VLM(0.2–2 个百分点)和传统 OCR(<<0.6 个百分点)。
- • 这一发现在英语、中文和韩语这三种类型学上不同的文字上都成立,尽管最具破坏性的扰动类型因文字而异。
- • 我们展示了扰动具有非局部效应。用通用 VLM 时,破坏 5% 的词会使未扰动剩余部分的错误率比清洁基线高出 5–10 倍。
- • 通过逐层探测 Qwen3-VL-4B,我们发现当扰动词的内部表示保持接近原始编码时,重写就会触发。单词长度也影响重写:短词(4–6 个字符)被重写的概率高达 10%,在 7 个字符以上时降至 0%。
- • 我们提出了 **FaithC4**,一个包含 1,455 份英语、中文和韩语文档的多语言基准,用于衡量在不完美输入下的转录忠实性,这是清洁文本基准无法捕捉的属性。
## 2 相关工作
#### 视觉语言模型
VLM 将 LLM 扩展到处理视觉输入以及文本。典型的 VLM 由预训练的视觉编码器、语言骨干网络和将图像特征投影到语言嵌入空间的连接器组成 [Yin et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib32)。最近的开源权重系列(LLaVA [Liu et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib20)、InternVL [Chen et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib18); [Wang et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib19)、Qwen-VL [Bai et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib12)、[2025](https://arxiv.org/html/2607.21617#bib.bib13)、Gemma [Kamath et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib45))和商业系统(GPT-4V [Achiam et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib21)、Gemini [Google (2023)](https://arxiv.org/html/2607.21617#bib.bib44))现已在视觉推理、文档理解和接地生成上达到强劲性能。尽管有这些能力,这些模型在不完美文本上的行为尚未被系统研究。我们展示了使强阅读成为可能的相同语言先验,可能在遇到不完美文本时引入静默重写。
#### 光学字符识别
OCR 已经从传统的工程化流水线(如 Tesseract [Kay (2007)](https://arxiv.org/html/2607.21617#bib.bib31) 和 PaddleOCR [Du et al. (2020)](https://arxiv.org/html/2607.21617#bib.bib38))演变为深度学习方法,包括 CRNN [Shi et al. (2016)](https://arxiv.org/html/2607.21617#bib.bib33) 和基于 Transformer 的架构 [Blecher et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib22)。最近,OCR 专用 VLM [Xu et al. (2020)](https://arxiv.org/html/2607.21617#bib.bib34); [Niu et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib10); [Cui et al. (2026)](https://arxiv.org/html/2607.21617#bib.bib15); [Wei et al. (2026)](https://arxiv.org/html/2607.21617#bib.bib8) 结合了视觉编码器与语言模型,代表了文本丰富文档处理的领先方法。虽然现有基准如 DocVQA [Mathew et al. (2021)](https://arxiv.org/html/2607.21617#bib.bib25)、OCRBench [Liu et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib23); [Fu et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib24) 和 OmniDocBench [Ouyang et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib26) 评估文档理解和文本识别,但它们并非设计用于评估模型是忠实转录文本还是静默纠正。
#### 文本扰动的鲁棒性
自然语言处理领域有一系列工作研究模型在扰动文本上的行为。[Belinkov and Bisk (2017)](https://arxiv.org/html/2607.21617#bib.bib46) 展示了机器翻译模型对字符级乱序和噪声高度敏感。后续研究将此分析扩展到文本分类 [Ebrahimi et al. (2018)](https://arxiv.org/html/2607.21617#bib.bib47) 和 BERT 风格编码器 [Pruthi et al. (2019)](https://arxiv.org/html/2607.21617#bib.bib48)。最近,[Cao et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib49) 发现 LLM 可以以接近人类的速率恢复乱序词。我们将这种扰动方法扩展到 OCR 场景,其中模型以图像形式接收扰动文本。与纯文本研究(模型直接看到乱序标记)不同,我们的设置允许我们衡量 VLM 是重写它看到的内容还是忠实转录。
#### 语言模型中的幻觉
幻觉,即生成看似合理但错误的内容,在 LLM 中已被广泛研究 [Maynez et al. (2020)](https://arxiv.org/html/2607.21617#bib.bib27); [Ji et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib28)。在 VLM 中,最近的工作主要集中在物体幻觉上,即模型描述图像中不存在的实体 [Li et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib54); [Guan et al. (2024)](https://arxiv.org/html/2607.21617#bib.bib55); [Wang et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib56)。大多数 VLM 工作研究对抗文本 [Shayegani et al. (2023)](https://arxiv.org/html/2607.21617#bib.bib29) 和排版攻击 [Wang and Ma (2025)](https://arxiv.org/html/2607.21617#bib.bib30)、偏见 [Vo et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib52),以及 VLM 倾向于忽略视觉证据而偏爱语言先验 [Liu et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib51); [Lee et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib53)。转录过程中文本级的幻觉,即模型静默地重写它看到的字符,仍然很大程度上未被探索。
## 3 实验设置
### 3.1 数据集
现有的 OCR 基准使用预先存在的具有固定文本的文档图像,使得目标操作不可行。相反,我们从原始文本开始,应用受控扰动,并将结果渲染为文档图像。扰动文本是 ground truth,这让我们可以衡量模型是忠实转录它们看到的内容,还是静默“重写”它。

我们从 Colossal Clean Crawled Corpus (C4) [Raffel et al. (2020)](https://arxiv.org/html/2607.21617#bib.bib41) 中提取文本,这是一个大规模网络爬取数据集。从其多语言子集 (mC4) 中,我们采样了三种不同语言的文档,即英语 (EN)、中文 (ZH) 和韩语 (KO)。对于每种语言,我们通过选择渲染后适合一页的文本段落来提取单页文档。这产生了 1,455 份文档(500 份英语、500 份中文、455 份韩语),平均英语 600 个词,中文 1,786 个字符,韩语 447 个词。
**表 1:FaithC4 数据集统计信息。** 1,455 份包含密集文本的单页 PDF。8% 的合格 token 受到扰动(根据语言不同,约占所有词的 2–8%)。
我们对 8% 的合格词(长度至少 4 个字符)应用三种类型的字符级扰动,并将未修改的文本保留为控制条件:
- • **原始**:未经修改的文档,作为基线。
- • **乱序**:内部字符被打乱,同时保留首尾字符(例如,“standard” → “sdanartd”)。
- • **随机**:每个字符被替换为同文字的一个随机字母(例如,“standard” → “xkpmewqi”)。
- • **视觉**:字符被替换为视觉上相似的替代(例如,“standard” → “stsndord”)。视觉相似字符列表见 [表 A.1](https://arxiv.org/html/2607.21617#A1.T1)。
每个扰动文本被渲染为单页 PDF 图像(9pt 衬线字体,1.2 倍行高)。生成过程如 [图 1](https://arxiv.org/html/2607.21617#S3.F1) 所示,统计信息汇总于 [表 1](https://arxiv.org/html/2607.21617#S3.T1)。有效扰动率因语言而异,因为合格性取决于文字。在英语中,扰动 8% 的合格词会修改 4.7% 的所有 token。在中文中,由于缺乏词边界,我们对不重叠的 4 字符窗口应用随机和视觉扰动,修改了 8% 的字符;省略了乱序扰动。在韩语中,只有 2.2% 的词被修改,因为许多韩语词低于 4 字符的最小长度。详见 [附录 A](https://arxiv.org/html/2607.21617#A1)。
### 3.2 模型
我们评估了 15 个模型,跨越三个类别:
- • **通用 VLM**:开源权重(Qwen3.5-4B [Team (2026)](https://arxiv.org/html/2607.21617#bib.bib50)、Qwen3-VL-4B [Bai et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib13)、InternVL3.5-4B [Wang et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib19)、Gemma4-E4B 和 -E2B [Google DeepMind (2026)](https://arxiv.org/html/2607.21617#bib.bib57); [Kamath et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib45))和闭源权重(GPT-5.4-mini [Singh et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib58)、Gemini-3-Flash、Gemini-2.5-Flash [Google (2023)](https://arxiv.org/html/2607.21617#bib.bib44))模型。
- • **OCR 专用 VLM**:专门针对文档文本提取进行训练或微调的模型(olmOCR-2-7B [Poznanski et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib36)、DeepSeek-OCR-2 [Wei et al. (2026)](https://arxiv.org/html/2607.21617#bib.bib8)、MinerU2.5-Pro [Niu et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib10)、PaddleOCR-VL-1.5 [Cui et al. (2026)](https://arxiv.org/html/2607.21617#bib.bib15)、LightOnOCR-2-1B [Taghadouini et al. (2025)](https://arxiv.org/html/2607.21617#bib.bib43))。
- • **传统 OCR**:字符级识别流水线(Tesseract [Kay (2007)](https://arxiv.org/html/2607.21617#bib.bib31)、docTR [Mindee (2021)](https://arxiv.org/html/2607.21617#bib.bib42))。
这些类别在多大程度上依赖语言先验方面有所不同。通用 VLM 从广泛的文本预训练中携带强先验,OCR 专用 VLM 在经过文档聚焦的微调后保留较弱的先验,而传统 OCR 系统基本没有先验。
#### 文本提取
我们对通用 VLM 使用统一的提取提示:
提取提示:“Extract all text from this document image. Output document text only.”
我们没有提供关于如何处理扰动文本的显式指令,允许每个模型自然展示其行为。OCR 专用模型使用其推荐提示(见 [附录 B](https://arxiv.org/html/2607.21617#A2))。
### 3.3 评估指标
我们用两个互补的指标评估 OCR 忠实性:词错误率 (WER) 用于对顺序敏感的词语级准确性,以及编辑距离相似度 (EDS) 用于与参考在字符级上的相似性。
#### 词错误率 (WER)
我们的主要指标是参考序列与预测序列之间的最小编辑距离,分解为替换 (S)、删除 (D) 和插入 (I):
\[
\text{WER} = \frac{S + D + I}{N} \quad (1)
\]
其中 \(N\) 是参考中的 token 数量。分词基于空格。相似文章
拆解病态捷径:用于忠实LVLM解码的因果框架
本文揭示了大视觉语言模型中的幻觉是由一种动态结构错位引起的,其中某些注意力头充当风险中介,与视觉证据解耦,转而锁定语言先验。作者提出了Fox,一种无需训练的因果干预框架,能够诊断并物理切断这些病态捷径,在忠实解码中实现了最先进的性能。
大型视觉-语言模型在注意力机制中迷失
这篇研究论文利用信息论分析了大型视觉-语言模型(LVLM)的内部机制,揭示了注意力机制可能存在冗余,而前馈网络才是推动语义创新的关键。作者证明,将学习到的注意力权重替换为随机值仍可获得相当的性能,这表明当前模型“在注意力中迷失”。
小型视觉-语言模型知道自己错了但说不出来:一项关于在现实图像退化下陈述信心与内部信心的双模型研究
本文评估了小型开源视觉-语言模型(Qwen2-VL-2B和SmolVLM)如何处理现实图像退化,发现它们口头表达的信心不可靠,而内部令牌概率提供了更好的错误检测能力,尽管两者在严重低光条件下均失败。
视觉语言模型是在“看”还是在“猜”?通过措辞控制的基准测试衡量并减少对文本先验的依赖
本文介绍了一个措辞控制的基准测试,用于衡量视觉语言模型在多大程度上依赖文本先验而非图像内容。在十一个模型上的实验表明,当文本泄漏最小时,性能显著下降,作者证明上下文学习和GRPO后训练可以减少这种依赖。
CaVe-VLM-CoT:一个可解释的视觉-语言模型框架
CaVe-VLM-CoT是一个基于模块化反思的智能体RAG框架,专为视觉-语言模型设计,通过五阶段流水线强制执行基于证据的推理,在ScienceQA上达到87.1%的准确率,并提出了一套包含23项指标的评估体系。