tencent/EVIE-Preview-4.5B · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

EVIE-Preview-4.5B 是一款来自Tencent的最先进的多语言视觉文档检索模型,采用ColBERT风格的晚期交互,在ViDoRe基准测试中表现领先,使用128维的token嵌入。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/08/17 14:34

tencent/EVIE-Preview-4.5B · Hugging Face

来源:https://huggingface.co/tencent/EVIE-Preview-4.5B

https://huggingface.co/tencent/EVIE-Preview-4.5B#overview概述

EVIE-Preview-4.5B 是基于 Qwen3.5-4B 构建的最新多语言视觉文档检索(VDR)模型。它采用了 ColBERT 风格的后期交互机制,并原生支持 128 维多向量标记嵌入(参数量 4.54B,BF16 格式)。

通过将原生的 GatedDeltaNet 线性注意力与全注意力混合建模相结合,并配备紧凑的视觉投影层,EVIE 在 ViDoRe V1+V2 和 ViDoRe V3 基准测试中均达到了顶级性能,同时生成紧凑的 128 维多向量表示。

注意:这是一个预览版本。EVIE 的下一个迭代版本尚待发布。

https://huggingface.co/tencent/EVIE-Preview-4.5B#key-highlights核心亮点

  • 🎯 超紧凑 128 维标记向量:原生 128 维多向量表示使每个标记向量在保持强大检索能力的同时保持狭窄。
  • 🏆 ViDoRe 基准测试的 SOTA:在 ViDoRe V3 上超越了更大的 8B 模型(在 8 个公开领域中的 7 个 领先),并在 ViDoRe V1+V2 上取得了最高的平均准确率(85.93 nDCG@5)。
  • 🌐 强大的多语言与多格式支持:在多种语言(EN、FR、DE、IT、ES、PT、ZH 等)和视觉格式(图表、表格、科学报告、财务文件)上具有强大的零样本泛化能力。
  • ⚡ 无缝的 ColPali 兼容性:完全集成了标准的 colpali-engine 生态系统和后期交互评分管道。

https://huggingface.co/tencent/EVIE-Preview-4.5B#architecture架构

文本查询 ───────► ColQwen3_5(双向注意力) ─────► 查询标记嵌入(128维)
                                                                 │
                                                      后期交互(最大相似度) ──► 相关性分数
                                                                 │
文档图像 ─────► ColQwen3_5(动态视觉) ──► 文档标记嵌入(128维)
  1. 视觉-语言骨干网络:基于 Qwen3.5-4B 构建,采用交错的线性注意力和全注意力层。
  2. 紧凑投影层:将上下文标记状态直接投影到 128 维表示中。
  3. 后期交互检索:通过查询标记与文档视觉标记之间的标记级最大相似度算子计算相似度。

https://huggingface.co/tencent/EVIE-Preview-4.5B#benchmark-results基准测试结果

https://huggingface.co/tencent/EVIE-Preview-4.5B#model-footprint模型足迹

相对宽度比较了一个标记向量的原生未压缩宽度与 EVIE 的 128 维输出。这不是总索引大小的比较:总存储量还取决于每页向量数、数据精度、投影或压缩设置以及索引开销。


https://huggingface.co/tencent/EVIE-Preview-4.5B#vidore-v3-8-public-domains-ndcg10ViDoRe V3:8 个公开领域(nDCG@10)

在跨越 6 种语言(EN、FR、DE、IT、PT、ES)查询的 8 个领域中进行评估:

模型平均分计算机科学能源金融(EN)金融(FR)人力资源工业制药物理EVIE-Preview-4.5B64.4080.3371.4567.68****53.0165.6557.4868.6650.96nemotron-colembed-vl-8b-v263.5479.3069.8267.2951.5466.3256.0367.1950.84tomoro-colqwen3-embed-8b61.6075.3568.4165.0849.1063.9854.4166.3650.13nemotron-colembed-vl-4b-v261.4278.5667.4865.0249.0162.3953.9166.1048.86tomoro-colqwen3-embed-4b60.1675.4466.4363.8446.8360.0953.5865.7449.32llama-nemotron-colembed-vl-3b-v259.7077.0964.8864.2344.4162.2851.7166.0446.93colnomic-embed-multimodal-7b57.6476.2063.5856.5745.4658.6750.1362.2648.25jina-embeddings-v457.5471.8163.5059.3046.1059.5350.3863.0946.63

🏆结果:EVIE 在 ViDoRe V3 的 8 个公开领域中的 7 个 领先。


https://huggingface.co/tencent/EVIE-Preview-4.5B#vidore-v1–v2-ndcg5ViDoRe V1 + V2(nDCG@5)

模型平均分ArxivQADocVQAInfoVQAShiftProjSynAISynEnergySynGovSynHealthTabfquadTatdqaBioMedESGHLESGEconEVIE-Preview-4.5B****85.991.562.993.094.0100.099.0****98.998.997.581.671.080.166.3****68.3Ops-Colqwen3-4B84.991.866.594.090.899.697.398.099.693.682.465.578.666.064.5nemotron-colembed-vl-8b-v284.893.168.194.693.3100.097.998.999.697.783.466.273.260.660.8nemotron-colembed-vl-4b-v283.992.067.493.392.399.396.298.098.598.181.264.371.461.560.8colqwen3.5-4.5B-v383.791.966.693.690.2100.097.197.398.995.984.065.373.858.059.9llama-nemotron-colembed-vl-3b-v283.690.467.294.792.0100.098.098.098.997.381.063.273.158.658.6tomoro-colqwen3-embed-8b83.591.266.494.587.999.396.797.699.194.280.965.576.060.759.5EvoQwen2.5-VL-Retriever-7B-v183.491.565.194.188.899.696.696.398.993.682.365.277.059.759.1tomoro-colqwen3-embed-4b83.290.666.394.387.499.396.997.299.694.379.965.474.662.456.3llama-nemoretriever-colembed-3b-v183.188.466.294.990.799.696.697.899.395.980.662.775.457.457.8SauerkrautLM-ColQwen3-8b-v0.182.993.864.794.590.498.696.596.899.392.284.063.370.857.958.0 平均分:所有 14 个任务的未加权平均值。任务 1–10:ViDoRe V1。任务 11–14:ViDoRe V2。


https://huggingface.co/tencent/EVIE-Preview-4.5B#quick-start快速开始

https://huggingface.co/tencent/EVIE-Preview-4.5B#installation安装

pip install -r requirements.txt

https://huggingface.co/tencent/EVIE-Preview-4.5B#python-inferencePython 推理

import torch
from PIL import Image
from colpali_engine.models import ColQwen3_5, ColQwen3_5Processor

# 使用 Hugging Face 模型仓库或本地目录
model_id = "tencent/EVIE-Preview-4.5B"

# 1. 加载模型并启用双向注意力
model = ColQwen3_5.from_pretrained(
    model_id,
    torch_dtype=torch.bfloat16,
    device_map="cuda",
    attn_implementation="flash_attention_2",
).eval()
model.enable_bidirectional_attention()

# 2. 加载处理器
processor = ColQwen3_5Processor.from_pretrained(model_id)

# 3. 准备输入
images = [Image.open("document_page.png")]
queries = ["What key insights are presented on this page?"]

image_batch = processor.process_images(images).to(model.device)
query_batch = processor.process_queries(queries).to(model.device)

# 4. 生成多向量嵌入并评分
with torch.inference_mode():
    image_embeddings = model(**image_batch)
    model.rope_deltas = None  # 在查询前向传播前需要重置
    query_embeddings = model(**query_batch)

scores = processor.score(query_embeddings, image_embeddings)
print("后期交互检索分数:", scores)

⚠️重要提示:要复现检查点的完整检索性能,必须调用 model.enable_bidirectional_attention() 并在查询前向传播前重置 model.rope_deltas = None

https://huggingface.co/tencent/EVIE-Preview-4.5B#cli-scoring-toolCLI 评分工具

您也可以直接使用包含的 infer.py (https://huggingface.co/tencent/EVIE-Preview-4.5B/blob/main/infer.py) 脚本:

python infer.py --query "季度收入报告" --image document_page_1.png --image document_page_2.png

https://huggingface.co/tencent/EVIE-Preview-4.5B#reproducing复现

在所有可见 GPU 上运行端到端评估基准测试:

bash reproduce.sh

https://huggingface.co/tencent/EVIE-Preview-4.5B#notes说明

  • 自动数据集下载:首次运行时,reproduce.sh 会自动调用 download_data.py (https://huggingface.co/tencent/EVIE-Preview-4.5B/blob/main/download_data.py),从 Hugging Face 获取 22 个公开的 ViDoRe 数据集(约 55 GB)。
  • 自定义数据集路径:要复用现有的数据集目录,可直接指定路径:bash reproduce.sh /path/to/vidore
  • 目标汇总指标
ViDoRe V1        nDCG@5    91.72  (10 个任务)
ViDoRe V2        nDCG@5    71.44  (4 个任务)
ViDoRe V1+V2     nDCG@5    85.93  (14 个任务)
ViDoRe V3 公开领域 nDCG@10   64.40  (8 个领域 × 6 种语言)

https://huggingface.co/tencent/EVIE-Preview-4.5B#training-details训练详情

EVIE 在大约 80 万高质量图像-查询对上进行了训练,覆盖了多语言文档、技术报告、复杂财务表格、信息图表和文档视觉问答。

https://huggingface.co/tencent/EVIE-Preview-4.5B#hard-negative-mining–data-filtering困难负例挖掘与数据过滤

  • 动态挖掘与验证:使用中间检索器主动挖掘困难负例并重新验证:
    • 能准确回答查询的候选样本被提升为 正例
    • 部分相关或模糊的候选样本从损失函数中 屏蔽
    • 仅严格不相关的页面被保留为真正的 困难负例
  • 质量过滤:系统性地丢弃包含空查询、损坏图像或退化文本的数据行。

https://huggingface.co/tencent/EVIE-Preview-4.5B#acknowledgements致谢

  • 基于 Illuin Technology 开发的 ColPali Engine (https://github.com/illuin-tech/colpali) 构建。
  • 由 Qwen3.5-4B (https://huggingface.co/Qwen/Qwen3.5-4B) 视觉-语言骨干网络提供支持。
  • 在 ViDoRe Benchmark (https://huggingface.co/vidore) 系列上进行评估。

https://huggingface.co/tencent/EVIE-Preview-4.5B#citation引用

@misc{tencent2026evie,
  title        = {EVIE-Preview-4.5B},
  author       = {{Tencent}},
  year         = {2026},
  howpublished = {\url{https://huggingface.co/tencent/EVIE-Preview-4.5B}},
  note         = {具有紧凑多向量嵌入的多语言视觉文档检索}
}

相似文章

tencent/WeMM-Embedding 9B/4B/2B

Reddit r/LocalLLaMA

腾讯推出 WeMM-Embedding,这是一系列基于 Qwen3.5 构建的通用多模态嵌入模型,提供 9B、4B 和 2B 尺寸,支持文本、图像、视频和视觉文档的嵌入生成。

tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face

Reddit r/LocalLLaMA

腾讯发布了 Hy-Embodied-RxBrain-1.0,一个用于具身认知的统一多模态基础模型,它将语言推理与视觉想象相结合,用于理解、世界状态预测和子目标规划。

MVEB:大规模视频嵌入基准

Hugging Face Daily Papers

本文介绍了MVEB,一个大规模的视频嵌入基准,涵盖23个任务,发现没有单一模型占据主导地位,并且音频的贡献取决于数据集注释的来源。它整合到MTEB生态系统中,用于统一的多模态评估。