VisTW:一个测试VLM能否真正理解台湾内容的繁体中文视觉基准测试

Reddit r/LocalLLaMA 论文

摘要

VisTW是一个用于评估VLM对真实台湾内容理解能力的繁体中文视觉基准测试。Twinkle Eval已添加对其支持,并提供准确率对比。

我想向大家推荐一个我认为值得更多关注的基准测试,并说明我们已为其添加了支持。它填补了什么空白?如果我们看看大多数人用来评估VLM的基准测试——MMBench、MMStar、MMMU、POPE——它们都是英文或简体中文的。一个模型可能在所有这些测试中都得分很高,却仍然无法识别台湾的路标、收据、健保卡,或者本地学校教科书中的图表。之前没有人对此进行过度量。VisTW(NTU MiuLab,arXiv 2503.10427,CC BY 4.0)恰恰测量了这一点。 它包含两个子集: VisTW-MCQ——包含4770道多项选择题,题目来自21个学术科目的真实考试。涵盖图表、电路图、乐谱、医学影像和地图。所有问题和选项均为繁体中文。 VisTW-Dialogue——包含141道关于台湾日常生活场景的开放式问题,由LLM评分,评分范围为0-10分。这个子集考察的是文化背景知识,而非教科书知识。 为了了解其规模,他们的排行榜上,gemma-3-12b-it在MCQ上的得分为0.4863,在Dialogue上的得分为3.94,而榜首的o3大约为0.7769 / 6.9878。该排行榜自2025年4月后未更新,因此未包含更新的模型。 官方代码库:TMMMU-Benchmark/evaluation 我们添加了对其的支持 Twinkle Eval是一个开源的评估框架,可对接任何OpenAI兼容的端点。自v2.10.0版本起,已支持两个VisTW子集。在声称其有效之前,我们用官方实现进行了对比测试——使用相同模型、相同端点、从所有21个科目中按比例抽取的253个问题: Twinkle Eval 官方实现 准确率 81.01% 80.56% 相差0.45个百分点。 我们记录了为使双方结果具有可比性而对官方代码库进行的四项修改,以便任何人可以验证我们的工作。 对比实际发现了什么? 值得分享,因为这是简单测试无法发现的问题。有一个科目的得分比官方实现低了36分。原因出在我们这边:官方提示词要求模型以“答案:$字母”的格式作答,模型会复制那个美元符号,而我们的提取器无法匹配“答案:$A”。更糟的是,它随后会退而使用更宽松的模式,从推理文本中提取一个字母——导致正确答案被错误判分,且输出中没有任何迹象表明有问题。 一个21题的简单测试集没有发现任何问题。跑完整个253题才发现。现已修复。这个bug不仅影响了VisTW,还压制了其他五个不同视觉基准测试的得分。 使用前值得了解的事项 官方实现有一个额外的第三个提取阶段,会调用LLM来解析其正则表达式未能匹配的响应。我们刻意不这样做,因为它将“模型回答得有多差”与“解析器猜得有多好”混为一谈;我们改为报告未解析率(unparsed_rate),以便差距保持可见。 推理型VLM需要很大的输出空间。在max_tokens:2048时,我们测量到19%的响应在生成答案前被截断,导致准确率损失19分。默认模板设置为8192。 对于Dialogue,其0-10分的平均分尚未体现在摘要JSON中——需要从每个问题的输出中自行汇总。此问题已作为开放议题跟踪。 运行方法 pip install twinkle-eval twinkle-eval --init vistw_mcq twinkle-eval --download-dataset vistw_mcq twinkle-eval --config configs/vistw_mcq.yaml 代码库中有一个包含21个问题的示例集,如果您想先检查端点是否工作。欢迎就基准测试或集成提出任何问题。如果您发现我们的数据有任何错误,我更希望能直接告知。
查看原文

相似文章

VTR-Bench:面向视频生成中视觉文本渲染评估的系统性基准

Hugging Face Daily Papers

VTR-Bench 提出了一个用于评估视频生成模型视觉文本渲染能力的系统性基准,涵盖五大场景类别共 300 条提示词、一套与人工评价对齐的自动化评估流水线,以及一个关键帧引导的智能体框架(Keyframe-Guided Agentic Framework)。在 11 个最先进模型上的实验表明,场景文本渲染普遍面临困难,表现最好的模型词错误率(WER)为 0.250。