18 款 LLM OCR 实测(7k+ 次调用):便宜/旧模型常吊打旗舰,完整数据集+框架已开源 [R]
摘要
对 18 款大模型在 OCR 任务上的全面评测(7k+ 次调用)发现,便宜或旧模型往往能以极低成本达到与旗舰模型相当的准确率,数据集与评测框架已完全开源。
**太长不看:** 我们发现自己为 OCR 多花了冤枉钱,于是把旗舰模型和便宜旧模型拉到一起比了比。新迷你基准 + 排行榜上线,免费工具可测你自己的文档,全部开源。我们在梳理 OCR / 文档提取流程时反复看到一个现象:太多团队要么卡在 legacy OCR 管线,要么默认用最新最大模型,结果 LLM 调用贵得离谱。我们精选 42 份标准文档,每份跑 10 次,严格同条件,共 7,560 次调用。核心结论:标准 OCR 场景下,更小更老的模型准确率不输旗舰,成本却只是零头。我们追踪 pass\^n(大规模可靠性)、单次成功成本、延迟、关键字段准确率。全部开源:[https://github.com/ArbitrHq/ocr-mini-bench](https://github.com/ArbitrHq/ocr-mini-bench) 排行榜:[https://arbitrhq.ai/leaderboards/](https://arbitrhq.ai/leaderboards/) 欢迎对比你们的结果。
相似文章
开源权重LLM在准确性上已迎头赶上(21分钟阅读)
一个新的基准ClinReg在真实的监管和临床试验任务上评估LLM,发现开源权重模型现在在准确性上与闭源模型相当,而成本仅为其一小部分。
@llama_index: “OCR 现在只是一个功能。前沿模型将吞噬它。”我们不断听到这种说法。数据却表明并非如此。在三个……
LlamaIndex 认为,文档 OCR 并未被前沿模型商品化,基准数据显示专业解析器仍然更准确且成本更低。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。
移动智能体评估中的 LLM 评判器基准测试
本文介绍了 MobileJudgeBench,一个包含 931 条人工标注轨迹的基准,用于系统评估移动智能体任务中基于 LLM 的评判器。研究发现,带有采样屏幕截图的简单基线评判器可与专用方法相媲美甚至更优,而 LLM 主干是质量的主要驱动因素。
@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。