标签
LlamaIndex对GPT-5.6在文档理解方面进行了基准测试,发现其相比GPT-5.5没有改进;该模型在文本和表格上表现良好,但在图表和布局方面仍有不足。
Jerry Liu报告了Mistral OCR在ParseBench上的更新结果,显示其性能优于GPT-5.5,仅落后于Gemini 3.1 Pro,在内容忠实度和语义格式方面表现强劲。
Jerry Liu的团队正在CVPR 2026上展示ParseBench,这是一个针对视觉语言模型(VLM)的全面文档理解基准。该基准包含2000页真实企业文档,以及针对表格、图表和视觉定位的评估指标。