标签
对16个前沿视觉语言模型在文档解析方面的综合评估显示,Opus 5.5在性价比上表现最佳,尤其在表格解析方面,而GPT-6 Luna在成本效益解析方面表现良好。对于大规模使用,推荐使用LlamaParse等专用工具,但Opus 5.5在应用内解析方面领先。
VisTW是一个用于评估VLM对真实台湾内容理解能力的繁体中文视觉基准测试。Twinkle Eval已添加对其支持,并提供准确率对比。
本文使用HFlow评估开放权重VLMs在处理自我中心数据方面的表现,显示Gemma和Qwen等模型与Gemini基线相比达到高精度,同时成本更低且适合自托管。
本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。
用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。
一项非正式实验使用棋盘揭示了视觉语言模型尽管能正确识别棋子,但在空间推理和精确结构化输出方面常常失败,突显了VLM评估中的一个关键差距。
一位博士生在顶级影像会议被拒后,询问将视觉-语言模型评测工作投到 EMNLP workshop 是否划算。