vlm-evaluation

标签

Cards List
#vlm-evaluation

@jerryjliu0: 我们全面评估了16个最新的前沿VLM——包括Opus 5.5和GPT-6 Sol/Luna——来查看更高的努力是否……

X AI KOLs Timeline ↗ · 6天前 缓存

对16个前沿视觉语言模型在文档解析方面的综合评估显示,Opus 5.5在性价比上表现最佳,尤其在表格解析方面,而GPT-6 Luna在成本效益解析方面表现良好。对于大规模使用,推荐使用LlamaParse等专用工具,但Opus 5.5在应用内解析方面领先。

0 人收藏 0 人点赞
#vlm-evaluation

VisTW:一个测试VLM能否真正理解台湾内容的繁体中文视觉基准测试

Reddit r/LocalLLaMA ↗ · 2026-09-16

VisTW是一个用于评估VLM对真实台湾内容理解能力的繁体中文视觉基准测试。Twinkle Eval已添加对其支持,并提供准确率对比。

0 人收藏 0 人点赞
#vlm-evaluation

我们使用HFlow评估最新的开放权重VLMs用于处理自我中心数据

Reddit r/LocalLLaMA ↗ · 2026-08-30

本文使用HFlow评估开放权重VLMs在处理自我中心数据方面的表现,显示Gemma和Qwen等模型与Gemini基线相比达到高精度,同时成本更低且适合自托管。

0 人收藏 0 人点赞
#vlm-evaluation

MAVEN:一个基于紧凑对齐评估器的多模态内容宏观社会价值评估框架

arXiv cs.CL ↗ · 2026-08-20 缓存

本文提出MAVEN,一个用于评估多模态内容宏观社会价值的分层框架,包含一个基准测试和优化评估器,以实现可扩展评估。

0 人收藏 0 人点赞
#vlm-evaluation

本地文本到图像模型对比:终极测试。

Reddit r/LocalLLaMA ↗ · 2026-06-21

用户使用192个提示词对本地文本到图像模型进行了全面对比,评估了文本渲染、人脸、人体解剖、空间构图等能力,结果和提示词已在imagebench.ai上公开。

0 人收藏 0 人点赞
#vlm-evaluation

棋盘是捕捉VLM仍然出错之处的极好方法

Reddit r/artificial ↗ · 2026-06-18

一项非正式实验使用棋盘揭示了视觉语言模型尽管能正确识别棋子,但在空间推理和精确结构化输出方面常常失败,突显了VLM评估中的一个关键差距。

0 人收藏 0 人点赞
#vlm-evaluation

EMNLP workshop 值得投吗?或其他适合 VLM 评测工作的 NLP 会议?

Reddit r/MachineLearning ↗ · 2026-04-22

一位博士生在顶级影像会议被拒后,询问将视觉-语言模型评测工作投到 EMNLP workshop 是否划算。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈