介绍 ASCIITermDraw Bench | 测试视觉语言模型生成和编辑 ASCII 艺术的能力
摘要
介绍 ASCIITermDraw Bench,这是一个用于评估视觉语言模型在 ASCII 艺术生成与编辑任务上的基准测试。
暂无内容
相似文章
VCG-Bench:面向统一视觉中心的生成与编辑结构化基准
VCG-Bench 是一个统一基准,用于评估视觉-语言模型在结构化图表生成与编辑任务上的表现,引入了一种基于符号 mxGraph XML 的“以图表为代码”范式,以及一个包含 6 个领域共 1,449 张图表的分类数据集。
AI能绘制科学图吗?一个用于评估文本到图像和多模态模型生成科学图形的基准
介绍了SciDraw-Bench,一个用于评估文本到图像和多模态模型生成科学图形的基准,采用四维评估协议。结果显示,领域专用系统优于通用模型,文本保真度仍然是最具挑战性的方面。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
介绍了VisEditBench,这是一个包含1,395个人工标注的可视化代码编辑任务的基准,面向视觉语言模型,涵盖反馈引导的修复和参考引导的重新样式化。评估了20个VLM,并提出了VisEditAgent,一个基于渲染的编辑框架,将通过率从55.75%提升到67.99%。
Terminal-Bench-LILT:基于语言、地区和文化的多语言代理编码基准
Terminal-Bench-LILT 呈现一个多语言编码基准,包含300个真实任务,涵盖10种语言,揭示了AI模型在处理非英语问题(如国际化和文化惯例)上的不足。
DrawingVQA:一个用于建筑图纸多深度视觉-文本推理的真实世界基准
介绍了DrawingVQA,这是首个用于评估多模态大语言模型在真实建筑图纸上表现的基准,包含33张图纸和92组涵盖三种推理深度的问答对,揭示了模型与专家性能之间的差距。