标签
OpenBMB感谢@_akhaliq贡献了MiniCPM-V 4.6的Hugging Face演示,使用Gradio服务器实现灵活的前端定制。
Numind发布了NuExtract3,这是一个基于Qwen3.5-4B的4B开放权重视觉语言模型,专为将文档图像转换为Markdown、OCR和结构化数据提取而设计。该模型采用Apache-2.0许可证,可自行托管,并提供量化版本以适应低显存环境。
本文研究了在仿真过程中使用视觉语言模型从第一视角视频评估护理能力,发现识别准确率与能力水平呈负相关,表明这一信号具有教学意义。
佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。
SimGym是一个利用视觉语言模型智能体模拟电商店面A/B测试的框架,将实验周期从数周缩短至一小时以内,并能实现与真实买家行为77%的方向一致性。
AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。
Aurora 是一个基于代理的视频编辑框架,它将一个工具增强的视觉语言模型代理与扩散变换器配对,自动解决用户请求中的文本和视觉未指定性,从而实现统一视频编辑任务,如替换、移除、风格迁移和参考驱动插入。
本文介绍PAGER,一种拓扑感知智能体,弥合了点精确GUI控制中的语义-执行鸿沟,在全新PAGE Bench上实现比基线高4.1倍的任务成功率。
RoboEvolve是一个框架,它协同进化VLM规划器和VGM模拟器用于机器人操作,仅用500张无标签种子图像就实现了数据效率以及鲁棒的持续学习。
作者探讨了语言模型是否能通过迭代绘画过程(而非一次性生成)来创作艺术,并构建了一个应用,利用视觉语言模型逐笔绘制笔画。这一实验凸显了大型语言模型生成物的脆弱性,并引发对艺术真诚性的反思。
OpenBMB 已发布 MiniCPM-V 4.6 视觉语言模型。该模型在发布首日即获得 MLX-VLM 软件包的支持,可在搭载 Apple Silicon 的 Mac 上实现高速推理。
RoboMemArena 推出了一项大规模基准测试,旨在通过现实世界验证评估涵盖 26 个复杂任务的机器人记忆能力,并提出了 PrediMem,这是一种利用预测编码优化记忆管理的双系统视觉 - 语言 - 动作模型。
docext是一个本地部署的工具包,无需OCR即可将图像和PDF转换为Markdown,利用视觉语言模型。它还引入了Nanonets-OCR-s,一个紧凑的3B参数模型,用于高效的图像到Markdown转换。
MolmoAct 2 是由 Allen Institute for Artificial Intelligence 开发的开源机器人模型,能够在执行动作前进行三维空间推理。
仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。
大家好!我一直在独立研究和开发小巧但强大的视觉语言模型(VLM),并注意到视觉数据集中的一个空白——没有一个数据集在教我的模型简单地将文本定位到图像中,而是试图让模型推理文本或场景本身。这促使我投入两周的副项目,创建了SGOCR,一个开源数据集流水线,用于生成空间定位的、以OCR为核心的VQA元组,包含大量丰富的元数据以支持多样化的VLM训练策
IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。
本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。
Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。