vision-language-model

标签

Cards List
#vision-language-model

@OpenBMB:感谢@_akhaliq贡献了MiniCPM-V 4.6的Hugging Face演示,让我们能够测试gradio.Server功能…

X AI KOLs Following · 2026-05-23 缓存

OpenBMB感谢@_akhaliq贡献了MiniCPM-V 4.6的Hugging Face演示,使用Gradio服务器实现灵活的前端定制。

0 人收藏 0 人点赞
#vision-language-model

NuExtract3发布:面向Markdown、OCR和结构化提取的开放权重4B视觉语言模型(可自行托管)[P]

Reddit r/MachineLearning · 2026-05-22

Numind发布了NuExtract3,这是一个基于Qwen3.5-4B的4B开放权重视觉语言模型,专为将文档图像转换为Markdown、OCR和结构化数据提取而设计。该模型采用Apache-2.0许可证,可自行托管,并提供量化版本以适应低显存环境。

0 人收藏 0 人点赞
#vision-language-model

基于仿真护理教育的自我视角视频的AI辅助能力评估

arXiv cs.AI · 2026-05-22 缓存

本文研究了在仿真过程中使用视觉语言模型从第一视角视频评估护理能力,发现识别准确率与能力水平呈负相关,表明这一信号具有教学意义。

0 人收藏 0 人点赞
#vision-language-model

面向文化图像描述的长上下文检索增强翻译:Gators在AmericasNLP 2026共享任务中的提交

arXiv cs.CL · 2026-05-21 缓存

佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。

0 人收藏 0 人点赞
#vision-language-model

SimGym:基于流量锚定的VLM智能体实现电商A/B测试模拟框架

arXiv cs.AI · 2026-05-20 缓存

SimGym是一个利用视觉语言模型智能体模拟电商店面A/B测试的框架,将实验周期从数周缩短至一小时以内,并能实现与真实买家行为77%的方向一致性。

0 人收藏 0 人点赞
#vision-language-model

AutoRubric-T2I: 基于规则的文本到图像对齐鲁棒奖励模型

Hugging Face Daily Papers · 2026-05-20 缓存

AutoRubric-T2I 自动生成并选择显式评分标准,以指导视觉语言模型裁判对文本到图像生成进行评判,用极少的人工标注实现高质量奖励信号,并提升下游任务的生成质量。

0 人收藏 0 人点赞
#vision-language-model

Aurora:使用工具代理的统一视频编辑

Hugging Face Daily Papers · 2026-05-18 缓存

Aurora 是一个基于代理的视频编辑框架,它将一个工具增强的视觉语言模型代理与扩散变换器配对,自动解决用户请求中的文本和视觉未指定性,从而实现统一视频编辑任务,如替换、移除、风格迁移和参考驱动插入。

0 人收藏 0 人点赞
#vision-language-model

PAGER:弥合点精确几何GUI控制中的语义-执行鸿沟

Hugging Face Daily Papers · 2026-05-15 缓存

本文介绍PAGER,一种拓扑感知智能体,弥合了点精确GUI控制中的语义-执行鸿沟,在全新PAGE Bench上实现比基线高4.1倍的任务成功率。

0 人收藏 0 人点赞
#vision-language-model

RoboEvolve:在有限数据下实现机器人操作的计划器与模拟器协同进化

Hugging Face Daily Papers · 2026-05-13 缓存

RoboEvolve是一个框架,它协同进化VLM规划器和VGM模拟器用于机器人操作,仅用500张无标签种子图像就实现了数据效率以及鲁棒的持续学习。

0 人收藏 0 人点赞
#vision-language-model

语言模型能作画吗?

Hacker News Top · 2026-05-12 缓存

作者探讨了语言模型是否能通过迭代绘画过程(而非一次性生成)来创作艺术,并构建了一个应用,利用视觉语言模型逐笔绘制笔画。这一实验凸显了大型语言模型生成物的脆弱性,并引发对艺术真诚性的反思。

0 人收藏 0 人点赞
#vision-language-model

MiniCPM-V 4.6

Product Hunt · 2026-05-12

MiniCPM-V 4.6 是一款专为移动设备优化的极致高效 13 亿参数视觉语言模型。

0 人收藏 0 人点赞
#vision-language-model

@Prince_Canuma:祝贺 @OpenBMB 发布 MiniCPM-V 4.6!MLX-VLM 已为其提供 Day-0 支持,感谢 Magic Yang。运行…

X AI KOLs Timeline · 2026-05-11 缓存

OpenBMB 已发布 MiniCPM-V 4.6 视觉语言模型。该模型在发布首日即获得 MLX-VLM 软件包的支持,可在搭载 Apple Silicon 的 Mac 上实现高速推理。

0 人收藏 0 人点赞
#vision-language-model

RoboMemArena:一个全面且具挑战性的机器人记忆基准测试

Hugging Face Daily Papers · 2026-05-11 缓存

RoboMemArena 推出了一项大规模基准测试,旨在通过现实世界验证评估涵盖 26 个复杂任务的机器人记忆能力,并提出了 PrediMem,这是一种利用预测编码优化记忆管理的双系统视觉 - 语言 - 动作模型。

0 人收藏 0 人点赞
#vision-language-model

@tom_doerr: 将图像和PDF转换为Markdown,无需OCR https://github.com/NanoNets/docext

X AI KOLs Timeline · 2026-05-08 缓存

docext是一个本地部署的工具包,无需OCR即可将图像和PDF转换为Markdown,利用视觉语言模型。它还引入了Nanonets-OCR-s,一个紧凑的3B参数模型,用于高效的图像到Markdown转换。

0 人收藏 0 人点赞
#vision-language-model

MolmoAct 2

Product Hunt · 2026-05-05

MolmoAct 2 是由 Allen Institute for Artificial Intelligence 开发的开源机器人模型,能够在执行动作前进行三维空间推理。

0 人收藏 0 人点赞
#vision-language-model

@techNmak:1.7B 参数轻量 VLM,在 OmniDocBench 上碾压巨头的 OCR 新王者

X AI KOLs Timeline · 2026-04-20 缓存

仅 1.7B 参数的多语言文档解析器 dots.ocr,用轻量体积实现 SOTA,证明文档理解无需巨无霸模型。

0 人收藏 0 人点赞
#vision-language-model

SGOCR:一个空间定位的、以OCR为核心的流水线与V1数据集 [P]

Reddit r/MachineLearning · 2026-04-20

大家好!我一直在独立研究和开发小巧但强大的视觉语言模型(VLM),并注意到视觉数据集中的一个空白——没有一个数据集在教我的模型简单地将文本定位到图像中,而是试图让模型推理文本或场景本身。这促使我投入两周的副项目,创建了SGOCR,一个开源数据集流水线,用于生成空间定位的、以OCR为核心的VQA元组,包含大量丰富的元数据以支持多样化的VLM训练策

0 人收藏 0 人点赞
#vision-language-model

Granite 4.0 3B Vision:面向企业文档的紧凑型多模态智能模型

Hugging Face Blog · 2026-03-31 缓存

IBM 发布 Granite 4.0 3B Vision,这是一款专为理解企业文档而设计的紧凑型视觉语言模型,具备表格提取、基于 ChartNet 的图表解读以及键值对 grounding 等专业能力。

0 人收藏 0 人点赞
#vision-language-model

dots.ocr:单个视觉语言模型中的多语言文档布局解析

Papers with Code Trending · 2025-12-02 缓存

本文介绍了 dots.ocr,一个统一的视觉语言模型,它联合学习布局检测、文本识别和关系理解,用于多语言文档布局解析。它在 OmniDocBench 上取得了最先进的结果,并引入了覆盖 126 种语言的 XDocParse 基准。

0 人收藏 0 人点赞
#vision-language-model

Hulu-Med:面向全面医学视觉语言理解的透明通用模型

Papers with Code Trending · 2025-10-09 缓存

Hulu-Med 是一个透明的医学视觉语言模型,统一了对文本、2D/3D图像和视频的理解,在30个基准测试中取得了最先进的性能,并且完全开源。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈