visual-language-model

标签

Cards List
#visual-language-model

@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…

X AI KOLs Timeline ↗ · 2026-06-23 缓存

百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。

0 人收藏 0 人点赞
#visual-language-model

封闭-开放工业检测场景的统一:新的大规模基准、挑战与基线

arXiv cs.AI ↗ · 2026-06-09 缓存

介绍了MMIOC-1M,一个用于工业缺陷检测的大规模多模态基准,并提出了RTVPNet,一种精细的文本-视觉提示网络,实现了最先进的性能。

0 人收藏 0 人点赞
#visual-language-model

@paulabartabajo_:给AI工程师的建议——在自定义数据上微调的小型视觉语言模型,准确率堪比GPT-5……

X AI KOLs Timeline ↗ · 2026-04-22 缓存

一条推文称,在自定义数据上微调的小型视觉语言模型准确率可媲美GPT-5,成本却低50倍,并举例Liquid AI的1.6B模型可用llama.cpp本地全速运行。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈