@DailyDoseOfDS_:在您自己的语言上微调DeepSeek-OCR!(100%本地)大多数视觉模型将文档视为巨大的序列…
摘要
DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。
查看缓存全文
缓存时间: 2026/06/08 15:26
在您自己的语言上微调 DeepSeek-OCR!
(完全本地运行)
大多数视觉模型将文档视为海量 token 序列,导致长上下文处理既昂贵又缓慢。
DeepSeek-OCR 采用上下文光学压缩,将二维布局转换为视觉 token,从而实现对复杂文档的高效处理。
它是一个拥有 3B 参数的视觉模型,精度达到 97%,同时使用的视觉 token 比基于文本的 LLM 少 10 倍。
实际上,您可以在单张 GPU 上轻松针对自己的特定用例进行微调。
我们使用 Unsloth 对波斯语文本进行了这项实验,字符错误率改善了 88.26%。
↳ 基础模型:149% 字符错误率(CER) ↳ 微调模型:60% CER(精确度提升 57%) ↳ 训练时间:在单张 GPU 上运行 60 步
波斯语只是测试案例。您可以替换为自己的数据集,适用于任何语言、文档类型或特定领域。
我们已将完整指南分享在下一篇推文中,包括代码、笔记本和环境设置,可一键运行。
所有内容均 100% 开源!
技术栈:
- @UnslothAI 用于运行和微调模型
- @LightningAI 环境用于托管和部署
在此处查找代码和环境设置:
相似文章
@geekbb: 百度开源的视觉语言模型 OCR 项目,在 DeepSeek-OCR 基础上做了升级,主打一次性解析超长文档。模型有两种推理模式:gundam 模式用来对付单张图里的密集文字,base 模式处理多页或 PDF。 https://github…
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。
@0x0SojalSec: 想象一下,把一整本书喂给AI,它就能完美理解。一款全新的OCR模型,能一次读取一整本书……
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
@0x0SojalSec: 3B小模型 DeepSeek OCR 2 击败 Gemini 3 Pro。本地运行。DeepSeek OCR 2,一个最先进的3B模型,比Gemini 3 P…
DeepSeek OCR 2 是一个拥有3B参数的模型,在OCR和文档理解方面超越了Gemini 3 Pro,具有类似人类的阅读顺序,并支持本地微调。
baidu/Unlimited-OCR
百度发布了Unlimited-OCR,一种用于一次性长程文档解析的新模型,基于Deepseek-OCR构建。它支持通过Hugging Face Transformers和SGLang进行单图像和多页/PDF解析。
跨时间僧伽罗语OCR:页面级自适应与历时分析
本文介绍了 sinhala-ocr-lk-acts-1010,这是首个公开可用的真实场景页面级僧伽罗语OCR数据集,并使用QLoRA对三种视觉语言模型(DeepSeek-OCR V1、DeepSeek-OCR V2、LightOnOCR-2-1B)进行了微调。LightOnOCR-2-1B实现了1.05%的字符错误率(CER),优于开源和商业OCR模型,并在不同时期的退化文档中保持了稳定的性能。