@0x0SojalSec: 3B小模型 DeepSeek OCR 2 击败 Gemini 3 Pro。本地运行。DeepSeek OCR 2,一个最先进的3B模型,比Gemini 3 P…
摘要
DeepSeek OCR 2 是一个拥有3B参数的模型,在OCR和文档理解方面超越了Gemini 3 Pro,具有类似人类的阅读顺序,并支持本地微调。
查看缓存全文
缓存时间: 2026/07/16 20:22
3B小模型DeepSeek OCR 2已超越Gemini 3 Pro。可本地运行。
DeepSeek OCR 2,一款3B参数的SOTA模型,在文档阅读方面比Gemini 3 Pro更智能。
而且你可以进行微调,它先构建整体画面,再按照自然的阅读顺序读取,在视觉、文档和OCR理解方面达到SOTA水平。
借助DeepEncoder V2,它模拟人类的阅读逻辑而非僵化的网格,扫描图像,使复杂布局、表格和混合内容更加准确,从而提升OCR精准度。
它具备全局理解能力,然后学习类人的阅读顺序——先关注什么,再关注什么,依次推进。
相比前代版本甚至Gemini 3 Pro,取得了令人瞩目的提升。
相似文章
@DailyDoseOfDS_:在您自己的语言上微调DeepSeek-OCR!(100%本地)大多数视觉模型将文档视为巨大的序列…
DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。
@jakevin7: 有个事挺有意思的。 DeepSeek V4 的技术报告,对所有主流大模型做了一轮横评,结论是——Gemini 3.1 Pro 的世界知识是所有模型里最强的。 不是 GPT,不是 Claude,是 Gemini。 但大家用 Gemini 的…
根据DeepSeek V4技术报告对主流大模型的横评,Gemini 3.1 Pro的世界知识被认为最强,但用户普遍觉得不好用,原因是该模型不主动调用搜索工具。
@_philschmid: 需要用于OCR或VQA的模型吗?试试Gemini 3.5 Flash。Gemini 3.5 Flash更快、更便宜、更准确。详情 ↓
推广Gemini 3.5 Flash,称其用于OCR和VQA任务时更快、更便宜、更准确。
@manateelazycat: 百度这个 AI 黄埔军校来了大神? 在 DeepSeek OCR 基础上开源的Unlimited OCR 出手就是王炸 在它自己的公布数据里,OmniDocBench v1.5 取得了 93.23 分,超过了 DeepSeek OCR 和…
开源OCR模型Unlimited OCR基于DeepSeek OCR,仅3B参数便在OmniDocBench v1.5上取得93.23分,超越DeepSeek OCR和Gemini 2.5等对手。
@0xSero:DeepSeek-V4-Pro 和 Kimi-K2.6 正在 Codex 应用中运行。体验前沿技术最经济的方式。支持本地模型,并且它们可以……
Codex 应用现已支持 DeepSeek-V4-Pro 和 Kimi-K2.6,提供使用前沿 AI 模型的最经济方式,同时支持本地模型和计算机使用功能。