标签
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
百度的Unlimited-OCR模型采用了Reference Sliding Window Attention技术,现已获得vLLM支持,能够以恒定内存消耗高效地一次性解析整本书籍。
这篇文章展示了如何在Hugging Face Jobs上将百度的Unlimited-OCR模型作为临时的、兼容OpenAI的端点提供服务,支持多页文档解析,具有表格转HTML和公式转LaTeX提取等功能。
百度发布了Unlimited-OCR,它可以一次性处理整个文档而无需分块,克服了当前OCR技术的一个主要限制。
百度开源了视觉语言模型Unlimited-OCR,基于DeepSeek-OCR升级,支持一次性解析超长文档,提供gundam(单图密集文字)和base(多页/PDF)两种推理模式。