将文本转换为图像以节省Token使用量
摘要
DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。
得,DeepSeek最近发布了一篇OCR论文,引发了关于‘光学压缩’的讨论,大致思路是:你可以将大约10个文本Token的信息几乎完美地塞进一个图像Token中,这意味着文本图像的Token效率可能比纯文本更高。听起来有些反直觉,因为图像显然比文本数据‘更大’,但解释是:文本Token是离散的(从约5万个固定词汇表中选取),而图像Token是连续的,每个Token可以表达更多的细微差别。已经有一些社区工具在利用现有的多模态模型做这件事(截取提示词的屏幕截图代替粘贴文本),而且确实有效,但还不清楚你是否能从头开始用这种方法训练模型而不让它退化回普通的文本Token LLM。所以,我受此启发做了一个应用,试试看吧,告诉我你的想法 :) 在这里查看:https://imagizer-website.vercel.app/
相似文章
@DailyDoseOfDS_:在您自己的语言上微调DeepSeek-OCR!(100%本地)大多数视觉模型将文档视为巨大的序列…
DeepSeek-OCR是一个3B参数的视觉模型,使用上下文光学压缩进行高效的文档处理。使用Unsloth在波斯语文本上进行微调,字符错误率降低了88.26%,全部开源且可在单GPU上运行。
文本到图像模型对文本编码器的依赖比你想象的要少
本文证明,文本到图像的扩散Transformer模型主要依赖文本编码器中的标记合并和词序,而非完整的上下文嵌入,表明图像模型本身能够解码复杂的语言结构。
@0x0SojalSec: 想象一下,把一整本书喂给AI,它就能完美理解。一款全新的OCR模型,能一次读取一整本书……
这条推文介绍了DeepSeek Unlimited OCR,这是一款AI模型,能一次读取整本书,内存占用保持平稳,在40+页面上达到93%基准分数和低于0.11的错误率。
InsightTok:在离散标记化中提升文本与人脸保真度以改进自回归图像生成
InsightTok 引入内容感知的感知损失,改进离散视觉标记化以更好地重建文本和人脸,从而提升自回归图像生成质量。
@0x0SojalSec: 疯狂,99%准确率的OCR推理模型,堪比专业人类,这款8B推理OCR模型能瞬间从图像中提取文字…
一款8B推理OCR模型实现了近乎完美的99%准确率,瞬间从图像中提取文字,并将复杂布局转换为整洁的Markdown,在文档任务上优于GPT-4o等更大模型。