将文本转换为图像以节省Token使用量

Reddit r/ArtificialInteligence 论文

摘要

DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。

得,DeepSeek最近发布了一篇OCR论文,引发了关于‘光学压缩’的讨论,大致思路是:你可以将大约10个文本Token的信息几乎完美地塞进一个图像Token中,这意味着文本图像的Token效率可能比纯文本更高。听起来有些反直觉,因为图像显然比文本数据‘更大’,但解释是:文本Token是离散的(从约5万个固定词汇表中选取),而图像Token是连续的,每个Token可以表达更多的细微差别。已经有一些社区工具在利用现有的多模态模型做这件事(截取提示词的屏幕截图代替粘贴文本),而且确实有效,但还不清楚你是否能从头开始用这种方法训练模型而不让它退化回普通的文本Token LLM。所以,我受此启发做了一个应用,试试看吧,告诉我你的想法 :) 在这里查看:https://imagizer-website.vercel.app/
查看原文

相似文章