相比GPT-4o直接视觉处理,我将图像处理token使用量减少了约95%,同时保持了大致相同的准确度。这有多重要?[P]

Reddit r/MachineLearning 新闻

摘要

一位研究人员分享了初步结果,展示了一种方法,与GPT-4o相比,将图像处理token使用量减少约95%,同时保持了相似的准确度,并寻求关于其重要性的反馈。

我正在测试一种新方法来降低基于图像的LLM推理成本。我在MOMA Graph基准测试上评估了它,使用了1,315个问题。与使用GPT-4o直接处理原始图像相比,我观察到:约95%更低的token使用量,准确度大致与GPT-4o直接图像基线相同。我故意不分享实现细节,因为该方法仍在开发中。我主要想了解结果本身有多强。如果这些数字在更大、更多样的基准测试中仍然成立,您会认为这是在多模态AI效率方面的一个有意义的结果吗?在认真对待这个说法之前,您希望看到什么证据?例如:更多数据集、更强的基线、统计显著性、延迟测量、API成本比较、不同模型的性能、失败案例分析。我特别感兴趣的是来自从事多模态模型、VLM效率或推理优化工作的人的反馈。
查看原文

相似文章

将文本转换为图像以节省Token使用量

Reddit r/ArtificialInteligence

DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。