相比GPT-4o直接视觉处理,我将图像处理token使用量减少了约95%,同时保持了大致相同的准确度。这有多重要?[P]
摘要
一位研究人员分享了初步结果,展示了一种方法,与GPT-4o相比,将图像处理token使用量减少约95%,同时保持了相似的准确度,并寻求关于其重要性的反馈。
我正在测试一种新方法来降低基于图像的LLM推理成本。我在MOMA Graph基准测试上评估了它,使用了1,315个问题。与使用GPT-4o直接处理原始图像相比,我观察到:约95%更低的token使用量,准确度大致与GPT-4o直接图像基线相同。我故意不分享实现细节,因为该方法仍在开发中。我主要想了解结果本身有多强。如果这些数字在更大、更多样的基准测试中仍然成立,您会认为这是在多模态AI效率方面的一个有意义的结果吗?在认真对待这个说法之前,您希望看到什么证据?例如:更多数据集、更强的基线、统计显著性、延迟测量、API成本比较、不同模型的性能、失败案例分析。我特别感兴趣的是来自从事多模态模型、VLM效率或推理优化工作的人的反馈。
相似文章
将我的Agent令牌消耗削减72%(每个任务11.9k ➝ 3.3k)。以下是我所做的具体改动,附数据
一位开发者分享了通过精简系统提示、收紧检索、裁剪工具输出等技术,将AI Agent的令牌消耗降低72%的详细案例研究,且对成功率影响极小。
@charliermarsh: 自从我上次发文后,我使用 Codex 将 ty 的保留内存再减少了 15%。现在我们通过 /goal 实现了约 25% 的整体内存减少,主要是在后台。
开发者 @charliermarsh 报告使用 Codex 将 ty 的保留内存再减少 15%,通过 /goal 实现了约 25% 的整体内存减少,并表达了对 GPT 模型的喜爱。
@corbin_braun: 看起来 GPT Image 2 获得了巨大升级,并且被 OpenAI 团队悄悄发布了,这只需 1 个提示词...
一条推文声称 OpenAI 悄悄发布了 GPT Image 2 的巨大升级,仅用一条提示就能生成令人印象深刻的结果,同时推广了一款 AI 缩略图工具。
将文本转换为图像以节省Token使用量
DeepSeek的OCR论文引入了‘光学压缩’的概念,表明一个图像Token可以编码大约10个文本Token的信息量,且准确性很高,使得文本图像比原始文本更具Token效率。社区工具和新应用Imagizer展示了这种方法在实际中的应用。
@OpenAI: 部署后,我们应用了 GPT-5.6 Sol,通过使其自身运行更高效来推进效率前沿。…
OpenAI 部署了 GPT-5.6 Sol,通过改进的 GPU 内核和推测解码,实现了 20% 的服务成本降低和 15% 以上的 token 生成效率提升。