光学推理:重新审视图像作为超越文本的表达性推理媒介

Hugging Face Daily Papers 论文

摘要

提出光学推理,将图像作为语言和多模态任务的独立推理媒介,相比传统基于文本的方法实现了更高的令牌效率。

思维链(CoT)提高了大型语言模型(LLMs)的性能,并已扩展到多模态大型语言模型(MLLMs)。最近的工作进一步从基于文本的多模态推理转向交错模态推理,其中中间步骤可以同时包含文本推理和视觉证据。在这项工作中,我们提出了一个更大胆、更具雄心的想法:图像能否单独作为语言和多模态任务的推理媒介?为了探索这一点,我们提出了光学推理,将图像视为独立的推理媒介。我们通过两种变体实现了这一概念:基于排印的光学推理,优化视觉布局以实现紧凑的推理渲染;以及基于图形的光学推理,将文本和图形元素组合成结构化的视觉推理。在数学、科学和交错模态推理基准测试中,光学推理能够匹配甚至超越传统的文本推理,同时在语言任务上平均减少28.57%的推理令牌,在多模态任务上减少16%,实现了文本推理1.96倍的令牌效率。这些结果表明,图像能够有效且高效地编码推理过程,同时为推理提供统一的视觉画布。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:40

论文页面 - 光学推理:将图像重新思考为超越文本的表达性推理媒介

来源:https://huggingface.co/papers/2606.09585

摘要

光学推理将图像作为语言和多模态任务的独立推理媒介,实现了比传统基于文本的方法更高的 Token 效率。

思维链(Chain-of-Thought,https://huggingface.co/papers?q=Chain-of-Thought,CoT)提升了大型语言模型(Large Language Models,https://huggingface.co/papers?q=Large%20Language%20Models,LLMs)的性能,并已扩展到多模态大型语言模型(Multimodal Large Language Models,https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models,MLLMs)。近期研究进一步从基于文本的多模态推理转向交错模态推理(interleaved-modal reasoning,https://huggingface.co/papers?q=interleaved-modal%20reasoning),其中中间步骤可以同时包含文本推理和视觉证据。在本文中,我们提出一个更大胆且更具雄心的想法:图像能否单独作为语言和多模态任务的推理媒介?为了探索这一点,我们提出了光学推理(optical reasoning,https://huggingface.co/papers?q=optical%20reasoning),将图像视为独立的推理媒介。我们通过两种变体实例化这一概念:基于排印的光学推理(typographic-based optical reasoning,https://huggingface.co/papers?q=typographic-based%20optical%20reasoning),优化视觉布局以实现紧凑的推理渲染;以及基于图形的光学推理(graphical-based optical reasoning,https://huggingface.co/papers?q=graphical-based%20optical%20reasoning),将文本和图形元素组合成结构化的视觉推理(visual rationales,https://huggingface.co/papers?q=visual%20rationales)。在数学、科学和交错模态推理(interleaved-modal reasoning,https://huggingface.co/papers?q=interleaved-modal%20reasoning)基准测试中,光学推理(optical reasoning,https://huggingface.co/papers?q=optical%20reasoning)可以达到甚至超越传统文本推理,同时在语言任务上平均减少 28.57% 的推理 Token,在多模态任务上减少 16%,实现了文本推理 1.96 倍的 Token 效率(token efficiency,https://huggingface.co/papers?q=token%20efficiency)。这些结果表明,图像可以高效且有效地编码推理过程,同时为推理提供统一的视觉画布。

查看 arXiv 页面(https://arxiv.org/abs/2606.09585)查看 PDF(https://arxiv.org/pdf/2606.09585)GitHub(https://github.com/ModalityDance/Optical-Reasoning)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09585)

将此论文添加到您的代理中:

hf papers read 2606.09585

没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型(0)

没有模型链接此论文

在模型 README.md 中引用 arxiv.org/abs/2606.09585 以从本页链接。

引用此论文的数据集(1)

ModalityDance/Optical-Reasoning-4k 查看器 • 更新于 25 分钟前 • 9.74k • 1(https://huggingface.co/datasets/ModalityDance/Optical-Reasoning-4k)

引用此论文的 Space(0)

没有 Space 链接此论文

在 Space README.md 中引用 arxiv.org/abs/2606.09585 以从本页链接。

包含此论文的收藏集(0)

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接。

相似文章

ETCHR:编辑以澄清和利用推理

Hugging Face Daily Papers

ETCHR是一种新颖的图像编辑方法,它将视觉推理与图像生成解耦,采用两阶段训练过程(推理模仿和推理增强)来提升多模态语言模型在五个视觉推理任务上的性能。在Qwen3-VL-8B、Gemini-3.1-Flash-Lite和Kimi K2.5等模型上,Pass@1持续提升4-5%。

用图像思考

OpenAI Blog

OpenAI 发布了 o3 和 o4-mini 模型,这些模型能够在链式思维过程中对图像进行推理,通过裁剪和缩放等原生图像操作工具实现视觉理解,无需额外的专用模型。这些模型在包括 STEM 问题、图表阅读和视觉搜索任务在内的多模态基准上达到了最先进的性能。