光学推理:重新审视图像作为超越文本的表达性推理媒介
摘要
提出光学推理,将图像作为语言和多模态任务的独立推理媒介,相比传统基于文本的方法实现了更高的令牌效率。
查看缓存全文
缓存时间: 2026/06/09 08:40
论文页面 - 光学推理:将图像重新思考为超越文本的表达性推理媒介
来源:https://huggingface.co/papers/2606.09585
摘要
光学推理将图像作为语言和多模态任务的独立推理媒介,实现了比传统基于文本的方法更高的 Token 效率。
思维链(Chain-of-Thought,https://huggingface.co/papers?q=Chain-of-Thought,CoT)提升了大型语言模型(Large Language Models,https://huggingface.co/papers?q=Large%20Language%20Models,LLMs)的性能,并已扩展到多模态大型语言模型(Multimodal Large Language Models,https://huggingface.co/papers?q=Multimodal%20Large%20Language%20Models,MLLMs)。近期研究进一步从基于文本的多模态推理转向交错模态推理(interleaved-modal reasoning,https://huggingface.co/papers?q=interleaved-modal%20reasoning),其中中间步骤可以同时包含文本推理和视觉证据。在本文中,我们提出一个更大胆且更具雄心的想法:图像能否单独作为语言和多模态任务的推理媒介?为了探索这一点,我们提出了光学推理(optical reasoning,https://huggingface.co/papers?q=optical%20reasoning),将图像视为独立的推理媒介。我们通过两种变体实例化这一概念:基于排印的光学推理(typographic-based optical reasoning,https://huggingface.co/papers?q=typographic-based%20optical%20reasoning),优化视觉布局以实现紧凑的推理渲染;以及基于图形的光学推理(graphical-based optical reasoning,https://huggingface.co/papers?q=graphical-based%20optical%20reasoning),将文本和图形元素组合成结构化的视觉推理(visual rationales,https://huggingface.co/papers?q=visual%20rationales)。在数学、科学和交错模态推理(interleaved-modal reasoning,https://huggingface.co/papers?q=interleaved-modal%20reasoning)基准测试中,光学推理(optical reasoning,https://huggingface.co/papers?q=optical%20reasoning)可以达到甚至超越传统文本推理,同时在语言任务上平均减少 28.57% 的推理 Token,在多模态任务上减少 16%,实现了文本推理 1.96 倍的 Token 效率(token efficiency,https://huggingface.co/papers?q=token%20efficiency)。这些结果表明,图像可以高效且有效地编码推理过程,同时为推理提供统一的视觉画布。
查看 arXiv 页面(https://arxiv.org/abs/2606.09585)查看 PDF(https://arxiv.org/pdf/2606.09585)GitHub(https://github.com/ModalityDance/Optical-Reasoning)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2606.09585)
将此论文添加到您的代理中:
hf papers read 2606.09585
没有最新 CLI?curl -LsSf https://hf.co/cli/install.sh | bash
引用此论文的模型(0)
没有模型链接此论文
在模型 README.md 中引用 arxiv.org/abs/2606.09585 以从本页链接。
引用此论文的数据集(1)
ModalityDance/Optical-Reasoning-4k 查看器 • 更新于 25 分钟前 • 9.74k • 1(https://huggingface.co/datasets/ModalityDance/Optical-Reasoning-4k)
引用此论文的 Space(0)
没有 Space 链接此论文
在 Space README.md 中引用 arxiv.org/abs/2606.09585 以从本页链接。
包含此论文的收藏集(0)
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
轻看,重思:多模态思维链推理能做什么与不能做什么
本文系统评估了12个任务上的多模态思维链推理,发现它对推理任务有选择性效果,但对感知任务有害,并识别出了一种“轻看,重思”模式,即在推理过程中视觉内省能力下降。
Perceive-to-Reason:解耦感知与推理实现细粒度视觉推理
提出Perceive-to-Reason(P2R)框架,通过两阶段流程和角色感知的强化学习策略,将视觉语言模型中的视觉感知与推理解耦,在细粒度视觉推理基准上达到最先进水平。
ETCHR:编辑以澄清和利用推理
ETCHR是一种新颖的图像编辑方法,它将视觉推理与图像生成解耦,采用两阶段训练过程(推理模仿和推理增强)来提升多模态语言模型在五个视觉推理任务上的性能。在Qwen3-VL-8B、Gemini-3.1-Flash-Lite和Kimi K2.5等模型上,Pass@1持续提升4-5%。
用图像思考
OpenAI 发布了 o3 和 o4-mini 模型,这些模型能够在链式思维过程中对图像进行推理,通过裁剪和缩放等原生图像操作工具实现视觉理解,无需额外的专用模型。这些模型在包括 STEM 问题、图表阅读和视觉搜索任务在内的多模态基准上达到了最先进的性能。
看不清还是想不对?面向视觉语言推理的感知奖励
本文提出一种强化学习框架,通过显式奖励感知保真度来改善视觉语言模型中的感知-推理协同,利用“蒙眼推理”代理和结构化言语验证来解决模态信用分配中的模糊性。