visual-reasoning

标签

Cards List
#visual-reasoning

思维链削弱多模态大模型的视觉空间推理能力

Hugging Face Daily Papers ↗ · 2026-04-17 缓存

研究表明,由于捷径学习和仅凭文本臆造视觉细节,思维链提示会损害多模态大模型在视觉空间推理方面的表现。

0 人收藏 0 人点赞
#visual-reasoning

学习自适应推理路径以实现高效视觉推理

Hugging Face Daily Papers ↗ · 2026-04-16 缓存

AVR是一种自适应视觉推理框架,能够动态选择最优推理格式,在视觉推理任务中减少50-90%的token使用量同时保持准确性。该方法通过将视觉推理分解为三种认知功能并使用FS-GRPO训练来鼓励高效格式选择,从而解决推理路径冗余问题。

0 人收藏 0 人点赞
#visual-reasoning

利用自监督指南提升视觉指令调优

Hugging Face Daily Papers ↗ · 2026-04-14 缓存

本文提出通过将自监督任务表达为自然语言指令,增强多模态语言模型中的视觉指令调优,从而在不增加架构或标注的情况下提升以视觉为中心的推理能力。通过将经典的自监督预文本任务(如旋转预测、颜色匹配和跨视角对应)重构为图像-指令-响应对,该方法仅需在训练数据中注入3%-10%的视觉化指令,便能在多个基准测试中实现一致的性能提升。

0 人收藏 0 人点赞
#visual-reasoning

规划复杂视觉任务的更优方法

MIT News — Artificial Intelligence ↗ · 2026-03-11 缓存

MIT研究人员开发了VLMFP,这是一种结合视觉语言模型与形式化规划软件的两阶段生成式AI方法,在机器人导航等复杂视觉规划任务中达到了70%的成功率,比现有基线方法高出近2.3倍。该方法能自动将视觉场景转化为传统求解器可处理的规划文件,从而在新环境中实现高效的长期规划。

0 人收藏 0 人点赞
#visual-reasoning

用图像思考

OpenAI Blog ↗ · 2025-04-16 缓存

OpenAI 发布了 o3 和 o4-mini 模型,这些模型能够在链式思维过程中对图像进行推理,通过裁剪和缩放等原生图像操作工具实现视觉理解,无需额外的专用模型。这些模型在包括 STEM 问题、图表阅读和视觉搜索任务在内的多模态基准上达到了最先进的性能。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈