visual-reasoning

标签

Cards List
#visual-reasoning

UniCAR-RL:视觉数学中先看得更清楚再深入思考

arXiv cs.AI ↗ · 2026-09-15 缓存

UniCAR-RL 引入了一个强化学习框架,通过解耦感知与推理,无需标注即可提升多模态大语言模型的视觉数学推理能力。

0 人收藏 0 人点赞
#visual-reasoning

多模态大语言模型在阅读前先看吗?诊断上下文谄媚现象

arXiv cs.CL ↗ · 2026-09-02 缓存

本文介绍了大语言模型中的多模态上下文谄媚现象,即外部文本覆盖视觉证据,并提出了一种使用 System-2 Visual Arbitration 的诊断方法来提高性能。

0 人收藏 0 人点赞
#visual-reasoning

CoVA-SFT: 用于视觉抽象链的大规模数据集

arXiv cs.CL ↗ · 2026-09-01 缓存

CoVA-SFT是一个大规模数据集与基准,专为训练多模态语言模型在视觉抽象链上构建,以提升视觉推理任务中超越基线的性能。

0 人收藏 0 人点赞
#visual-reasoning

TempCloze: 视频大语言模型能否识别缺失的中间部分?

Hugging Face Daily Papers ↗ · 2026-09-01 缓存

TempCloze 是一个视频完形填空基准,用于评估视频大语言模型中的视觉时序推理,要求模型从干扰项中识别缺失的视频片段,以减少在语义、对齐和进展方面的语言捷径。

0 人收藏 0 人点赞
#visual-reasoning

我认为我们可能一直在以错误的方式思考移动代理。API 提供控制,但理解屏幕能带来别的东西。

Reddit r/AI_Agents ↗ · 2026-08-29

作者质疑依赖 API 访问的传统移动代理方法,并提出通过类似 aiden-firmware 的硬件使用屏幕理解来实现更通用的代理,使其能像人类一样交互。

0 人收藏 0 人点赞
#visual-reasoning

基于动作引发视觉差异的桌面GUI代理反思方法

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出证据优先反思(EFR)方法,通过解耦动作引发的视觉差异提取与结果验证,以改进桌面GUI代理中的反思过程,在基准测试上实现7.11%的准确率提升。

0 人收藏 0 人点赞
#visual-reasoning

VBVR-Pro: 一个用于原生视觉推理的可扩展且可验证的套件

Hugging Face Daily Papers ↗ · 2026-08-26 缓存

VBVR-Pro 引入了一个闭环测试平台,用于通过生成实现可扩展且可验证的原生视觉推理,其特点包括任务扩展、可验证奖励以及跨多样视觉基底的机制研究。

0 人收藏 0 人点赞
#visual-reasoning

VGI-BENCH: 探测视频生成模型中的视觉智能

Hugging Face Daily Papers ↗ · 2026-08-20 缓存

VGI-BENCH 通过27项任务评估视频生成模型中的视觉推理,揭示当前系统在可靠性和自我纠正方面的局限性。

0 人收藏 0 人点赞
#visual-reasoning

超越视觉思维链:内化视觉思维的主动视频推理

Hugging Face Daily Papers ↗ · 2026-08-16 缓存

本文介绍了内化视觉思维(IVT),一个后训练框架,该框架训练多模态模型预测未来帧嵌入,从而无需合成中间图像即可直接生成答案,将主动视频推理的延迟降低5倍以上。

0 人收藏 0 人点赞
#visual-reasoning

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers ↗ · 2026-08-08 缓存

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

0 人收藏 0 人点赞
#visual-reasoning

在测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

arXiv cs.CL ↗ · 2026-08-05 缓存

本文提出了一种面向大型视觉语言模型的测试时对齐方法,利用轨迹引导的结构化采样和迭代MCMC细化,在不进行大量后训练的情况下提高视觉推理准确性。

0 人收藏 0 人点赞
#visual-reasoning

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers ↗ · 2026-08-05 缓存

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

0 人收藏 0 人点赞
#visual-reasoning

Beacon:知道何时以及如何进行智能体视觉推理

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。

0 人收藏 0 人点赞
#visual-reasoning

视频模型中的视觉提示(阅读时间8分钟)

TLDR AI ↗ · 2026-07-30 缓存

视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。

0 人收藏 0 人点赞
#visual-reasoning

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG ↗ · 2026-07-28 缓存

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

0 人收藏 0 人点赞
#visual-reasoning

视频模型的视觉提示工程

Hugging Face Daily Papers ↗ · 2026-07-28 缓存

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

0 人收藏 0 人点赞
#visual-reasoning

Trace:基于分类指导的多领域视觉推理环境

Hugging Face Daily Papers ↗ · 2026-07-22 缓存

TRACE是一个基于分类指导的环境,包含跨11个领域的1000个视觉推理任务。在64,000个TRACE实例上训练Qwen2.5-VL-3B和Qwen2.5-VL-7B,使其在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。

0 人收藏 0 人点赞
#visual-reasoning

层次化去噪用于多步视觉推理

Hugging Face Daily Papers ↗ · 2026-07-16 缓存

HDR 是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步视觉推理。与基线方法相比,它实现了更好的推理一致性、更低的延迟和强大的数据效率。

0 人收藏 0 人点赞
#visual-reasoning

UniVR:在视觉空间中思考以实现统一视觉推理

Hugging Face Daily Papers ↗ · 2026-07-14 缓存

UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。

0 人收藏 0 人点赞
#visual-reasoning

@_jasonwei: Muse Spark 1.1 在放射学最后考试中表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们尚未超越 Fable(目前)。而人类...

X AI KOLs Following ↗ · 2026-07-13 缓存

Muse Spark 1.1 在放射学最后考试 2.0(一项面向医疗自主 AI 诊断的新型视觉推理基准)上表现优于 GPT-5.6 Sol 和 Gemini 3.1,但落后于 Fable 和人类放射科医生。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈