visual-reasoning

标签

Cards List
#visual-reasoning

在测试时对齐大型视觉语言模型:一种轨迹引导的结构化采样方法

arXiv cs.CL · 4天前 缓存

本文提出了一种面向大型视觉语言模型的测试时对齐方法,利用轨迹引导的结构化采样和迭代MCMC细化,在不进行大量后训练的情况下提高视觉推理准确性。

0 人收藏 0 人点赞
#visual-reasoning

OPD-V:具有模态平衡的视觉在策略自蒸馏

Hugging Face Daily Papers · 4天前 缓存

介绍了 OPD-V,一种用于多模态大语言模型的视觉在策略自蒸馏范式,利用正负教师将模态平衡作为特权信息,在降低训练成本的同时提高跨基准的推理性能。

0 人收藏 0 人点赞
#visual-reasoning

Beacon:知道何时以及如何进行智能体视觉推理

Hugging Face Daily Papers · 2026-07-30 缓存

本文介绍了 Beacon,一种智能体视觉推理模型,通过强化学习中的必要性感知自适应奖励和提示引导的能力扩展机制,提升了多模态大语言模型(MLLMs)决定何时使用工具以及从工具使用中获益的能力。

0 人收藏 0 人点赞
#visual-reasoning

视频模型中的视觉提示(阅读时间8分钟)

TLDR AI · 2026-07-30 缓存

视觉提示工程(VIPE)自动修改任务图像以提升视频模型的推理性能,通常比基于文本的提示或测试时缩放更为有效。

0 人收藏 0 人点赞
#visual-reasoning

基于噪声学生在线策略自蒸馏的自增强视觉语言模型

arXiv cs.LG · 2026-07-28 缓存

提出NOPD,一种自蒸馏方法,通过利用干净输入和损坏输入之间的预测差异,在没有外部监督的情况下改进视觉语言模型。在视觉推理任务上取得了显著提升,匹配或超过了强化学习和来自外部模型的蒸馏。

0 人收藏 0 人点赞
#visual-reasoning

视频模型的视觉提示工程

Hugging Face Daily Papers · 2026-07-28 缓存

本文介绍了视觉提示工程(VIPE),一种自动修改任务图像以提升视频模型性能的方法,表明它可能比基于文本的提示工程或测试时缩放更为有效。

0 人收藏 0 人点赞
#visual-reasoning

Trace:基于分类指导的多领域视觉推理环境

Hugging Face Daily Papers · 2026-07-22 缓存

TRACE是一个基于分类指导的环境,包含跨11个领域的1000个视觉推理任务。在64,000个TRACE实例上训练Qwen2.5-VL-3B和Qwen2.5-VL-7B,使其在24个外部基准上的宏平均性能分别提升了3.51和4.06个百分点。

0 人收藏 0 人点赞
#visual-reasoning

层次化去噪用于多步视觉推理

Hugging Face Daily Papers · 2026-07-16 缓存

HDR 是一个统一框架,将层次化潜变量集成到因果视频生成中,用于多步视觉推理。与基线方法相比,它实现了更好的推理一致性、更低的延迟和强大的数据效率。

0 人收藏 0 人点赞
#visual-reasoning

UniVR:在视觉空间中思考以实现统一视觉推理

Hugging Face Daily Papers · 2026-07-14 缓存

UniVR提出了VR-GRPO,一种用于统一视觉推理的强化学习范式,能够从纯视觉演示中学习复杂推理和物理动力学,在VR-X基准测试上实现了高达25%的性能提升。

0 人收藏 0 人点赞
#visual-reasoning

@_jasonwei: Muse Spark 1.1 在放射学最后考试中表现优于 GPT-5.6 Sol 和 Gemini 3.1。我们尚未超越 Fable(目前)。而人类...

X AI KOLs Following · 2026-07-13 缓存

Muse Spark 1.1 在放射学最后考试 2.0(一项面向医疗自主 AI 诊断的新型视觉推理基准)上表现优于 GPT-5.6 Sol 和 Gemini 3.1,但落后于 Fable 和人类放射科医生。

0 人收藏 0 人点赞
#visual-reasoning

moondream3.1-9B-A2B

Reddit r/LocalLLaMA · 2026-07-12 缓存

Moondream 3.1 是一款采用混合专家架构的视觉语言模型(总参数量9B,激活参数量2B),提供最先进的视觉推理、检测、指点和描述功能,可通过 Photon 推理引擎本地部署,或通过 Moondream Cloud API 使用。

0 人收藏 0 人点赞
#visual-reasoning

论视觉推理中的局部性与长度泛化

Hugging Face Daily Papers · 2026-07-10 缓存

本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。

0 人收藏 0 人点赞
#visual-reasoning

MentalThink:在Mental SVG World中塑造思维

arXiv cs.AI · 2026-07-07 缓存

MentalThink 引入了一种视觉-符号推理范式,用于多模态大语言模型(MLLMs),该范式使用SVG代码作为中间视觉表示进行多轮推理。通过SFT和RL的两阶段训练,在空间推理基准上取得了出色表现。

0 人收藏 0 人点赞
#visual-reasoning

PixelEyes:解耦感知与推理,实现精准视觉证据搜寻

Hugging Face Daily Papers · 2026-06-30 缓存

PixelEyes 提出了一种多轮视觉推理代理,通过掩码引导搜索和语义区域广度优先搜索解耦感知与推理,并引入新基准(Pinpoint-Bench)和数据集(PixelEyes-6K),以提升视觉证据搜寻中的定位能力。

0 人收藏 0 人点赞
#visual-reasoning

V-Zero: 基于对比证据门控的无答案标签在线策略蒸馏用于细粒度视觉推理

Hugging Face Daily Papers · 2026-06-24 缓存

V-Zero 是一种新颖的无标签框架,用于细粒度视觉推理,它利用对比证据门控和在线策略蒸馏,无需标注答案标签即可提升性能,且训练速度远超传统方法。

0 人收藏 0 人点赞
#visual-reasoning

VeriEvol: 通过可验证的Evol-Instruct扩展多模态数学推理

Hugging Face Daily Papers · 2026-06-22 缓存

VeriEvol是一个新颖的框架,用于在视觉数学推理中扩展强化学习,通过一个双轴方法来确保可靠的奖励标签,该双轴方法将提示难度与答案可靠性分离,使用进化算子和假设检验验证。它在五个基准的视觉数学测试集上取得了显著的准确率提升。

0 人收藏 0 人点赞
#visual-reasoning

视觉具象化推理

Hugging Face Daily Papers · 2026-06-15 缓存

本文介绍了视觉具象化推理,一种使视觉语言模型能够将自然语言推理与使用点或框的明确视觉证据基础相结合的方法。一个可扩展的合成流水线和基础感知的强化学习提高了推理准确性,使得一个4B模型在空间和计数基准上能够匹配甚至超越一个27B模型。

0 人收藏 0 人点赞
#visual-reasoning

Visual Para-Thinker++: 视觉推理的单策略多智能体框架

Hugging Face Daily Papers · 2026-06-08 缓存

Visual Para-Thinker++提出了一种用于视觉推理的单策略多智能体框架,该框架使用角色条件化智能体(主智能体、工作智能体、汇总智能体)和专用训练方法,以减少幻觉并提高效率,在幻觉敏感基准测试上优于基线。

0 人收藏 0 人点赞
#visual-reasoning

DyCo-RL: 动态跨模态协调用于视觉推理

Hugging Face Daily Papers · 2026-06-06 缓存

本文指出,视觉推理中的失败往往源于思维链生成过程中视觉与文本证据之间的动态跨模态协调崩溃。它介绍了DyCo-RL,一个强化学习框架,通过奖励有效的跨模态协调来提升推理性能。

0 人收藏 0 人点赞
#visual-reasoning

可微分高效算子搜索

arXiv cs.LG · 2026-06-05 缓存

介绍了高效算子搜索(EOS),这是一个统一的可微分框架,将令牌缩减方法(剪枝、合并、池化、自适应重加权)泛化到共享算子空间,在预算约束下自动搜索最优算子组合。该方法在多个基准上取得有竞争力的结果,并揭示了一致的算子模式。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈