visual-reasoning

Tag

Cards List
#visual-reasoning

Astra leads in IKEA furniture assembly

Reddit r/singularity ↗ · 2h ago Cached

Epoch AI created the Furniture Assembly Benchmark (FAB) to test AI models' visual reasoning in spotting mistakes in IKEA assembly photos. OpenAI's GPT-6 Astra leads with 80% accuracy, showing major improvements over previous models.

0 favorites 0 likes
#visual-reasoning

UniCAR-RL: Seeing Better before Thinking Deeper in Visual Mathematics

arXiv cs.AI ↗ · 2026-09-15 Cached

UniCAR-RL introduces a reinforcement learning framework that decouples perception and reasoning to improve multimodal large language models' visual mathematical reasoning without annotation.

0 favorites 0 likes
#visual-reasoning

Do Multimodal LLMs See Before They Read? Diagnosing Contextual Sycophancy

arXiv cs.CL ↗ · 2026-09-02 Cached

The paper introduces multimodal contextual sycophancy in large language models, where external text overrides visual evidence, and proposes a diagnostic method using System-2 Visual Arbitration to improve performance.

0 favorites 0 likes
#visual-reasoning

CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions

arXiv cs.CL ↗ · 2026-09-01 Cached

CoVA-SFT is a large-scale dataset and benchmark designed to train multimodal language models in chain of visual abstractions, improving performance over baselines in visual reasoning tasks.

0 favorites 0 likes
#visual-reasoning

TempCloze: Can Video-LLMs Identify the Missing Middle?

Hugging Face Daily Papers ↗ · 2026-09-01 Cached

TempCloze is a video cloze benchmark for evaluating visual temporal reasoning in Video-LLMs, requiring models to identify missing video segments from distractors to reduce linguistic shortcuts in semantics, alignment, and progression.

0 favorites 0 likes
#visual-reasoning

I think we might have been thinking about mobile agents the wrong way. APIs give you control, but understanding the screen gives you something else.

Reddit r/AI_Agents ↗ · 2026-08-29

The author questions traditional mobile agent approaches relying on API access and proposes using screen understanding via hardware like aiden-firmware to enable more general-purpose agents that interact like humans.

0 favorites 0 likes
#visual-reasoning

Reflection with Action-Induced Visual Differences for Desktop GUI Agents

arXiv cs.AI ↗ · 2026-08-26 Cached

This paper proposes Evidence-First Reflection (EFR) to improve reflection in desktop GUI agents by decoupling action-induced visual difference extraction from outcome verification, yielding accuracy gains of 7.11% on benchmarks.

0 favorites 0 likes
#visual-reasoning

VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-08-26 Cached

VBVR-Pro introduces a closed-loop testbed for scalable and verifiable native visual reasoning through generation, featuring task scaling, verifiable rewards, and mechanism studies across diverse visual substrates.

0 favorites 0 likes
#visual-reasoning

VGI-BENCH: Probing Visual Intelligence in Video Generation Models

Hugging Face Daily Papers ↗ · 2026-08-20 Cached

VGI-Bench evaluates visual reasoning in video generation models through 27 tasks, revealing limited reliability and self-correction in current systems.

0 favorites 0 likes
#visual-reasoning

Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

Hugging Face Daily Papers ↗ · 2026-08-16 Cached

The paper introduces Internalized Visual Thinking (IVT), a post-training framework that trains multimodal models to predict future frame embeddings, enabling direct answer generation without synthesizing intermediate images, thereby reducing latency over 5x for proactive video reasoning.

0 favorites 0 likes
#visual-reasoning

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-08-08 Cached

This paper introduces Counterfactual Evidence Disentanglement (CED), a training-time method that makes vision-language models rely on concrete image evidence rather than language priors or shortcuts, improving visual reasoning grounding across benchmarks.

0 favorites 0 likes
#visual-reasoning

Aligning Large Vision-Language Models at Test Time: A Trajectory-Guided Structured Sampling Approach

arXiv cs.CL ↗ · 2026-08-05 Cached

This paper proposes a test-time alignment approach for large vision-language models using trajectory-guided structured sampling and iterative MCMC refinement, improving visual reasoning accuracy without heavy post-training.

0 favorites 0 likes
#visual-reasoning

OPD-V: Visual On-Policy Self-Distillation with Modality Balance

Hugging Face Daily Papers ↗ · 2026-08-05 Cached

Introduces OPD-V, a visual on-policy self-distillation paradigm for multimodal large language models that leverages positive and negative teachers to exploit modality balance as privileged information, improving reasoning performance across benchmarks while reducing training cost.

0 favorites 0 likes
#visual-reasoning

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-07-30 Cached

This paper introduces Beacon, an agentic visual reasoning model that improves multimodal LLMs' ability to decide when to use tools and benefit from tool use, using Necessity-Aware Adaptive Reward and Hint-Guided Capability Expansion in reinforcement learning.

0 favorites 0 likes
#visual-reasoning

Visual Prompts in Video Models (8 minute read)

TLDR AI ↗ · 2026-07-30 Cached

Visual prompt engineering (VIPE) automatically modifies task images to improve video model reasoning performance, often more effective than text-based prompting or test-time scaling.

0 favorites 0 likes
#visual-reasoning

Self-Boosting Vision-Language Models with Noisy Student On-Policy Self-Distillation

arXiv cs.LG ↗ · 2026-07-28 Cached

Proposes NOPD, a self-distillation method that improves vision-language models without external supervision by leveraging prediction discrepancies between clean and corrupted inputs. Achieves significant gains on visual reasoning tasks, matching or exceeding RL and distillation from external models.

0 favorites 0 likes
#visual-reasoning

Visual prompt engineering for video models

Hugging Face Daily Papers ↗ · 2026-07-28 Cached

This paper introduces Visual Prompt Engineering (VIPE), a method that automatically modifies task images to improve video model performance, showing it can be more effective than text-based prompt engineering or test-time scaling.

0 favorites 0 likes
#visual-reasoning

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-07-22 Cached

TRACE is a taxonomy-guided environment with 1,000 visual reasoning tasks across 11 domains. Training Qwen2.5-VL-3B and Qwen2.5-VL-7B on 64,000 TRACE instances improves their macro-average performance across 24 external benchmarks by 3.51 and 4.06 percentage points respectively.

0 favorites 0 likes
#visual-reasoning

Hierarchical Denoising For Multi-Step Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-07-16 Cached

HDR is a unified framework integrating hierarchical latents into causal video generation for multi-step visual reasoning, achieving better reasoning consistency, lower latency, and strong data efficiency compared to baselines.

0 favorites 0 likes
#visual-reasoning

UniVR: Thinking in Visual Space for Unified Visual Reasoning

Hugging Face Daily Papers ↗ · 2026-07-14 Cached

UniVR introduces VR-GRPO, a reinforcement learning paradigm for unified visual reasoning, learning complex reasoning and physical dynamics from pure visual demonstrations, achieving up to 25% improvement on the VR-X benchmark.

0 favorites 0 likes
Next →
← Back to home

Submit Feedback