vision-language-model

Tag

Cards List
#vision-language-model

TANGO: Humanoid Navigation in Cluttered Environments with a Whole-Body Vision-Language-Action Model

Hugging Face Daily Papers ↗ · 2026-09-08 Cached

TANGO is a vision-language-action framework for humanoid robots to navigate cluttered environments using simulated training data, demonstrating state-of-the-art performance and zero-shot real-world deployment.

0 favorites 0 likes
#vision-language-model

CARDEA: Auditable Reasoning Grounded in Spatial Evidence for End-to-End Coronary Angiography Interpretation

Hugging Face Daily Papers ↗ · 2026-09-07 Cached

CARDEA is an AI model designed to provide auditable reasoning for coronary angiography interpretation using Chain-of-Box to indicate image regions, enhancing trust in clinical practice.

0 favorites 0 likes
#vision-language-model

@maximelabonne: Neat app to understand and explore VLM evals

X AI KOLs Timeline ↗ · 2026-09-05 Cached

A shared app for exploring and understanding vision language model evaluations, referencing a thread analyzing popular vision benchmarks.

0 favorites 0 likes
#vision-language-model

Jina-OCR-v1: Efficient Document Parsing with Speculative Decoding and Dense Verifiable Rewards

arXiv cs.CL ↗ · 2026-09-04 Cached

Jina-OCR-v1 is an efficient end-to-end document parsing model that uses speculative decoding and dense verifiable rewards to achieve high accuracy and speed on low-budget GPUs, scoring 91.14 on OmniDocBench v1.6 and 83.4 on olmOCR-Bench.

0 favorites 0 likes
#vision-language-model

Editable Visual Design

Hugging Face Daily Papers ↗ · 2026-09-03 Cached

A coding agent guided by vision-language models generates editable layered designs by synthesizing visual assets and refining HTML/CSS layouts, enabling post-editing with precise control.

0 favorites 0 likes
#vision-language-model

WorldReward: Reward Modeling for Camera-Conditioned World Models

Hugging Face Daily Papers ↗ · 2026-09-03 Cached

WorldReward introduces a vision-language reward model for camera-conditioned world models that unifies action-consistency and visual-quality evaluation through chunk decomposition and preference aggregation, outperforming existing methods like GPT-5.5 on benchmarks.

0 favorites 0 likes
#vision-language-model

@adithya_s_k: You can literally RL a 4B VLM to ace GeoGuesser > Open-source code, RL environment, dataset, training setup, evals, and…

X AI KOLs Timeline ↗ · 2026-09-02 Cached

An announcement that open-source resources, including code, RL environment, and dataset, will be released for using reinforcement learning on a 4B parameter vision-language model to excel at GeoGuesser, enabling full reproduction.

0 favorites 0 likes
#vision-language-model

SCAFFOLD: A Large-Scale Structured Dataset of Computer Science Research Figures with Diagram QA and Chain-of-Thought Reasoning Traces

arXiv cs.AI ↗ · 2026-09-02 Cached

SCAFFOLD is a large-scale dataset of computer science research figures paired with captions, context, QA, and Chain-of-Thought traces, aimed at improving vision-language model understanding of diagrams in CS papers.

0 favorites 0 likes
#vision-language-model

Parametric Multimodal User Memory: Storing What Captions Cannot Carry

arXiv cs.CL ↗ · 2026-09-01 Cached

This research paper introduces a parametric multimodal user memory system that improves AI agents' ability to recall users by integrating perceptual data like voice and appearance, using vision-language models and dedicated encoders to surpass text-based methods.

0 favorites 0 likes
#vision-language-model

A Glance Is All You Need: Single-Pass Fine-Grained Image Captioning with SimLoss

Hugging Face Daily Papers ↗ · 2026-09-01 Cached

SimLoss uses embedding-space contrastive supervision to enable single-pass fine-grained image captioning that matches multi-stage quality at much lower latency, with variants like SimLoss FFT achieving high precision.

0 favorites 0 likes
#vision-language-model

FoldingAgent: Inferring Parametric Origami Procedures from Demonstration Videos

Hugging Face Daily Papers ↗ · 2026-08-31 Cached

FoldingAgent is an agentic framework that uses vision-language models and specialized tools to infer parametric origami folding programs from demonstration videos via sequential reasoning and physical verification.

0 favorites 0 likes
#vision-language-model

Introducing Parse: Enterprise document intelligence at scale (5 minute read)

TLDR AI ↗ · 2026-08-28 Cached

Cohere introduces Parse, a cost-effective vision language model for processing large volumes of enterprise documents into structured data, offering high performance and scalability for use cases like RAG and document indexing.

0 favorites 0 likes
#vision-language-model

Weaving Visual Narratives: Agentic Image Bundle Composition Beyond Atomic Visual Matching

Hugging Face Daily Papers ↗ · 2026-08-27 Cached

The paper introduces Image Bundle Composition (IBC) to shift image retrieval from atomic matching to dynamic composition of cohesive image bundles, addressing limitations in traditional approaches. It proposes a benchmark dataset IBCBench and an agentic framework BundleWeaver that leverages LLMs and VLMs for relational composition.

0 favorites 0 likes
#vision-language-model

1/100 → 44/100: fine-tuning a 450M VLM on 50K browser screenshots

Reddit r/LocalLLaMA ↗ · 2026-08-23

The article describes the process of fine-tuning a 450 million parameter vision-language model using 50,000 browser screenshots, showing progress from initial to current stages.

0 favorites 0 likes
#vision-language-model

@HuggingModels: Ever wanted an AI that can 'see' medical images and answer questions about them? This model, llava-medical-8B-clip-vit-…

X AI KOLs Timeline ↗ · 2026-08-23 Cached

The article introduces llava-medical-8B-clip-vit-stage2, a specialized vision-language model fine-tuned for healthcare, enabling AI to interpret medical images like X-rays and MRIs and answer related questions.

0 favorites 0 likes
#vision-language-model

QwenMix-3.7: Kept seeing posts about Qwen3.8 and 3.6 sharing the same structure.. so I had Qwen3.8 combine them.

Reddit r/LocalLLaMA ↗ · 2026-08-20 Cached

QwenMix-3.7 is a weight-interpolation merge of the Qwen3.6-27B and Qwen3.8-27B AI models, created using per-row norm preservation at t=0.5.

0 favorites 0 likes
#vision-language-model

SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation

Hugging Face Daily Papers ↗ · 2026-08-18 Cached

SemComp-Bench introduces a benchmark for evaluating semantic task completion in video generation, using a curated dataset and a vision-language model-based evaluation protocol to assess outcome achievement and generation reliability.

0 favorites 0 likes
#vision-language-model

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

Hugging Face Daily Papers ↗ · 2026-08-16 Cached

ConceptFormer learns continuous latent concept representations for visual document retrieval, bridging visual evidence and semantic relevance without text intermediates, achieving significant improvements over baselines.

0 favorites 0 likes
#vision-language-model

MOSS-VL Technical Report

Hugging Face Daily Papers ↗ · 2026-08-15 Cached

MOSS-VL is an open vision-language model family designed for real-time interaction, using gated cross-attention to process vision during generation and achieving top performance in streaming benchmarks among open-source models.

0 favorites 0 likes
#vision-language-model

LiquidAI LFM2.5-VL-3B: a 3.1B local VLM that beats Gemma-4 E4B — screen understanding 2.5 → 82.2

Reddit r/artificial ↗ · 2026-08-14

LiquidAI released LFM2.5-VL-3B, a 3.1B local vision-language model that outperforms Gemma-4 E4B and demonstrates a significant jump in screen understanding, making on-device AI more practical.

0 favorites 0 likes
← Previous
Next →
← Back to home

Submit Feedback