Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
Summary
Audio-Visual Flamingo (AV-Flamingo) is a fully open audio-visual large language model designed for understanding and reasoning over long and complex videos, outperforming similarly sized open models and competitive with larger models.
View Cached Full Text
Cached at: 07/20/26, 09:40 AM
Paper page - Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
Source: https://huggingface.co/papers/2607.16107 Authors:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
Abstract
WepresentAudio-VisualFlamingo(AV-Flamingo),afullyopenstate-of-the-artaudio-visuallargelanguagemodel(AV-LLM)forjointunderstandingandreasoningoveraudio,images,andlong-formvideos.UnlikepriorAV-LLMsthatprimarilyfocusonshortclips,AV-Flamingoisdesignedforunderstandingandreasoningoverlongandcomplexreal-world(audio-visual)videos.Tosupportthis,wemakethreekeycontributions:(i)Audio-Visual-Skills,alarge-scalecollectionofreal-worldvideoswith~7Mcaptionandquestion-answertraininginstancesdesignedtoemphasizetemporal,compositional,andcross-modalaudio-visualreasoning;(ii)anovelthree-stagecurriculumthatprogressivelytrainsthemodelfromshort-rangeperceptiontolong-horizonmulti-eventreasoning;and(iii)TemporalAudio-VisualInterleavedChain-of-Thought,areasoningframeworkthatexplicitlygroundsintermediatereasoningstepstotimestampsinlongaudio-visualstreams,improvingtemporalalignmentandinterpretability.Extensiveexperimentsacross15+audio-visual,omni-modal,audio,andvisionbenchmarksshowthatAV-Flamingooutperformssimilarlysizedopenmodelsbyclearmarginsandremainshighlycompetitivewith,andinsomecasessurpasses,muchlargeropen-weightandclosedmodels,particularlyonlongandcomplexreal-worldaudio-visualunderstandingandreasoningtasks.Beyondbenchmarkperformance,AV-Flamingoexhibitsstrongreal-worldutilityandtransferswelltounseentasks,highlightingitsrobustnessandgeneralizationability.
View arXiv pageView PDFProject pageAdd to collection
Get this paper in your agent:
hf papers read 2607\.16107
Don’t have the latest CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
Models citing this paper1
Datasets citing this paper1
#### nvidia/av-skills Viewer• Updatedabout 7 hours ago • 23.6k • 10 • 2
Spaces citing this paper1
Collections including this paper0
No Collection including this paper
Add this paper to acollectionto link it from this page.
Similar Articles
Audio-Visual Intelligence in Large Foundation Models
This survey paper provides a comprehensive review of audio-visual intelligence within large foundation models, establishing a unified taxonomy, synthesizing core methodologies, and outlining key datasets, benchmarks, and open research challenges.
AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression
AVOC introduces a retrieval-inspired token compression method for omni-modal LLMs that effectively handles hour-long audio-video inputs by selecting informative tokens based on relevance, importance, and diversity. The framework achieves state-of-the-art results on long-form audio-video understanding benchmarks, surpassing prior methods by significant margins.
VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding
VideoChat3 is a fully open, efficient, and generalist video-centric multimodal large language model that introduces Inflated 3D Vision Transformer (I3D-ViT) and Adaptive Frame Resolution for streaming video perception, along with scalable video data synthesis pipelines, achieving superior performance with only 4B parameters.
BFL Introduces FLUX 3 - multi-modal model for Image, Video and Audio
BFL has introduced FLUX 3, a multi-modal AI model capable of generating images, videos, and audio.
OmniVideo-100K: A Dataset for Audio-Visual Reasoning through Structured Scripts and Evidence Chains
OmniVideo-100K introduces an automated data engine with entity-anchored scripting and clue-guided QA generation to improve audio-visual reasoning and temporal consistency, achieving significant performance gains across multiple benchmarks.