大型基础模型中的视听智能
摘要
本综述论文全面回顾了大型基础模型中的视听智能,建立了统一的分类体系,综合了核心方法论,并概述了关键数据集、基准和开放性研究挑战。
查看缓存全文
缓存时间: 2026/05/08 14:27
论文页 - 大型基础模型中的视听智能
来源:https://huggingface.co/papers/2605.04045 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
视听智能是一个通过大型基础模型整合听觉与视觉模态的多学科领域,涵盖从理解、生成到交互的各种任务,并具有统一的分类学与方法论基础。
视听智能(Audio-Visual Intelligence,简称AVI)(https://huggingface.co/papers?q=Audio-Visual%20Intelligence)已成为人工智能的核心前沿,它桥接听觉与视觉模态,使机器能够在多模态的真实世界中感知、生成和交互。在大型基础模型(https://huggingface.co/papers?q=large%20foundation%20models)时代,音频与视觉的联合建模变得愈发关键——不仅用于理解,还包括对动态、时间耦合信号的可控生成与推理。近期的进展,如Meta MovieGen和Google Veo-3,突显了工业界和学术界对统一视听架构日益增长的关注,这些架构从海量多模态数据(https://huggingface.co/papers?q=multimodal%20data)中学习。然而,尽管进展迅速,相关文献仍然零散,涵盖了多样化的任务、不一致的分类法以及异构的评估实践,阻碍了系统性的比较与知识整合。本综述首次通过大型基础模型(https://huggingface.co/papers?q=large%20foundation%20models)的视角,对AVI进行了全面回顾。我们建立了一个统一的分类法,覆盖AVI任务的广泛版图,从理解(如语音识别(https://huggingface.co/papers?q=speech%20recognition)、声音定位(https://huggingface.co/papers?q=sound%20localization))到生成(如音频驱动的视频合成(https://huggingface.co/papers?q=audio-driven%20video%20synthesis)、视频到音频(https://huggingface.co/papers?q=video-to-audio))再到交互(如对话(https://huggingface.co/papers?q=dialogue)、具身或智能体接口(https://huggingface.co/papers?q=agentic%20interfaces))。我们综合了方法论基础,包括模态标记化(https://huggingface.co/papers?q=modality%20tokenization)、跨模态融合(https://huggingface.co/papers?q=cross-modal%20fusion)、自回归和扩散生成(https://huggingface.co/papers?q=diffusion-based%20generation)、大规模预训练(https://huggingface.co/papers?q=large-scale%20pretraining)、指令对齐(https://huggingface.co/papers?q=instruction%20alignment)和偏好优化(https://huggingface.co/papers?q=preference%20optimization)。此外,我们精心整理了代表性数据集、基准和评估指标,提供了跨任务家族的结构化比较,并识别了在同步(https://huggingface.co/papers?q=synchronization)、空间推理(https://huggingface.co/papers?q=spatial%20reasoning)、可控性(https://huggingface.co/papers?q=controllability)和安全(https://huggingface.co/papers?q=safety)方面的开放挑战。通过将这一快速扩展的领域整合成一个连贯的框架,本综述旨在为未来大规模AVI研究提供基础性参考。
查看arXiv页面(https://arxiv.org/abs/2605.04045)查看PDF(https://arxiv.org/pdf/2605.04045)项目页面(https://javisverse.github.io/)GitHub(https://github.com/JavisVerse/Awesome-AVI)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.04045)
引用本论文的模型0
没有模型链接本论文
请在模型 README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。
引用本论文的数据集0
没有数据集链接本论文
请在数据集 README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。
引用本论文的Space0
没有Space链接本论文
请在Space README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。
包含本论文的收藏集0
没有收藏集包含本论文
请将本论文添加至收藏集(https://huggingface.co/new-collection)以从本页链接。
相似文章
Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos
视听火烈鸟(AV-Flamingo)是一个完全开放的视听大语言模型,专为理解和推理长视频及复杂视频而设计,在性能上优于同规模的开源模型,并与更大型模型竞争。
LTX-2:高效的联合音视频基础模型
LTX-2 是一款高效的联合音视频基础模型。文本内容混合了论文引用和关于国家面临生存威胁的视频脚本,但主要的分类目标是该 AI 模型论文。
从结构到协同:多模态大语言模型中视觉-语言感知范式演进的综述
本综述论文系统回顾了多模态大语言模型(MLLMs)中统一视觉-语言感知的范式演进,提出了五阶段分类法,并指出了通向通用多模态智能的开放挑战。
当视觉为声音代言
本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。
面向语言智能的可扩展视觉预训练
本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。