大型基础模型中的视听智能

Hugging Face Daily Papers 论文

摘要

本综述论文全面回顾了大型基础模型中的视听智能,建立了统一的分类体系,综合了核心方法论,并概述了关键数据集、基准和开放性研究挑战。

视听智能(AVI)已成为人工智能的核心前沿,它桥接听觉和视觉模态,使机器能够在多模态现实世界中感知、生成和交互。在大基础模型时代,音频与视觉的联合建模变得愈发关键,即不仅用于理解,也用于对动态、时间相关的信号进行可控生成和推理。最近的进展,如 Meta MovieGen 和 Google Veo-3,突显了工业界和学术界对从海量多模态数据中学习的统一音-视架构日益增长的关注。然而,尽管进展迅速,相关文献仍然零散,涵盖多种任务、不统一的分类体系以及异构的评估实践,阻碍了系统比较和知识整合。本综述首次从大型基础模型的视角对AVI进行了全面回顾。我们建立了一个统一的分类体系,涵盖了AVI任务的广泛领域,从理解(例如语音识别、声音定位)到生成(例如音频驱动的视频合成、视频转音频)以及交互(例如对话、具身或代理接口)。我们综合了方法论基础,包括模态标记化、跨模态融合、自回归和基于扩散的生成、大规模预训练、指令对齐和偏好优化。此外,我们整理了代表性的数据集、基准和评估指标,提供了跨任务家族的结构化比较,并识别了在同步、空间推理、可控性和安全性方面的开放性挑战。通过将这一快速扩展的领域整合到一个连贯的框架中,本综述旨在为未来关于大规模AVI的研究提供基础参考。
查看原文
查看缓存全文

缓存时间: 2026/05/08 14:27

论文页 - 大型基础模型中的视听智能

来源:https://huggingface.co/papers/2605.04045 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

视听智能是一个通过大型基础模型整合听觉与视觉模态的多学科领域,涵盖从理解、生成到交互的各种任务,并具有统一的分类学与方法论基础。

视听智能(Audio-Visual Intelligence,简称AVI)(https://huggingface.co/papers?q=Audio-Visual%20Intelligence)已成为人工智能的核心前沿,它桥接听觉与视觉模态,使机器能够在多模态的真实世界中感知、生成和交互。在大型基础模型(https://huggingface.co/papers?q=large%20foundation%20models)时代,音频与视觉的联合建模变得愈发关键——不仅用于理解,还包括对动态、时间耦合信号的可控生成与推理。近期的进展,如Meta MovieGen和Google Veo-3,突显了工业界和学术界对统一视听架构日益增长的关注,这些架构从海量多模态数据(https://huggingface.co/papers?q=multimodal%20data)中学习。然而,尽管进展迅速,相关文献仍然零散,涵盖了多样化的任务、不一致的分类法以及异构的评估实践,阻碍了系统性的比较与知识整合。本综述首次通过大型基础模型(https://huggingface.co/papers?q=large%20foundation%20models)的视角,对AVI进行了全面回顾。我们建立了一个统一的分类法,覆盖AVI任务的广泛版图,从理解(如语音识别(https://huggingface.co/papers?q=speech%20recognition)、声音定位(https://huggingface.co/papers?q=sound%20localization))到生成(如音频驱动的视频合成(https://huggingface.co/papers?q=audio-driven%20video%20synthesis)、视频到音频(https://huggingface.co/papers?q=video-to-audio))再到交互(如对话(https://huggingface.co/papers?q=dialogue)、具身或智能体接口(https://huggingface.co/papers?q=agentic%20interfaces))。我们综合了方法论基础,包括模态标记化(https://huggingface.co/papers?q=modality%20tokenization)、跨模态融合(https://huggingface.co/papers?q=cross-modal%20fusion)、自回归和扩散生成(https://huggingface.co/papers?q=diffusion-based%20generation)、大规模预训练(https://huggingface.co/papers?q=large-scale%20pretraining)、指令对齐(https://huggingface.co/papers?q=instruction%20alignment)和偏好优化(https://huggingface.co/papers?q=preference%20optimization)。此外,我们精心整理了代表性数据集、基准和评估指标,提供了跨任务家族的结构化比较,并识别了在同步(https://huggingface.co/papers?q=synchronization)、空间推理(https://huggingface.co/papers?q=spatial%20reasoning)、可控性(https://huggingface.co/papers?q=controllability)和安全(https://huggingface.co/papers?q=safety)方面的开放挑战。通过将这一快速扩展的领域整合成一个连贯的框架,本综述旨在为未来大规模AVI研究提供基础性参考。

查看arXiv页面(https://arxiv.org/abs/2605.04045)查看PDF(https://arxiv.org/pdf/2605.04045)项目页面(https://javisverse.github.io/)GitHub(https://github.com/JavisVerse/Awesome-AVI)加入收藏(https://huggingface.co/login?next=%2Fpapers%2F2605.04045)

引用本论文的模型0

没有模型链接本论文

请在模型 README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。

引用本论文的数据集0

没有数据集链接本论文

请在数据集 README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。

引用本论文的Space0

没有Space链接本论文

请在Space README.md 中引用 arxiv.org/abs/2605.04045 以从本页链接。

包含本论文的收藏集0

没有收藏集包含本论文

请将本论文添加至收藏集(https://huggingface.co/new-collection)以从本页链接。

相似文章

LTX-2:高效的联合音视频基础模型

Papers with Code Trending

LTX-2 是一款高效的联合音视频基础模型。文本内容混合了论文引用和关于国家面临生存威胁的视频脚本,但主要的分类目标是该 AI 模型论文。

当视觉为声音代言

Hugging Face Daily Papers

本文发现,具备视频处理能力的多模态大语言模型(MLLMs)表面上似乎能够理解音频,但实际上依赖视觉线索,这一失败模式被称为视听Clever Hans效应。我们提出了Thud,一个基于干预的探查框架来诊断该问题,并提出了一种对齐方案,将视听一致性提升了28个百分点。

面向语言智能的可扩展视觉预训练

Hugging Face Daily Papers

本文证明,无需文本提取的文档无监督视觉预训练在语言智能方面持续优于纯文本预训练,为基础模型提供了一种高效且可扩展的方法。