audio-visual

标签

Cards List
#audio-visual

FRCTL

Product Hunt ↗ · 2026-09-21 缓存

FRCTL 是一个浏览器端的引擎,供艺术家创建媒体、进行现场视觉表演,并在社区驱动平台上销售预设。

0 人收藏 0 人点赞
#audio-visual

Omni Demand Understanding: 多模态交互中上下文用户意图推理的基准测试

arXiv cs.CL ↗ · 2026-09-21 缓存

本文介绍了Omni Demand Understanding (ODU),一个评估多模态AI模型如何从复杂音视频交互中推断用户需求的基准测试,揭示了当前模型中显著的性能差距。

0 人收藏 0 人点赞
#audio-visual

OmniEcho: 面向具身智能体的空间音频理解

Hugging Face Daily Papers ↗ · 2026-09-20 缓存

OmniEcho引入了一种空间感知的全模态模型和一个新的基准,用于具身智能体的空间音频-视觉感知和导航,实现了最先进的性能。

0 人收藏 0 人点赞
#audio-visual

Realtime-Venus:具有异步委托的全双工交互系统

Hugging Face Daily Papers ↗ · 2026-09-12 缓存

Realtime-Venus是一个主动全双工交互系统,通过两个独立训练的9B模型集成了持续感知、对话控制和原生语音生成,在音频和视频基准测试中取得高分。

0 人收藏 0 人点赞
#audio-visual

UniSwap:面向说话视频的流式音视频身份交换

Hugging Face Daily Papers ↗ · 2026-08-13 缓存

UniSwap 是一个用于说话视频中联合音视频身份交换的新框架,利用统一的流式音视频扩散 Transformer 来替换外观和嗓音音色,同时保留源内容与动态。

0 人收藏 0 人点赞
#audio-visual

从语音到交互:鸡尾酒会场景中的多模态系统分析

arXiv cs.CL ↗ · 2026-08-11 缓存

本文分析了针对CHiME-9 MCoRec鸡尾酒会场景的多模态系统,比较了音视频目标语音分离、改进的识别、基于大语言模型的对话分组等设计策略,发现仅语音重叠并不能解释性能差异。

0 人收藏 0 人点赞
#audio-visual

@samsja19:很棒的基准

X AI KOLs Following ↗ · 2026-08-08 缓存

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。

0 人收藏 0 人点赞
#audio-visual

ByteDance SeedRealtime(4分钟阅读)

TLDR AI ↗ · 2026-08-06

ByteDance发布了SeedRealtime,这是一个原生音视频模型,能够处理连续的视频、音频和文本,同时进行实时语音输出。

0 人收藏 0 人点赞
#audio-visual

FATE:帧级音视频时间嵌入

Hugging Face Daily Papers ↗ · 2026-08-02 缓存

提出FATE,一种帧级音视频时间嵌入方法,将帧序列在物理时间轴上对齐,实现语义与时间的联合理解。在时间检索、事件定位和生成评估指标上均优于基线方法。

0 人收藏 0 人点赞
#audio-visual

AV-JEPA: 将LeJEPA扩展到音视频自监督学习

arXiv cs.AI ↗ · 2026-07-20 缓存

AV-JEPA将LeJEPA扩展到音视频自监督学习,在潜在空间中实现跨模态对齐,无需解码器、对比负样本或复杂损失函数,并在VGGSound和AudioSet上取得了有竞争力的分类结果。

0 人收藏 0 人点赞
#audio-visual

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

Hugging Face Daily Papers ↗ · 2026-07-17 缓存

视听火烈鸟(AV-Flamingo)是一个完全开放的视听大语言模型,专为理解和推理长视频及复杂视频而设计,在性能上优于同规模的开源模型,并与更大型模型竞争。

0 人收藏 0 人点赞
#audio-visual

视频 = 世界 + 事件流

Hugging Face Daily Papers ↗ · 2026-07-16 缓存

Wan-Streamer v0.3 将视频重新定义为世界加事件流,引入了一个用于实时音视频交互的通用预训练任务。它实现了低延迟的全双工交互,模型端响应延迟为 200 毫秒。

0 人收藏 0 人点赞
#audio-visual

OmniFocus: 查询引导的模态平衡令牌压缩方法用于全模态大语言模型

arXiv cs.LG ↗ · 2026-07-07 缓存

OmniFocus 是一种无需训练、查询引导的令牌压缩方法,用于全模态大语言模型,它独立估计视频和音频的重要性,以保留模态特定的证据同时保持对齐,在低令牌保留比率下实现了显著的推理加速,同时精度损失极小。

0 人收藏 0 人点赞
#audio-visual

Wan-Streamer v0.2:更高分辨率,相同延迟

Hugging Face Daily Papers ↗ · 2026-07-05 缓存

Wan-Streamer v0.2 是一个保持延迟不变升级的端到端音视频交互模型,通过多GPU思考者-执行者架构将输出分辨率从192x336提高到640x368,同时维持约200毫秒的模型端延迟。

0 人收藏 0 人点赞
#audio-visual

Wan-Streamer v0.1:端到端实时交互基础模型

Hugging Face Daily Papers ↗ · 2026-06-23 缓存

Wan-Streamer是一个统一的端到端多模态模型,用于实时音视频交互,采用因果注意力机制,并集成处理视觉、音频和文本模态,实现了亚秒级延迟。

0 人收藏 0 人点赞
#audio-visual

MaineCoon: 追求实时视听社交世界模型

Hugging Face Daily Papers ↗ · 2026-06-16 缓存

MaineCoon是一个220亿参数的实时视听自回归模型,用于社交世界建模,能够在单个GPU上以高达47.5 FPS进行流式生成,并引入了新颖的训练技术和智能体推理框架。

0 人收藏 0 人点赞
#audio-visual

OmniVideo-100K:一个通过结构化脚本和证据链进行音视频推理的数据集

Hugging Face Daily Papers ↗ · 2026-06-12 缓存

OmniVideo-100K介绍了一个自动化的数据引擎,通过实体锚定脚本和线索引导的问答生成来提升音视频推理和时间一致性,在多个基准测试上实现了显著的性能提升。

0 人收藏 0 人点赞
#audio-visual

从感知到决策:多模态大语言模型中听觉与视觉感知的信息流

arXiv cs.AI ↗ · 2026-06-10 缓存

本文研究了音频与视觉信息在音频-视觉大语言模型(AVLLMs)中的流动方式,揭示了AVLLMs根据输入配置采取顺序或并行路由,并且某些token在信息传输后可被丢弃以提高效率。

0 人收藏 0 人点赞
#audio-visual

OmniMem: 面向流式音视频大模型的扰动感知记忆压缩

arXiv cs.AI ↗ · 2026-06-09 缓存

OmniMem 引入了一种面向流式音视频大模型的模态感知记忆分配与扰动感知选择策略,在长视频基准测试上相比压缩基线实现了2-4%的绝对准确率提升。

0 人收藏 0 人点赞
#audio-visual

面向音视频事件定位的层次化语义约束异构图

arXiv cs.AI ↗ · 2026-06-08 缓存

提出了一种层次化语义约束异构图模型,用于开放词汇的音视频事件定位,解决了多个时间尺度上的跨模态一致性问题以及片段级和视频级之间的层次语义约束问题。在OV-AVEL基准上取得了最先进的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈