audio-video-generation

标签

Cards List
#audio-video-generation

@rohanpaul_ai:一个非常酷的实时视频模型刚刚发布,用于交互式角色和世界

X AI KOLs Following ↗ · 昨天 缓存

Vivix.AI 发布了 A1,一个面向交互式角色和世界的实时视频模型,通过小段连续片段同时生成音频与视频,从而实现无缝打断,以及带有持久状态的实时长对话。

0 人收藏 0 人点赞
#audio-video-generation

AV-GRPO:基于模态锚定的解耦扩散强化学习,用于联合音视频生成

Hugging Face Daily Papers ↗ · 2026-09-24 缓存

本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。

0 人收藏 0 人点赞
#audio-video-generation

缺失的时间链接:用于脚本驱动音视频生成的Temporal Context Routing

Hugging Face Daily Papers ↗ · 2026-09-02 缓存

Temporal Context Routing通过将脚本时间映射到共享的视频-音频时间轴,提升了联合音视频生成中脚本对齐的时间准确性,减少了镜头边界和对话的错误。

0 人收藏 0 人点赞
#audio-video-generation

DreamX-Creator:实现2K分辨率的原生音频-视频生成民主化

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

DreamX-Creator 1.0 是一个紧凑的7B原生联合音频-视频生成器,它利用跨模态注意力、渐进式训练和强化学习来产生同步的2K分辨率输出,旨在实现高质量音频-视频生成的民主化。

0 人收藏 0 人点赞
#audio-video-generation

Multi2AV-Safety:多模态到音频-视频生成的安全基准测试

arXiv cs.AI ↗ · 2026-08-28 缓存

Multi2AV-Safety是首个用于评估多模态到音频-视频生成安全性的基准,覆盖了所有11种非单例条件配置,包含11,024个攻击实例,并揭示了有害语义从良性输入中显现的组合风险。

0 人收藏 0 人点赞
#audio-video-generation

lightx2v/MiniMax-H3-Prompt-Rewriter-LoRA

Hugging Face Models Trending ↗ · 2026-08-07 缓存

LightX2V releases an open, local LoRA prompt rewriter for MiniMax-H3 text-to-audio-video generation, fine-tuned on Qwen3.6-27B to expand short prompts into structured audio-video descriptions.

0 人收藏 0 人点赞
#audio-video-generation

MultiRef-Compass: 迈向多参考到音频视频生成的全面评估

Hugging Face Daily Papers ↗ · 2026-07-15 缓存

本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。

0 人收藏 0 人点赞
#audio-video-generation

AVTok: 面向整体音视频生成的一维统一标记化

Hugging Face Daily Papers ↗ · 2026-06-29 缓存

AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。

0 人收藏 0 人点赞
#audio-video-generation

MSAVBench:迈向多镜头音视频生成的全面可靠评估

Hugging Face Daily Papers ↗ · 2026-05-19 缓存

MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。

0 人收藏 0 人点赞
#audio-video-generation

Lightricks/LTX-2

GitHub Trending (daily) ↗ · 2026-06-18 缓存

LTX-2 是 Lightricks 推出的首个基于 DiT 的音频-视频基础模型,提供同步音频和视频生成、高保真度以及可投入生产的输出,并附带开源代码和开放模型权重。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈