标签
Vivix.AI 发布了 A1,一个面向交互式角色和世界的实时视频模型,通过小段连续片段同时生成音频与视频,从而实现无缝打断,以及带有持久状态的实时长对话。
本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。
Temporal Context Routing通过将脚本时间映射到共享的视频-音频时间轴,提升了联合音视频生成中脚本对齐的时间准确性,减少了镜头边界和对话的错误。
DreamX-Creator 1.0 是一个紧凑的7B原生联合音频-视频生成器,它利用跨模态注意力、渐进式训练和强化学习来产生同步的2K分辨率输出,旨在实现高质量音频-视频生成的民主化。
Multi2AV-Safety是首个用于评估多模态到音频-视频生成安全性的基准,覆盖了所有11种非单例条件配置,包含11,024个攻击实例,并揭示了有害语义从良性输入中显现的组合风险。
LightX2V releases an open, local LoRA prompt rewriter for MiniMax-H3 text-to-audio-video generation, fine-tuned on Qwen3.6-27B to expand short prompts into structured audio-video descriptions.
本文介绍了MultiRef-Compass,这是针对多参考到音频视频生成的全面基准,包含350个精心挑选的样本和评估协议,涵盖四个维度:基础质量、参考一致性、音视频一致性和指令遵循。
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。
MSAVBench是首个面向多镜头音视频生成的综合基准与自适应评估框架,评估了19个模型在多样化任务上的表现,并与人类判断实现了高度对齐。
LTX-2 是 Lightricks 推出的首个基于 DiT 的音频-视频基础模型,提供同步音频和视频生成、高保真度以及可投入生产的输出,并附带开源代码和开放模型权重。