标签
Elon Musk 转发了一位用户讨论使用 Claude AI 生成关于西方文明的视频。
GPT-6 Astra使用p5.js代码生成了一个关于时间的4K视频,涵盖了从大爆炸到编写自身代码的过程,展示了可编辑的AI生成内容。
Google 推出 Gemini 3.8 Live with Live Avatar,这是一项更新,将实时视觉虚拟形象集成到对话式 AI 中,通过唇形同步、多语言支持和异步工具执行等功能增强交互,适用于企业应用。
Jakob Porchman from Black Forest Labs presented at AI Engineer Paris on customizing the Flux video generation model for robot control and gaming, highlighting methods like prompt upsampling and content moderation.
WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。
ViRDM是一种使用表示分布匹配的少步因果视频生成方法,通过在单GPU或多GPU上高效训练,取得了比基于DMD的基线更好的结果。
本文比较了Luma Labs的Dream Machine和Invideo,得出结论:Luma更适合单个高质量电影镜头,而Invideo在从剧本到成品的全流程电影制作中表现出色,支持AI配音和连续性。
本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。
本文介绍了RecCAR,一种正则化方法,用于解决联合多模态扩散变换器中的互惠对应差距,从而提高视频生成任务的性能。
PixVerse R2 引入了一种统一的缩放架构,用于实时视听世界模型,利用块稀疏注意力机制和持续预训练来增强视频生成和交互控制。
Higgsfield AI 正在推广其 API 最高 50% 的折扣,该 API 可访问视频和图像模型,如 Higgsfield Genjutsu 和 Cinema Studio 4.0,用于构建 AI 应用程序。
一家生物计算初创公司 The Biological Computing Company 正在 Amazon Web Services 上提供其基于老鼠大脑的 AI 模型用于视频生成,进行有限预览,推动生物计算领域的发展。
这篇文章讨论了AI视频生成的挑战,强调虽然像PixVerse这样的工具可以生成片段,但制作具有叙事的完整视频仍然需要大量的人工努力和创造力。
Perplexity Computer 已使用 MiniMax H3 和 ByteDance Seedance 2.5 模型添加了视频生成功能,允许 Pro 和 Max 订阅者在一个会话中创建视频和图像。
内容表达了将AI视频的看法从消极转向积极的乐观态度,引用了一篇文章,该文章将Astra定位为使用AI进行视频创作的创意工作者的转折点。
Benjamin DEKR 分享了 Runway Labs 关于他们的实时视频接口能够在场景中实现丰富交互的引言。
用户展示使用 Codex 和 Blender 制作 4K 雨夜 711 场景,达到商业电影质感,表明这些工具可用于创作专业级内容。
本文提出了VideoGen-Agent,一种基于强化学习的多模态智能体,它协调工具进行视频生成,在新的VABench基准测试上显著提升了性能。
WorldCrafter是一个视频世界模型,它学习一个可相机查询的隐式3D感知记忆,用于从单张图像或文本提示进行一致且相机可控的流式场景探索。
一位用户分享了使用 Remotion 和 GLM 5.3 Flash 模型生成关于股市分析的动态图形视频的积极体验,指出其有效性和未来可负担性的潜力。