标签
Gemini Omni 1.1 Flash 是 Google 最新的多模态模型,为开发者引入了新的创作控制和生成视频能力。
字节跳动正在扩展其AI教育应用Gauth,利用AI生成的动画引导学生解决问题,这引发了人们对于此类工具究竟是真正提升理解力,还是仅仅制造学习错觉的质疑。
Pika Labs 推出 Pika AI Club,这是一项会员服务,提供 70+ 个生成式媒体模型的访问权限,最高可享受 80% 折扣,并支持 Agent 原生访问。
Google Startups发布了一份新的技术指南,用于使用Google DeepMind的模型构建生成式媒体应用,内容涵盖模型、工具、架构、质量保证和经济考量。
Runway 发布了 Media Router,这是一款偏好优化路由器,可根据用户定义的成本、质量或延迟标准自动选择最佳视频、图像或音频模型,无需手动挑选模型。该产品已在 Runway Dev 中上线。
Runway推出了Media Router,这是一款可根据质量、速度或成本偏好,自动为给定请求选择最佳生成式媒体模型的工具。它旨在简化开发者的集成过程,应对生成式媒体领域的日益拥挤。
来自xAI的Ethan He讨论了为什么视频代理模型是下一个前沿,他认为视频模型从LLM中获取智能,并且视频生成的演变将模仿AI编程,从一次性输出转向多轮规划与执行。
Google 发布了 Veo 3 和 Imagen 4,这是下一代视频和图像生成模型,具有显著的能力提升,包括音频生成和增强的物理模拟。该公司还推出了 AI 电影制作工具 Flow,并扩大了 Lyria 2 音乐创作工具的访问权限。
文章介绍了Google I/O 2026 Keynote上发布的生成式媒体产品更新,包括Google Pics图像编辑工具、Stitch UI设计工具,以及Google Flow的新功能如Gemini Omni、多智能体并行处理、自定义工具和音乐混音。强调技术帮助用户将创意快速变为现实。