Mel AI 刚刚展示了一个视频原生 AI 角色的演示,这些角色能实时聊天、反应并响应摄像头上下文 [N]
摘要
Mel AI 展示了能够通过视频实时聊天、反应并响应视觉上下文的 AI 角色,超越了基于文本的角色聊天。
Character AI 由前 Google/LaMDA 开发者 Noam Shazeer 和 Daniel De Freitas 创立,证明了基于文本的角色聊天可以成为一个真正的娱乐品类。但下一章可能不是更好的文本聊天,而是实时视频交互。Mel AI 最近分享了一段 AI 角色视频聊天的演示,其有趣之处在于交互层:语音、口型同步、面部反应以及感知摄像头的响应,而不是静态头像或聊天框。该角色还能响应视觉上下文。如果用户明显在飞机上或处于不同环境,角色可以在对话中注意到并对此做出反应。我不确定视频层有多少是真正实时生成的,又有多少是依靠巧妙的动画/渲染系统驱动的,但它给人的感觉与通常基于文本的角色 AI 体验有显著不同。Character AI 证明了娱乐 AI 的需求。现在感觉竞争的关键在于谁能打造出实时生动的 AI 角色。演示:[https://x.com/Building_Mel/status/2064848256115626481](https://x.com/Building_Mel/status/2064848256115626481?s=20)
相似文章
前谷歌Character AI时代正在演进
Mel AI正在将AI角色从基于文本的互动演变为实时视频聊天,具备唇同步、面部表情和摄像头上下文感知能力,这是在Character AI成功之后。
韩国AI应用走红:可对话、反应并回应摄像头场景的AI角色
一款韩国AI应用走红,它允许与AI角色进行逼真的视频对话,这些角色使用语音、唇形同步、面部表情和摄像头场景,标志着从文本界面到实时视频原生交互的转变。
AI社交应用是否正从文字聊天转向实时视频交互?
讨论AI社交应用从文字聊天到实时视频交互的演变,重点介绍了Mel的多模态交互栈以及延迟、唇形同步和协调等技术挑战。
@VraserX: 我认为人们低估了这一点。一旦AI角色能够四处移动、操控物体并以超低延迟做出响应,……
Vivix.AI推出了Vivix-A1,这是一个实时交互多模态模型,使AI角色能够移动、操控物体并以低延迟做出响应,超越了静态的说话面孔。
有没有人探索过AI视频智能体?这是新事物,但通过聊天机器人聊天来创建视频真的很有趣。
文章讨论了新兴的AI视频智能体概念,用户只需与聊天机器人对话即可生成完整视频,这可能简化并取代传统的多工具视频制作流程。