@rohanpaul_ai:一个非常酷的实时视频模型刚刚发布,用于交互式角色和世界

X AI KOLs Following 模型

摘要

Vivix.AI 发布了 A1,一个面向交互式角色和世界的实时视频模型,通过小段连续片段同时生成音频与视频,从而实现无缝打断,以及带有持久状态的实时长对话。

一个非常酷的实时视频模型刚刚发布,用于交互式角色和世界。 A1 并不是先生成语音,再让身体去配合语音进行动画处理。 在这里,音频和视频是作为一个整体从小段连续片段中一起生成的。语音和动作属于同一个片段。 这一点在你插话打断时非常重要。在先生成语音、再进行动画处理的流程中,一次打断意味着要停止两个系统,并希望它们能在同一位置停下。而在这里,只需要引导一条流即可。 用户可以和一个角色对话三十秒或三十分钟,在句子说到一半时打断它、切换话题、让它走到房间另一边。模型无法提前规划好整段视频。
查看原文
查看缓存全文

缓存时间: 2026/10/01 04:14

一款非常酷的实时视频模型刚刚发布,用于生成可交互的角色和世界。

A1 不是先生成语音、再让身体去匹配语音。

在这里,音频和视频是作为一个整体从模型中生成的,以小段连续片段的形式输出。语音和动作属于同一个片段。

这一点在你切入(插话)时非常关键。在“先生成语音、再生成动画“的流水线中,中断意味着要同时停止两个系统,并祈祷它们能停在同一个位置。而这里只有一条流需要重定向。

用户可以和一个角色聊三十秒,也可以聊三十分钟;可以在它说了一半时打断它,改变话题,或者让它穿过房间。模型无法事先规划整个片段。

Vivix.AI (@VivixLabs_HQ): 创建你自己的角色。主导一切。实时进行。

介绍 A1 Playground + Agent:打造一个能说话、能行动、能陪你互动的实时 AI 角色。

创建你的角色:https://t.co/NtO2zveu5Q

他们的形象。他们的性格。他们的声音。由你选择。描述一下你心目中的角色,

相似文章

OpenAI的新语音模型不止于回话

Reddit r/ArtificialInteligence

OpenAI推出了三个新的实时音频模型,支持连续、多任务的语音交互,优先考虑长上下文推理、实时翻译和无缝工具使用。