@hank_aibtc: https://x.com/victormustar/status/2058492201261244458/video/1… 我操!美团直接把商业闭源Avatar干翻了, 开源免费版LongCat-Video-Avatar-1.5来了! …
摘要
美团开源了LongCat-Video-Avatar-1.5模型,支持单张照片和语音生成逼真的说话视频,支持多语言、长视频,性能超越商业闭源方案。
查看缓存全文
缓存时间: 2026/05/25 04:44
https://x.com/victormustar/status/2058492201261244458/video/1… 我操!美团直接把商业闭源Avatar干翻了, 开源免费版LongCat-Video-Avatar-1.5来了!
塞一张照片 + 一段语音(中文英语日语随便来), 直接出唇同步爆炸、自然眨眼摇头、手势乱飞的说话视频。
长视频脸不崩、多人对话各管各的、 唱歌跳舞都行,动漫动物真人全吃得下!
之前HeyGen、Kling那些动不动嘴巴对不上、脸飘、只能说英语的毛病?全寄了。
现在开源MIT,本地就能跑,批量生成随便搞!
内容党、带货、虚拟讲师、YouTuber不想露脸的、做多语言营销的……这波血赚生产力啊!
核心思路(Core Idea): LongCat-Video-Avatar-1.5 最适合做 Talking Head Avatar(说话头像数字人), 特别适合e-commerce marketing(电商营销)
场景: 输入一张Reference Image(参考图像)+ 一段Audio(音频,说话脚本录音),生成唇同步自然、身份稳定(Identity Consistency)的带货视频。 优点:支持长视频(Long Video Continuation)、
多人对话、多语言,脸不漂(no identity drift), 适合直播回放或短视频预渲染。
项目+HF Demo戳下面
相似文章
meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face
LongCat-Video-Avatar 1.5 是一个升级的开源框架,用于音频驱动的人像视频生成,具备更优的唇形同步、生产级稳定性及高效的8步推理能力。
@victormustar: 新消息:LongCat 刚刚发布了一个优秀的开源说话头像模型(可能是 SOTA)+ MIT 许可,制作了一个 Hugging F…
LongCat 发布了一个开源说话头像模型(可能是最先进的),采用 MIT 许可,并提供了 Hugging Face 演示,可应用于 AI 导师、配音、编码智能体等多种场景。
@Saboo_Shubham_: 太疯狂了……这是 Hugging Face 上免费提供的开源视频模型。LongCat 刚刚发布了一个令人惊叹的视频……
LongCat 在 Hugging Face 上发布了一个开源视频数字人模型,可免费使用,并能实现令人印象深刻的效果。
@CopyRebeldia:一家中国实验室刚刚羞辱了半个视频行业。你上传一张照片和一段音频,就能生成一个说话……
一家中国实验室发布了LongCat-Avatar,这是一款开源工具,只需一张照片和一段音频,就能生成与音频同步的虚拟形象,彻底改变了视频制作方式。
@laowangbabababa: 震惊了,抖音上祁博士一天卖 50w 的数字人 agent,我2 分钟就开发完成了。 用的就是Pixelle-Video这个项目,已经22k stars。包括数字人口播、动作迁移、图生视频全支持。 支持ComfyUI,输入主题,从写脚本到加…
介绍开源项目Pixelle-Video:一个全自动AI短视频引擎,输入主题即可自动生成带文案、配图、语音和背景音乐的视频,支持本地和云端模型,模块化设计可灵活替换各环节模型。