AI唇形同步是真正好的视频翻译中缺失的一环吗?

Reddit r/artificial 新闻

摘要

本文探讨了AI唇形同步技术作为视频翻译的有前景的增强手段,使说话者看起来自然地说出翻译后的语言,评估了SyncSo、Rask和HeyGen等工具,并讨论了其对内容可访问性和商业用途的更广泛影响。

所以最近我一直在玩AI唇形同步,我开始觉得这项技术有点被忽视了。现在,我们已经有AI翻译和配音一段时间了,但问题总是视频中的人看起来仍然像在说完全不同的语言。我不知道你们怎么想,但像这样的小不一致让我很恼火!YouTube的自动配音可能是最简单的例子:声音可能不自然,时间可能不对,而且人的嘴巴运动方式与他们说的话完全不同。一旦注意到,就很难再忽略。Instagram的翻译功能对我来说基本上有同样的问题。音频被翻译了,但视觉仍然暴露了它。当然,让我惊讶的是专门的唇形同步模型已经变得多么好!我最近测试了几个,SyncSo、Rask和HeyGen。结果在每个视频中并不一致,但仍然,其中一些确实相当好。有几个片段,人们无法分辨是AI生成的,老实说?我会把这视为一个优点。这让我思考更大的图景:- 高质量教育和信息内容的很大一部分存在于英语中,而大量的人因为语言障碍而不消费它。好的翻译已经解决了一部分问题,但让说话者看起来像是在说你的语言,似乎比我最初想的要重要得多。商业应用对我来说似乎很明显:电影、在线课程、广告、培训视频、采访等。也许这个不同步的嘴巴对我来说只是一个讨厌点,但我很好奇你们对此有什么想法。那么,AI唇形同步只是配音的另一个改进,还是那种能让翻译视频感觉像原生的技术?
查看原文

相似文章