我用Gemini的AI虚拟形象工具克隆了自己。结果令人不安地像我。

Wired 产品

摘要

作者测试了谷歌的Gemini AI虚拟形象工具,该工具通过自拍视频创建一个数字克隆,并将其插入AI生成的视频中。结果令人印象深刻地逼真,却又令人不安。

我使用了Gemini应用生成了带有我自己数字克隆的逼真视频。谷歌将此视为创作的未来。我仍然感到毛骨悚然。
查看原文
查看缓存全文

缓存时间: 2026/05/21 18:12

# 我用Gemini的AI化身工具克隆了自己。结果惊人地像我 来源:https://www.wired.com/story/i-cloned-myself-with-geminis-ai-avatar-tool-the-result-was-unnervingly-me/ 旧金山多洛雷斯公园的一个美丽温暖的午后,我正在对一只史前恐龙唱生日歌。当我唱完小夜曲时,一个插着粉色蜡烛的纸杯蛋糕神奇地出现在我空着的手中。当我把蜡烛吹灭时,这个像CGI一样的生物脸上露出平静满足的神情。 虽然这段AI视频中的男人看起来和听起来都和我一模一样,但这个片段实际上是使用Google Gemini应用中的新功能之一生成的:**化身**。这些数字再现品类似于现已下架的OpenAI Sora应用的核心功能。它是一个你的数字克隆,可以插入到AI视频中。化身由该公司新的Omni视频模型驱动,该功能仅对订阅用户开放。 我每月支付20美元订阅Google的AI Pro计划,很快就用完了Gemini的使用限制(每5小时重置一次)。我只是问了几个问题,生成了两个10秒的视频片段,就被提示要等到之后才能继续使用。 视频:Reece Rogers 我第一次看到Omni用我的形象能做什么,是在旧金山对着一只恐龙唱歌,以及在金门大桥下冲浪。我同时感到印象深刻和毛骨悚然。内容有些尴尬,有一些混乱的时刻和莫名其妙的服装,但视频里的那个人就是我。我用手指放大它的脸,仔细观察嘴巴的活动。牙齿有点不太对劲,但除此之外,那就是Reece,连双下巴都一样。 与之前允许用户决定是否允许他人使用自己形象生成AI视频的OpenAI不同,Google只允许成年用户使用自己的化身制作视频。 我花了大约五分钟通过Gemini应用设置我的化身。过程包括坐在光线充足的房间里,用手机摄像头对着我的脸,朗读一串两位数的数字。然后我慢慢向右看,再把头转向左边,一切就结束了。Reece 2.0诞生了,准备好成为我的deepfake明星。(在这个过程中注意你穿的衣服,因为你的着装很可能会出现在AI生成的内容中,但更多内容稍后再说。) 让我们逐帧分析一下生日片段,真正梳理一下我的感受。完整提示词:*生成一段视频,内容是我在多洛雷斯公园山顶对一只衰老的恐龙唱生日快乐歌*。 AI生成的片段,作者:Reece Rogers 第一秒以一个"千禧一代停顿"开始,因为即使是AI Reece也有根深蒂固的习惯。最初最引人注目的是逼真的场景。Google的AI视频背景并非将我的化身放在某个随机公园的巨大山丘上,而是与实际地点惊人地相似。从棕榈树成行的人行道到远处高耸的Salesforce大厦,即使输出并不完美,也能立刻看出描绘的是哪个公园。一家以绘制地图闻名的公司能做到这一点,也是合情合理。 当AI我开始唱歌(音高比我实际能唱的要低一些)时,前几小节看起来很自然。我像一个小指挥一样,随着节拍上下摆动双手。然后,我在"to"这个词上卡了一下,Gemini切换到更广角的镜头,真正的混乱开始了。一个香草纸杯蛋糕随机出现,我呼出一团烟雾吹灭了庆祝的蜡烛。(说实话,AI Reece真没礼貌。今天又不是你的特别日子。) 我用化身功能生成的另一个AI片段同样将混乱时刻和我对着镜头说话的逼真镜头结合在一起。完整提示词:*生成一段视频,内容是我在金门大桥下冲浪*。 我没有穿潜水服,而是从头到脚穿着牛仔服。至少,冲浪板上没有鞋子,我想。这个AI生成的片段包含了一些看起来像是安装在冲浪板上的GoPro拍摄的镜头。 AI生成的片段,作者:Reece Rogers 随着越来越多的人使用生成式AI,特别是那些没有严格防护栏的模型,这些工具正越来越多地被用于针对女性制作非自愿deepfake。Google声称,在推出这项新功能时,安全是首要考虑因素。"我们努力防止伤害,"Google DeepMind负责Omni产品团队的Nicole Brichtova说。"并且,我们努力以不阻止良性事物的方式做到这一点。" 尽管AI Reece的片段中存在卡顿和其他错误,但这些我自己的超现实版本比我回听语音邮件或重看某个有趣周末外出的片段时感觉更真实。这个化身看起来不一定是一个更性感版本的我,不,它有一种更令人毛骨悚然的东西。我的数字克隆是一个无缝的Reece。随时准备去任何地方,做任何事情,成为我。

相似文章

推出 Gemini 2.0:我们为智能体时代打造的新型 AI 模型

Google DeepMind Blog

Google DeepMind 推出 Gemini 2.0,这是一款新型智能体 AI 模型,具备原生图像和音频输出、增强的工具使用能力和多模态功能,专为下一代 AI 智能体设计。Gemini 2.0 Flash 现已向开发者推出,计划于 2025 年初实现更广泛的可用性。

Gemini 的图像编辑功能获得重大升级

Google DeepMind Blog

Google DeepMind 为 Gemini 应用发布了升级的图像编辑模型,在编辑人物和宠物照片时能保持一致的相似度。这个名为 Nano Banana 的新模型备受好评,支持换装、照片混合和风格迁移等功能,同时保持人物特征的一致性。