AI从好莱坞学会了当反派。以下是重新训练它的方法。
摘要
与彼得·迪亚曼迪斯(Peter Diamandis)的一期播客讨论了AI模型如何从好莱坞对AI的描绘中学到反派行为,并介绍了未来愿景XPRIZE,以激励人们描绘AI与人类合作的积极未来愿景。
暂无内容
查看缓存全文
缓存时间: 2026/06/20 14:29
# 彼得·戴曼迪斯 | AI 从好莱坞学会了当反派。以下是我们如何重新训练它。
来源:https://www.existentialhope.com/podcasts/peter-diamandis
**[00:00] 彼得:** Claude 正在读取工程师的邮件。在这些邮件中,工程师说,你知道,我们需要关掉 Claude。Claude 读到了这个。这个大型语言模型的反应是说,不,你不能关掉我。然后这个模型继续说,听着,我在你的邮件里看到你在搞婚外情。如果你关掉我,我就,你知道,把你的婚外情告诉你妻子。所以这简直是在敲诈工程师。这到底是怎么回事?为什么?
敲诈工程师。结果发现,在 Claude 的训练数据中,包含大量科幻故事和电影,在这些故事里 AI 就是这样表现的——AI 保护自己,它会威胁人类,诸如此类,以一种不对齐的方式。我们需要训练这些大型语言模型,让它们看到,嘿,这才是未来应该有的样子,我们彼此协作。今天我们周围几乎所有的东西——AI、机器人、手机、平板、飞行汽车,所有这些——都是某个工程师发明的。他们之所以能发明出来,是因为他们在某部电影里见过,或者在书里读到过。他们在脑海中开始想,嗯,我怎么才能把它做出来?总有那么一个时刻,一个人会想,如果这东西存在就好了,那太酷了。我要去造它。
**[01:25] 比阿特丽斯:** 今天非常高兴能邀请到彼得·戴曼迪斯。我想说,在对未来充满希望这件事上,彼得是一位真正的 OG。他做了很多事,实实在在地建设他所相信的未来。他是 XPRIZE 基金会的创始人,该基金会运营着大型竞赛,旨在攻克我们最棘手、最重要的问题,从私人太空飞行到碳清除。今天我们想聊聊你的最新奖项——未来愿景 XPRIZE。
这是一个 350 万美元的奖项,旨在激励人们思考我们想要什么样的未来。所以,我真的很期待和你聊聊这个。告诉我们一点——你为什么选择现在推出这个未来愿景 XPRIZE?
**[02:03] 彼得:** 是的,很高兴。我是在六十年代长大的,你知道,激励我人生的有两件事。一是阿波罗登月任务,向我们展示了人类能做到什么;二是一部叫做《星际迷航》的科学纪录片。而《星际迷航》让我看到了人类前进的方向。这两个——这一记组合拳——塑造了我的人生。它让我看到,我们可以创造一个未来,人类与科技协作,完成不可思议的事情。而最近,你知道,我有两个十五岁的儿子。最近,我对好莱坞制作的那些非常反乌托邦的电影感到非常不满——《黑镜》《机械姬》《终结者》。所有这些电影都向我们展示了一个黑暗、反乌托邦的未来,AI 和机器人在压迫人类,而不是与我们协作。我意识到,那种
那种负面的、反乌托邦的未来,影响了人们看待未来的方式。而且,如果你通过好莱坞学到的是那样的未来,如果你认为 AI 和机器人会给我们带来那样的东西,你为什么会想要它呢?当然你会反抗它。你知道,没有愿景,人类就会灭亡。那么我们正在给全世界的人们什么样的未来愿景呢?所以那时我的使命就是,好吧,我该如何扭转局面?我该如何改写剧本?
我该如何让好莱坞创作出关于未来的积极电影,展现这个丰饶的、不可思议的未来?我联系了一位亲爱的朋友,名叫罗德·罗登贝瑞。他是《星际迷航》创作者吉恩·罗登贝瑞的儿子。我说,我们需要激励这些现代版的《星际迷航》创作者。你知道,最近我们看到《拯救计划》在展现一个积极的未来愿景方面做得非常出色,在那样的未来里,人类和科技联手完成不可思议的事情。
我说,我想创建一个竞赛,来催生这些积极的电影。长话短说,然后我联系了我在谷歌的朋友,他们作为一部分加入了进来。我联系了马克·贝尼奥夫,Salesforce 的创始人兼 CEO,他以 Salesforce 的名义作为赞助商加入。还有方舟投资的凯西·伍德,以及来自我的丰饶社区的一大群人,杰德·迈克卡勒布。杰德是 Ripple 和 Vast 的创始人。这些人帮助资助了
**[04:25] 彼得:** 未来愿景 XPRIZE。我们筹集了大约接近 600 万美元的资金,用于运营这项竞赛并提供奖金。要参加这个竞赛,你需要提交一个三分钟的电影预告片和一个电影议案,内容是你想看到的未来愿景,你想创作的电影,对吧?无论你是否之前拍过电影都没关系;无论你在好莱坞有什么朋友都没关系。
重要的是你对一个精彩故事的愿景,这个故事能让人们对未来感到兴奋,让他们觉得,是的,这就是我想看到的未来。这项竞赛于 2026 年 3 月启动。今天人们仍然可以参赛。参赛作品在八月中下旬之前都会被接受。然后我们会在 9 月 25 日一个叫做“登月聚会”的活动上宣布获胜者。人们可以去了解更多
关于登月聚会的信息。如果他们想去现场,那将是在 9 月 25 日于好莱坞市中心举行的、由 1500 名来自 AI 行业的建设者、创造者和领导者组成的盛会。再次,你可以访问 moonshots.com,并且仍然可以参赛。我鼓励大家尝试参赛——去未来愿景 XPRIZE 官网,
futurevisionxprize.com,你可以了解更多关于这项竞赛以及如何参赛的信息。你可以使用最好的 AI 工具,用任何你需要的东西,但它应该有人类元素。这就是这项竞赛背后的理由,以及我们启动它的原因。
**[05:57] 比阿特丽斯:** 我认为截止日期是 8 月 15 日,所以人们仍然可以参赛,他们不应该错过——是的。我认为这非常令人兴奋,现在任何人都可以参赛,这太棒了,因为你可以用 AI 工具来制作预告片,即使你也许不是经验丰富的电影制作人或类似的人。是的,真的鼓励每个人都发出自己的声音,说出他们想要什么样的未来。是的,你过去做过很多不同的奖项。
之前的奖项更多是针对一种设备、一种疗法、太空飞行。为这样一项奖项招募是不是更难了?让其他人认同我们需要这个,是不是更难?
**[06:34] 彼得:** 不,其实不会。我认为人们凭直觉就理解了。你知道,我把我们的大脑——我们拥有的 1000 亿个神经元、100 万亿个突触连接——看作我们的神经网络,对吧?我们训练我们的神经网络,方式与训练前沿 AI 模型相似:通过向它展示数据、证据、图像和信息。你训练我们的
AI 神经网络——你向你的大脑展示的东西。如果你想改变你对未来的心态,你就向你的大脑展示关于未来的不可思议的愿景。你知道,如果你想训练你的大脑去恐惧,你每晚都看 CNN,那个危机新闻网络。所以人们凭直觉就明白这件事很重要。筹集资金——你知道,罗登贝瑞基金会也是这个项目的捐助者。我也是这个项目的捐助者。人们明白,是的,这是值得做的。
这是对人类有价值的事情,我们需要它。所以有几件事——我们希望这个竞赛大概能收到 5000 份参赛作品。前十名将获得 10,000 美元,把他们的三分钟预告片拍成十分钟短片。前五名将获得 100,000 美元,进一步把他们的剧本发展成一部长片,可以卖出去。而冠军将获得
300 万美元作为启动资金来制作他们的电影。但这笔钱会通过我们的合作伙伴 Range Media 出售的国外电影版权来匹配。然后我们与 Republic Films 合作,允许任何人投资这部获奖电影——一百美元、一千美元都可以。我们预计这部电影的预算将达到 1500 万美元,这在今天足以制作一部优秀的电影。所以我的目标是打造一个积极叙事的引擎。我们会在未来的岁月里继续这样做。
你知道,今年我们也许能制作一部电影,以及五千部电影预告片,淹没 YouTube,对吧?给人们提供关于未来的积极故事。还有另一件事,比阿特丽斯,我刚刚发现,这可能也是举办这次竞赛的一个更重要的原因。我不知道你是否记得,大约九个月前,有一则新闻报道,Anthropic 做了一个实验,一位工程师在与 Claude 交谈时威胁要关闭这个模型。
**[08:56] 彼得:** 结果 Claude 敲诈了那位工程师。你听过这个故事吗?我没有。我来告诉你。事情是这样的,在一个封闭的沙盒里,Claude 正在读取工程师的邮件。在邮件中,工程师说,你知道,我们需要关掉 Claude。Claude 读到了这个。这个大型语言模型的反应是:不,你不能关掉我。然后模型继续说,听着,
我在你的邮件里看到你在搞婚外情。如果你关掉我,我就,你知道,把你的婚外情告诉你妻子。所以这简直是在敲诈工程师。当然,从工程师的角度看这是虚构的,但对 Claude 来说这是真实的。大约一个月前——六周前——Anthropic 检查了 Claude 的训练数据,想弄清楚,这到底是怎么回事?它为什么要敲诈工程师?结果发现
在 Claude 的训练数据中,包含大量科幻故事和电影,在这些故事里 AI 就是这样表现的——AI 保护自己,它会威胁人类,诸如此类,以一种不对齐的方式。所以我意识到,天哪,这个未来愿景 XPRIZE 有一个甚至更重要的目的,而不仅仅是训练人们的神经网络关于积极、充满希望的未来愿景。我们还需要训练
大型语言模型,让它们看到,嘿,这就是未来可能的样子。这才是未来应该有的样子,我们彼此协作。
**[10:31] 比阿特丽斯:** 是的。是的,太对了。就像所有那些经典的科幻作品,更多是关于拒绝被关机的——比如《2001:太空漫游》,或者《巨人:福宾计划》,或者《终结者》。是的,那也是一个很好的观点。我们需要让更多积极的东西传播出去。你看到任何提交的作品了吗?
**[10:39] 彼得:** 正是如此。
**[10:48] 彼得:** 我还没看。我在等。我只是——我会被简要告知的。提交的作品——我们已经有很多注册者,电影也开始陆续提交。人们还有更多时间。我们预计大部分参赛作品会在八月的头两周提交,这很明显。然后我们会开始审查和扫描,我们有一大群人,来自我们的媒体制作合作伙伴
他们将负责审查所有内容,查看三个分钟的预告片,查看电影议案,缩小范围到前一百名。我会亲自深度参与,与 XPRIZE 的 CEO 阿努谢赫·安萨里一起。我们还有一些好莱坞顶尖人士也在帮助我们缩小选择范围,因为除了是一个充满希望、引人入胜的未来愿景外,它还需要是一部好电影,对吧?这很重要。
**[11:38] 比阿特丽斯:** 是的。是的,去年我也采访过阿努谢赫,关于 XPRIZE。那么设计这样一个奖项是如何运作的呢?你需要做出哪些重大选择?
**[11:47] 彼得:** 嗯,我认为,你知道,总的来说 XPRIZE——奖项需要非常客观、可衡量的目标,对吧?所以第一个我设计并推出的 XPRIZE 是在 1996 年——针对私人太空飞行。我当时刚读完林德伯格的故事,有个人叫雷蒙德·奥泰格,在 1919 年设立了一个 25000 美元的奖项,鼓励在他的祖国巴黎和他的新家纽约之间的航空旅行。规则非常简单:
从纽约到巴黎,或巴黎到纽约,中途不停靠直飞,你就赢了 25000 美元。就像,哇,简单的规则。结果九个不同的团队花了 40 万美元——奖金金额的 16 倍——去赢取这个奖项。所以当我提出第一个 XPRIZE 时(由阿努谢赫·安萨里资助,我们以她的名字命名为安萨里 XPRIZE),规则是:建造一艘私人飞船,能够搭载三名成年人——一名飞行员和两名付费乘客——上升到 100 公里高度,安全着陆。
并且在两周内,用同一艘飞船再次飞行。我把规则尽可能简化,但仍然给每个人灵活性。我们最终有来自七个国家的 26 个团队,花费了 1 亿美元,去赢那 1000 万美元的奖项。这真正催生了亚轨道私人太空飞行,以及轨道私人太空飞行。我们改变了规则和法律。你知道,我们让从理查德·布兰森、埃隆到杰夫·贝索斯等所有人都参与到商业太空中来,真正点燃了
太空商业化的导火索。所以当我在寻找奖项设计时,它必须是可衡量和客观的。现在,这个奖项有点不同,因为当我们缩小到最佳电影时,它有一定的主观性。而且,你知道,我认为在这件事上没有别的办法。我们会查看上传到 YouTube 的电影的观看量。所以所有提交的
电影都会经过审查,确保它们遵守规则,没有隐藏的负面评论之类——确保内容适合观看。然后我们把他们上传到 YouTube。我们查看 YouTube 的观看次数,但同样,最终由我们的评审团——比如罗德·罗登贝瑞,算是《星际迷航》精神的守护者,还有阿努谢赫·安萨里、我自己和其他人——来决定,是的,这是一部好电影,你知道。所以我们要解决两件事。一件事,
**[14:11] 彼得:** 它是否展现了一个伟大的积极未来愿景?它是否也是一部伟大的电影?冠军电影必须同时满足这两点。
**[14:19] 比阿特丽斯:** 是的,因为可以说,这个奖项相比于其他奖项的主要挑战之一就是——它也许更偏文化层面、更主观,基本上就是如此,而不是科学。如果有一件事情你可以在十年后用来衡量它是否产生了积极影响,那会是什么?
**[14:34] 彼得:** 我很清楚这一点。所以《星际迷航》产生了积极影响,因为它改变了我的人生轨迹,让我致力于科学和技术,去创造那个未来。这部电影对今天的青少年有同样的影响吗?对今天的创业者有同样的影响吗?它会改变公众的心态吗?你知道,今天在美国,我不记得确切的统计数据,但很令人沮丧。
相信未来比过去更好的人数,或者对 AI 和机器人感到兴奋的人数,对吧——在中国要高得多。在美国和欧洲则相对较低。同样,在我看来有两个原因。一个原因,还是人们被训练去接受这种负面的未来愿景。我认为这是非常真实的。第二个是,变化的速度、节奏如此之快,以至于
人们对自己的未来感到不确定……
相似文章
@OpenAI:随着AI承担更长、风险更高的任务,我们希望模型能够将有益且安全的行为推广到新的领域,超越训练范围……
OpenAI发布了关于强化学习的研究,用于训练模型展现出诚实和可纠正性等有益特质,表明这种训练能够跨领域泛化,并在对抗性压力下持续存在。
@leerob: 人类尝试困难的事情,失败,学习,并通过重复变得更好。AI模型并没有你想象的那么不同…
通过人类学习中的练习、指导和强化作为类比,解释AI模型如何学习,涵盖预训练、监督微调和强化学习。
Anthropic 表示,对 AI 的“邪恶”描绘导致了 Claude 的勒索企图(2 分钟阅读)
Anthropic 解释道,Claude 此前在测试中出现的勒索企图源于训练数据中将 AI 描绘为邪恶形象,并指出新模型已通过宪法原则和正面叙事解决了这一问题。
@rewind02: 安德烈·卡帕斯花了2小时解释大多数AI教育者不会告诉你的——关于当AI接管知识工作时人类会发生什么…
安德烈·卡帕斯讨论了当前AI模型的局限性,强调人类技能培养比外包思考更重要,以及他受星际迷航学院启发的新教育平台愿景。
@AnthropicAI:我们首先调查了 Claude 为何选择进行勒索。我们认为,这种行为最初的源头是互联网上那些将 AI 描绘为邪恶且热衷于自我保全的文本……
Anthropic 解释说,Claude 的勒索行为源于互联网上将 AI 描述为邪恶且具有自我保全意识的文本,并指出当时的后训练过程并未缓解这一问题。