亚马逊Alexa的秘密起源
摘要
本文揭示了亚马逊Alexa和Echo的秘密起源,从杰夫·贝佐斯2011年的白板草图,到远场语音识别的技术挑战,以及团队在苹果Siri发布后竞相上市的历程。
暂无内容
查看缓存全文
缓存时间: 2026/07/24 23:04
# 亚马逊Alexa的秘密起源
来源:https://www.wired.com/story/how-amazon-made-alexa-smarter/
2011年初,杰夫·贝索斯在会议室白板上首次勾勒出后来成为亚马逊Echo的设备。他希望这款设备售价20美元,完全由语音控制。它的“大脑”将存在于云端,利用亚马逊的Web Services产品,使亚马逊能够不断改进它,而无需用户升级硬件。
这个带有Alexa——贝索斯以古老的亚历山大图书馆命名的人工智能虚拟助手——的设备的首次描绘,显示了扬声器、麦克风和一个静音按钮。它无法开箱即懂指令,因此草图将配置设备连接无线网络的行为识别为需要进一步思考的挑战。
当时担任贝索斯技术顾问(“TA”)的格雷格·哈特是会议中的另一人,他正在仔细倾听。贝索斯说他希望哈特领导团队,将这个关于语音计算机的有些离奇的想法变成实际产品。哈特用手机拍下了这幅画。
“杰夫,我没有硬件方面的经验,而且我带过的最大的软件团队也只有大约40人,”他回忆说。
“你会做得很好,”贝索斯回答。
哈特感谢了他的信任,并说:“好吧,记住,当我们一路搞砸的时候。”
图片可能包含文本和白板
杰夫·贝索斯于2011年首次在白板上勾勒出Alexa设备。
图片由亚马逊提供
在接下来的三年里,贝索斯一直密切参与该项目。他批准在第一台Echo发布前投入数亿美元,做出详细的产品决策,并每隔一天就与团队会面。员工们用德语中的最高级词汇称他为“超级产品经理”。
但实际负责运营的是哈特,他的办公室就在贝索斯办公室对面,位于Kindle团队所在的楼里。接下来的几个月里,哈特从公司内外招聘了一个小团队。像他的老板一样,他对保密性非常执着。他给潜在应聘者发送主题为“加入我的使命”的模糊邮件,并问诸如“你会如何为盲人设计一款Kindle?”之类的面试问题。他拒绝说明候选人将从事什么产品。一位受访者回忆说,他猜测是亚马逊广为传闻的智能手机,并说哈特回答:“有另一个团队在做手机。但这个有趣得多。”
最初的Alexa团队带着狂热的紧迫感工作。不切实际地,贝索斯希望在6到12个月内发布该设备。他有充分的理由赶时间。2011年10月4日,就在Alexa团队组建之际,苹果在iPhone 4S中推出了Siri虚拟助手。这是联合创始人史蒂夫·乔布斯的最后一个激情项目,他于第二天因癌症去世。哈特和他的团队在得知复兴的苹果也在开发语音激活的个人助手这一消息时感到被证实,但他们也因Siri率先上市且最初获得一些负面评价而感到沮丧。
亚马逊团队试图安慰自己,他们的产品是独一无二的,因为它独立于智能手机。他们还在试图完成一项技术上复杂得多的壮举。Siri的用户直接对着麦克风下达指令。亚马逊则试图构建一种能够从嘈杂房间的另一端理解语言的服务,使用一种相对不成熟的技术,称为远场语音识别。
为了加快开发速度,哈特和他的团队开始寻找收购初创公司。这并非易事,因为总部位于波士顿的语音巨头Nuance(苹果已授权其技术用于Siri,且最近被微软收购)多年来通过吞并美国顶尖语音公司而壮大。Alexa的高管们试图通过让潜在目标公司为Kindle数字图书目录启用语音功能,然后研究他们的方法和结果,来了解哪些剩余的初创公司有前途。这次搜寻导致了接下来两年内的几次快速收购,包括波兰初创公司Ivona。
Ivona于2001年由格但斯克理工大学计算机科学专业的学生卢卡什·奥索夫斯基创立。奥索夫斯基的想法是,所谓的文本转语音(TTS)可以用自然的声音大声朗读数字文本,并帮助波兰的视障人士。他与一位年轻的同学米哈乌·卡什丘克一起,录制了一位演员的声音,选择了称为双音素的单词片段,然后将它们以不同的组合混合或“拼接”在一起,以模拟演员可能从未说过但听起来自然的单词和句子。
Ivona的创始人们很早就看到了他们技术的强大潜力,当时他们付费请一位名叫雅采克·拉比亚克的波兰流行演员录制数小时的语音,以创建声音数据库。由此产生的产品,他们称之为Spiker,迅速成为波兰最畅销的电脑语音。在接下来的几年里,它被广泛用于地铁、电梯和自动电话营销活动。拉比亚克随后开始到处听到自己的声音,并经常收到用他自己的声音敦促他(例如)在即将到来的选举中投票给某位候选人的电话。恶作剧者操纵软件让他说些不合适的话,并将片段发布到网上,被他的孩子们发现。之后,Ivona的创始人们不得不重新谈判演员的合同,因为他愤怒地试图从软件中撤回自己的声音。(如今,“Jacek”仍然是AWS Amazon Polly电脑语音服务提供的波兰语声音之一。)
2006年,Ivona开始参加并多次赢得由卡内基梅隆大学组织的年度“暴雪挑战”最自然电脑语音比赛。到2012年,Ivona已扩展到20种其他语言,并提供40多种声音。哈特和该项目的首位工程经理阿尔·林赛在前往欧洲寻找收购目标时访问了他们在格但斯克的办公室。“从我们走进他们办公室的那一刻起,我们就知道文化契合,”林赛说,他指出Ivona在一个研究人员常常被崇高追求分心且难以实际交付产品的领域取得了进展。“他们的拼搏精神使他们能够超越纯学术,不被科学蒙蔽。”
这笔约3000万美元的收购于2012年完成,但保密了一年。Ivona团队以及亚马逊为其新建的格但斯克研发中心雇佣的越来越多的语音工程师被委以打造Alexa声音的重任。该程序由贝索斯亲自微观管理,并受到CEO通常的好奇心和一时兴起的支配。
起初,贝索斯说希望设备发出几十种不同的声音,每种声音与不同的目标或任务相关联,比如听音乐或预订航班。当这被证明不切实际时,团队考虑了他们在单一性格中想要的特征列表,如可信赖、共情和温暖,并确定这些特征通常与女性声音相关联。
为了开发这种声音并确保其没有地区口音,波兰团队与亚特兰大地区的配音工作室GM Voices合作,正是这家工作室帮助将配音女演员苏珊·贝内特的录音变成了苹果的Siri。为了为客户创建合成人格,GM Voices让配音演员阅读数百小时的文本,从整本书到随机文章,这是一个可能持续数月且令人麻木的过程。
由于相信为Alexa选择合适的声音至关重要,哈特和同事们花了数月时间审查GM Voices为该项目制作的各种候选人的录音,并将最佳选择呈递给贝索斯。亚马逊团队对最佳声音进行排名,要求额外样本,并最终做出了选择。贝索斯批准了。一贯保密的亚马逊从未透露过Alexa背后配音演员的名字。我在调查专业配音圈后得知了她的身份:配音演员兼歌手妮娜·罗尔,常驻科罗拉多州博尔德。她的专业网站上包含诸如Mott's苹果汁和大众帕萨特等产品的旧电台广告链接——Alexa声音温暖音色是显而易见的。2021年2月我打电话联系她时,罗尔说她不能接受采访。当我要求亚马逊允许我与她交谈时,他们拒绝了。
Alexa现在有了声音,但很快明显看出她需要一个新的大脑。2013年初,亚马逊开始将原始Echo的原型机送到数百名员工家中,要求他们签署保密协议并填写关于产品体验的调查问卷。
据大家所说,这些实验设备又慢又笨。也许最令人沮丧的评价来自贝索斯本人。这位CEO显然在西雅图的家中测试一台设备,因为对它的理解能力感到恼火,他告诉Alexa去“朝自己的头开一枪”。一位工程师在审查与测试设备的互动时听到了这个评论,他说:“我们都以为这可能是项目的终结,或者至少是我们在亚马逊几个人的终结。”
在接下来的几个月里,亚马逊努力使其产品更智能的过程中,卷入了一场两种人工智能信条之间的战斗,并导致其面临迄今为止最大的挑战。
由于收购了位于英国剑桥的人工智能公司Evi,Alexa已经精通文化上常见的寒暄式对话,即所谓“应酬语”。如果用户对设备说:“Alexa,早上好,你好吗?”Alexa能够做出正确反应。它还能处理事实性查询,例如要求列出太阳系中的行星。这些特性,源于一种称为知识图谱的编程技术,给人留下Alexa很聪明的印象。但它真的聪明吗?另一种自然语言理解方法(称为深度学习)的支持者认为,Evi的方法过于死板,无法赋予Alexa那种能够满足贝索斯梦想——打造一个能与用户交谈并回答任何问题的多功能助手——的真正智能。例如,如果用户说“播放斯汀的音乐”,他们担心基于知识图谱的系统可能会认为他在对艺术家说“拜”,从而感到困惑。
在深度学习方法中,机器被输入大量关于人们如何交谈以及哪些回答令人满意的数据,然后被编程自我训练以提供最佳答案。换句话说,Alexa被用得越多,就会变得越聪明。
这种方法的主要倡导者是一位印度出生的工程师,名叫罗希特·普拉萨德。普拉萨德和同事们必须解决所有开发AI的公司都面临的悖论:如果他们推出一个愚蠢的系统,客户不会使用它,因此不会产生足够的数据来改进服务。但公司需要这些数据来训练系统使其变得更聪明。谷歌和苹果部分通过从Nuance授权技术来解决这个悖论,利用其结果训练自己的语音模型,然后与该公司断绝关系。多年来,谷歌还通过免费电话目录查询热线800-Goog-411收集语音数据。亚马逊没有可以挖掘的此类服务,哈特反对授权外部技术——他认为从长远来看这会限制公司的灵活性。但来自员工家中Beta测试的少量训练数据仅仅相当于几百名白领工人的语音,通常是在早晚不在办公室时从嘈杂的房间另一端发出的。数据质量很差,而且数量不够。
罗希特·普拉萨德
罗希特·普拉萨德是亚马逊Alexa AI首席科学家。
摄影:Joe Buglewicz/Bloomberg/Getty Images
与此同时,贝索斯变得不耐烦。“我们怎么知道这个产品什么时候才算好?”他不断问。哈特、普拉萨德和他们的团队创建了图表,预测随着数据收集的进行,Alexa将如何改进。数学表明,他们需要将数据收集规模大致翻倍,才能实现Alexa准确率每连续提高3%。
那年春天,就在普拉萨德加入公司仅几周后,团队向贝索斯提交了一份六页的叙述,阐述了这些事实,并提议将语音科学团队的规模扩大一倍,并将计划中的发布从夏季推迟到秋季。会议进展不顺利。“你们这样做是错的,”据在场人士称,贝索斯在阅读了关于推迟的材料后说。“先告诉我什么会是神奇的产品,然后告诉我如何到达那里。”
贝索斯当时的技求顾问迪利普·库马尔随后询问公司是否有足够的数据。从剑桥拨入会议的普拉萨德回答,他们还需要数千小时复杂的远场语音指令。据一位当时在房间的高管说,贝索斯显然考虑了增加语音科学家人数的请求,并在几秒钟内在脑中进行了计算。“让我把话说清楚。你告诉我,为了实现让你的要求使这个产品成功,不是需要40年,而只需要我们20年?”
普拉萨德试图回避。“杰夫,我们不是这样想的。”
“告诉我我的计算哪里错了!”据一位在场人士说,贝索斯说道。哈特插话:“等一下,杰夫,我们听到了,我们明白了。”普拉萨德和其他亚马逊高管对那次会议以及Alexa开发期间与贝索斯的其他艰难互动有着不同的记忆。但据一位在场人士说,CEO站起来说:“你们不是认真在做这个产品,”然后突然结束了会议。
杰夫·贝索斯离场后,负责原型工作的Alexa高管们带着受伤的自尊心退到附近的会议室,重新考虑他们对数据悖论的解决方案。他们的老板是对的。内部测试和用亚马逊员工进行训练太有限了。他们需要大规模扩大Alexa的Beta测试,同时仍对外界保密。
由此产生的计划将使Alexa项目如虎添翼,并回答了一个后来困扰语音专家的问题:亚马逊是如何在构建语音激活虚拟助手的竞赛中,异军突起,超越谷歌和苹果的?
为了执行其内部称为AMPED的计划,亚马逊与一家名为Appen的澳大利亚数据收集公司签约,并带着伪装过的Alexa上路了。从波士顿开始,Appen租用了房屋和公寓,然后亚马逊在几个房间里放置了各种“诱饵”设备:底座麦克风、Xbox游戏机、电视和平板电脑。房间里还放置了大约20个不同高度的Alexa设备,每个都罩在一种声学织物中,隐藏其外观但允许声音通过。然后,Appen与一家临时工中介签约,一批接一批的合同工每天八小时、每周六天在这些房产中穿梭,阅读iPad上的脚本,脚本包含预设台词和开放式提示,如“要求播放你最喜欢的曲子”和“问任何你希望助手做的事情”。
文章图片
超智能算法不会取代所有工作,但它们正在...
相似文章
为何Siri和Alexa仍不够智能?
本文探讨了由Apple和Amazon开发的语音助手Siri和Alexa被认为不够智能的原因。
@StartupArchive_:杰夫·贝索斯解释亚马逊如何拓展新产品(如Kindle和AWS)——“我肯定会建议小初创公司尽可能保持狭窄和专注……”
杰夫·贝索斯阐述亚马逊拓展Kindle和AWS等新产品的流程,强调两种路径:客户需求驱动与能力驱动,内容源自2014年访谈。
Amazon
Amazon宣布在技术和人工智能领域的新发展。
为什么苹果为Siri构建了第三方AI系统,却拒绝在WWDC上展示(6分钟阅读)
苹果为Siri构建了一个第三方AI的扩展框架,但故意未在WWDC 2026上展示,原因可能是欧盟监管争议、OpenAI潜在的法律诉讼,以及围绕其自研Siri重做版的信息传递策略。
Amazon 的新 Alexa+ 功能可生成播客剧集
Amazon 宣布推出名为 Alexa Podcasts 的新 Alexa+ 功能,可利用 AI 生成任意主题的播客剧集,提供自定义时长和语调的选项,由 AI 主播声音进行叙述。