三秒欺诈:AI语音诈骗为何超越所有防御

Hacker News Top 新闻

摘要

AI语音克隆技术可实现精密欺诈,常以老年人为目标,FBI报告损失达数十亿美元,凸显防御之难。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/15 13:42

# 三秒窃案:为何AI语音诈骗让所有防御措施望尘莫及 来源:https://smarterarticles.co.uk/the-three-second-theft-why-ai-voice-fraud-outruns-every-defence 莎朗·布莱特威尔在电话里听到了女儿的哭泣声,那一刻,她原本可能建立的任何防线都土崩瓦解。那个声音属于艾普丽尔——至少她的每一个直觉都这样告诉她:同样的音色,同样年轻女子在痛苦中支离破碎的语调。那个声音说,她一边开车一边发短信,撞倒了一名孕妇,手机被警察扣了。接着一个男人接过电话,自称是艾普丽尔的律师,解释说保释金需要一万五千美元现金。他警告布莱特威尔不要告诉银行这笔钱的用途,以免影响女儿的信用记录。不到一小时,这位来自佛罗里达州多佛的退休老人就取出了钱,交给了一名她以为是法院工作人员的快递员。直到她联系上真正的艾普丽尔——后者整个上午都在上班,从未靠近任何车祸现场——她才明白,女儿根本没有打过那个电话。没有人类打过。电话里的哭泣声是从一段音频片段合成而来,而她以为自己正在拯救的那个女儿,不过是别人机器里的一组数字模式。 布莱特威尔的损失,在2025年夏天被美国各地新闻报道后,如今已成为美国最普通的犯罪之一。同时,它也是技术最先进的犯罪之一。这两个事实的碰撞——即一项需要机器学习前沿技术的欺诈行为,可以零成本、大规模地对一位普通祖母实施——正是执法部门、银行、电信公司和监管机构两年来未能控制的问题的核心特征。问题已不再是这项技术是否奏效。它奏效得惊人。问题在于,当攻击的复杂程度与目标受害者的认知水平之间的差距不是以月计、而是以年计时,真正有意义的保护需要什么。 ## 二十六年账本上的新条目 2026年4月,联邦调查局互联网犯罪投诉中心发布了上一年度网络犯罪的年度报告。在这份报告二十六年的历史中,首次将人工智能驱动的欺诈作为一个独立类别加以统计。数字触目惊心。该局记录了超过22,000起与AI相关的投诉,调整后的损失超过8.93亿美元。其中,报告将3.52亿美元的损失归因于60岁及以上的受害者,使老年人成为AI金融犯罪中针对性最强的单一群体。AI数据只是更大总额的一部分:全美网络犯罪损失在一年内增长了26%,达到209亿美元,其中60岁及以上美国人的损失占77亿美元——较上一年增长了约60%。 联邦调查局坦承,即使这些数字也低估了问题的严重性。报告中对AI的认定仅反映了受害者识别并报告的情况,而大多数语音克隆电话的受害者根本不知道有机器参与。他们相信——正如莎朗·布莱特威尔最初相信的那样——他们是在与自己的孩子通话。因此,8.93亿美元最好被理解为下限,而非上限——这是一个本质设计上就对受害者保持隐蔽的类别的可见部分。联邦调查局感到有必要创建这一类别本身就是一个信号。犯罪统计是保守的工具;机构不会为了一时风尚而重绘存在了二十六年的报告分类体系。账本上的这条新条目,承认了一个事实:三年前在消费领域几乎不存在的一种工具,如今已成为盗窃的主流手段。 在国际上,情况更为严峻,且正在恶化。2026年3月,国际刑警组织发布了《全球金融欺诈威胁评估》第二版,估计2025年全球金融欺诈损失达4420亿美元——这一数额相当于丹麦全年经济产出。该组织将威胁轨迹评定为“升级”,并描述了所谓的“欺诈工业化”:诈骗从机会主义个体向有组织、跨国运营转移,并与人口贩运和网络犯罪交织。关键是,国际刑警组织发现,AI增强型欺诈的利润率大约是传统欺诈的四倍半,而所谓的“自主式AI系统”现在可以自主规划并执行整个欺诈活动——从侦查到勒索赎金。换句话说,经济规律已发生逆转。工业规模的欺骗,制造成本几乎为零,却能带来巨额回报。 ## 三秒就够了 祖父母骗局的核心技术能力,描述起来极其简单。现代AI语音克隆系统仅需三秒的音频,就能产生一个与原始声音在实际上无法区分的合成语音。三秒,就是一条语音邮件问候语的长度,一段播客的片段,一个生日视频发布到公开Instagram账号时的背景音。原材料并非从安全数据库中窃取,而是由日常生活的录音行为自愿提供的。一个出现在单条TikTok视频中的孙辈,就提供了骗子制造绑架假象所需的一切。 威胁之所以严峻,不仅因为克隆技术有效,更因为实现克隆的工具廉价、丰富且几乎不受监管。2025年3月,《消费者报告》评估了六家公司的语音克隆产品——Descript、ElevenLabs、Lovo、PlayHT、Resemble AI 和 Speechify——并得出结论,大多数产品缺乏针对欺诈或滥用的有意义保障。该组织发现,其中四款产品仅要求用户勾选一个复选框,声明自己拥有克隆该声音的合法权利。这四款产品都没有采用任何技术机制来确认说话者是否真正同意,或限制克隆仅限于用户自己的声音。六家公司中有四家仅需一个姓名或电子邮件地址即可开设账户。这项调查的直白结论——由NBC新闻和《注册者》放大报道——是,该行业已经制造出一种能够冒充任何人的工具,然后将其置于一个自我声明复选框之后。 ElevenLabs 是最知名的提供商之一,它强调拥有多层安全计划:禁止冒充的禁止使用政策、可识别可能源于其系统的音频的公共AI语音分类器、将生成内容链接回产生该内容的账户的可追溯性,以及围绕选举周期阻止克隆某些受保护人物的“禁止语音”保障措施。这些并非微不足道的措施,且比几个竞争对手提供的要多。但它们有一个结构性弱点:几乎全部是事后操作。它们帮助调查人员在欺诈已经发生、受害者已经失去积蓄后确定来源。它们几乎无法阻止三秒克隆在第一时间被生成,因为能够阻止它的东西——即对被克隆者同意进行强有力、强制性的验证——恰恰是竞争激烈、快速发展的市场不愿强加于自身的阻力。当一项保障措施让公司损失转化率,并且只保护竞争对手的客户时,市场不会自愿提供它。事实上,它也没有。 ## 失明的法证权威 如果有一个瞬间能捕捉到基于检测的防御为何失败,那就是2026年6月《纽约时报》刊登的一篇人物特写。其主角是加州大学伯克利分校教授哈尼·法里德——他被广泛认为是全球深伪法证领域的最高权威。二十多年来,法里德一直以区分真实与合成内容的能力为职业,回应政府、人权组织、记者和执法部门的需求。但据《纽约时报》报道,近来他开始在自己的测试中失败。“我觉得自己正在失明,”他说。地球上最擅长区分真实录音与AI生成录音的人,再也无法可靠地做到这一点了。 这一坦白应该终结某种类型的讨论。多年来,对合成媒体应对策略的隐含承诺是,检测将跟上生成的步伐——每一个更令人信服的造假,就会有一个更灵敏的检测器,而这场军备竞赛尽管令人不安,但至少是可以赢得的。法里德的坦白证明,至少在音频领域,这场竞赛已经输了。当该领域最优秀的检测者沦落到抛硬币的地步时,在造假已被制造并传播后再去抓造假,根本算不上策略。那只是希望。而一场依赖二十分钟恐慌的欺诈,不会给受害者或他们的银行二十分钟的时间,去进行连哈尼·法里德本人都不再信任的法证分析。 这是有意义的保护要求我们接受的第一个也是最重要的事情:检测不能成为支撑性的防线。无法期望一位在电话中听到哭泣声的祖母进行法证分析,而该学科最顶尖的专家实际上已经放弃了这种做法。任何最终依赖于目标人物或其他人能够分辨真实声音与克隆声音的计划,都已经过时了。这一含义比电话欺诈更为深远。如果世界上检测合成音频的权威无法相信自己的判断,那么每一个静默假设人类可以作为后备验证者的下游系统——例如被要求“自行判断”的银行柜员,或被提醒“仔细听有没有不对劲”的亲属——都建立在已经崩溃的基础之上。 ## 脆弱性的架构 将老年人的针对性攻击归因于天真,是诱人但错误的。触发本文的简报揭示了一个更令人不安的事实:使老年人格外容易受害的特征,并非智力缺陷,而是人生圆满的特征。他们通常拥有较高的平均储蓄余额,这是数十年工作的积累,使他们成为高效的目标——一次成功的电话呼叫可能比针对年轻人的呼叫带来更多收益。他们成长于、并仍然在基于信任的沟通模式中运作,在这种模式下,接到受困扰亲属的电话会被当作真正的紧急情况来应对,而不是被当作潜在攻击来质疑。他们——并非自己的过错——对AI语音合成的存在相对不熟悉,因为一生中的大部分时间里,电话那头的声音理所当然地是一个人。而且,他们与所有父母和祖父母一样,暴露在家庭紧急情况特有的情感架构中,在这种架构下,保护孩子的本能会压倒所有更慢、更具怀疑能力的机能。 学术研究已经开始对此进行系统化。2026年6月发表的一篇arXiv论文明确指出,“老年人仍然对AI增强型骗局格外脆弱。”另一个由Yixin Zou领导的研究团队于2026年初发表的论文,研究了在AI日益复杂的情况下专门为老年人设计的欺诈干预措施,开发了一个名为ROLESafe的基于角色的模拟工具,当参与者通过扮演受害者或帮助者的角色(而非被动观察者)学习时,该工具提高了他们识别欺诈的能力。第三篇论文来自Charm Security公司的研究人员,提出了一个“人类脆弱性与利用框架”——这是一个结构化的目录,借鉴了软件安全领域的漏洞数据库,用于分类欺诈系统利用的认知和社会机制。该框架的前提本身就是一种无声的控诉:安全行业花费数十年时间编目和修补机器的弱点,却忽视了对人类弱点的记录和管理。祖父母骗局之所以成功,是因为它攻击的是系统中从未被打过补丁的那一部分。 这就是为什么针对老年人的宣传活动——尽管必要——不足以解决问题。该骗局利用的情感机制,不是一张传单能填补的知识空白;它是一个人对孙辈的爱,被武器化了。你可以告诉一个人一百遍声音可能是伪造的,但在克隆声音尖叫求救的那一刻,知识来不及到达。2026年6月美联社的报道(由《海峡时报》和《马尼拉时报》转载)引用了语音安全公司Pindrop的Amit Gupta的精准表述:“目标不是完美的语音复制。目标是制造足够的情感不确定性和紧迫感,让受害者在核实之前就采取行动。”一种建立在假设受害者会核实之上的防御,恰恰是针对攻击本意绕过的弱点而构建的。 那篇报道中最令人不寒而栗的证词并非来自老年受害者,而是来自一位律师。费城律师加里·席尔德霍恩本人曾遭遇语音克隆诈骗,他说即便有事后反思和职业怀疑精神,他仍无法动摇对所听到内容的确定感:“我会带着这个信念进坟墓——我发誓那是你的声音。”任何倾向于相信警惕性是答案的人都应该读读这句话。席尔德霍恩是一名训练有素的辩护律师,受雇于审视证据并质疑看似可信的故事,而克隆却彻底击败了他,正如它击败了一位惊慌的祖母。该骗局利用的脆弱性不仅存在于老年人、轻信者或技术文盲中。它存在于人类听觉系统本身——这个系统经过数百万年的进化,将熟悉的声音视为熟悉的人的证明——而现在,在漫长的进化史中首次,这个系统正在被系统性地、可利用地欺骗。 关于老年人的数据强化了而非反驳了这一重新框架。联邦贸易委员会2025年12月向国会提交的报告发现,60岁及以上人群报告的欺诈总损失在2020年至2024年间大约翻了两番,达到约24亿美元,其中68%归属于单次损失10万美元或以上的情况。该机构对真实年度成本的自身估计——考虑到因羞耻和尴尬导致的长期低报——高达815亿美元。这些数字并非轻信的少数人被骗走零花钱。这些数字是整整一代人积累的储蓄,正在通过一种专门针对他们信任模式、财务状况以及家庭情感核心位置的机制被抽走。 ## 不对称性,量化 安全公司Adaptive Security的首席执行官布莱恩·朗用一句话向美联社概括了新的经济学:“一个坐在键盘前的人,可以制造出无穷无尽的攻击者。”这就是不对称性的纯粹形式。一边是一个自动化系统,能在几秒钟内生成令人信服的克隆,拨通数千个号码,并用合成的情感进行每一次对话,边际成本趋近于零。另一边是一个独立的人类个体——通常年老、独处,并且在大约一段恐慌

相似文章