AI惠及所有人,支持所有语言

Google AI Blog 新闻

摘要

Google通过新的Gemini模型推进AI语言支持,实现实时翻译和转录,旨在通过Universal Speech Model等举措覆盖1000种语言。

<img src="https://storage.googleapis.com/gweb-uniblog-publish-prod/images/AI_languages_blog_social.max-600x600.format-webp.webp">我们正在超越传统的文本翻译,打造能够理解世界丰富多样、鲜活语言的模型,让语言以原本的方式被表达。
查看原文
查看缓存全文

缓存时间: 2026/09/15 17:55

# 人人可用的AI,覆盖每一种语言 来源:https://blog.google/innovation-and-ai/technology/ai/ai-for-every-language/ 如今,我们的技术与产品在超过300种语言中支持着日常交流,覆盖逾70亿使用者——占全球人口的86%。这一里程碑意义重大,但也凸显了我们使命(https://about.google/company-info/commitments/)中至关重要的工作:数十年来,技术主要服务于少数主导语言,导致数千种鲜活语言和方言在数字世界中代表不足甚至完全缺席。 2006年推出Google翻译(https://blog.google/products-and-platforms/products/translate/fun-facts-google-translate-20years/)时,我们的目标很简单:打破语言壁垒。AI的进步帮助我们将这一愿景带给更多人,使翻译功能从最初支持少数语言扩展到如今支持250余种语言。但仅翻译文本远远不够。技术必须理解人们在现实世界中真实的沟通方式。因此,我们专注于研发能够尊重文化细微差异和人类语言丰富性的系统,让每个人都能按自己的方式参与交流并被理解。 以下是这项工作的具体实践。 ## 从文本到真正理解 传统语音识别系统遵循僵化的多步骤流程:将音频转写为文本,处理文本,再合成回语音。虽然可行,但这种流程剥离了人类沟通中最丰富的部分:语气、节奏、情感和语境。 人们说话不会始终是语法完美的工整句子。我们会在说话时笑、打断、犹豫,甚至在一句话中混用多种语言——比如常说西班牙式英语(Spanglish)或印式英语(Hinglish)。 为捕捉这种自然状态,我们超越文本转录,转向原生音频智能——训练Gemini等模型直接处理原始音频,同时理解声音与意图。具体成果包括: - **流畅的实时对话工具:** 如今,Gemini 3.5实时翻译(https://blog.google/innovation-and-ai/models-and-research/gemini-modelsgemini-live-3-5-translate/)支持70种语言和超过2000个语言对的实时口语翻译,自然捕捉语码转换和情感信号。Gemini 3.5转录(https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-5-transcribe/)是我们迄今最精准的语音转文本模型,可将原始音频转化为结构清晰、格式规范的文本,即使在嘈杂环境或处理复杂术语时也能保持高精度。该模型还驱动了Android Gboard上的「流畅转录」(https://support.google.com/gboard/answer/17468539?hl=en)等功能,可删除填充词、修正语法与标点,并支持通过语音指令编辑重写内容,实现无缝语言切换。 - **千语计划:** AI正以前所未有的规模帮助打破语言障碍。但要在用户首选语言中服务更多人,就必须超越当前AI表现优异的语言范畴:我们的目标是支持全球1000种最常用语言。为此,我们开发的通用语音模型(https://research.google/blog/universal-speech-model-usm-state-of-the-art-speech-ai-for-100-languages/)在1200万小时音频上训练,并采用跨语言迁移学习(https://arxiv.org/abs/2606.21954)技术,使模型能将从高资源语言学到的知识迁移至低资源语言,从而提升对训练数据较少语言的语音理解能力。 - **扎实的基础研究:** 这些工作建立在25年开放研究和超过400篇同行评审语音论文(https://research.google/search/?query=speech&)的基础上,持续推动语音模型的前沿发展。 ## 将社区置于语言数据的核心 由于网络内容不成比例地集中于少数主导语言,要让AI理解代表性不足的语言,我们必须重新思考数据收集方式。解决方案是与本地基层组织建立伙伴关系。这种本土化策略推动了我们最具雄心的三项开放数据合作: - **WAXAL**(https://research.google/blog/waxal-a-large-scale-open-resource-for-african-language-speech-technology/)(沃洛夫语意为「说话」,发音为"Wah-hal"):与马凯雷雷大学、Digital Umuganda等合作伙伴共同构建,WAXAL是一个大规模开放语音数据集,涵盖撒哈拉以南非洲地区27种语言,覆盖26个国家超过1亿使用者,捕捉了传统数据集常缺失的声调变化和对话节奏。 - **瓦尼项目**(https://vaani.iisc.ac.in/):与印度科学研究所(IISc)和Bhashini合作,该项目(https://arxiv.org/abs/2603.28714)通过区域锚定而非语言锚定的方式绘制印度的语言多样性地图,目前已从超过15.5万名使用者处收集了109种语言的3万多小时语音数据。 - **扩增计划**(https://research.google/blog/amplify-initiative-localized-data-for-globalized-ai/):我们与四大洲1600多名本地专家和20所大学(包括巴西UFMG、印度IIT Kharagpur和乌干达马凯雷雷大学)合作,贡献了15000个捕捉本地细微差别的多模态数据点。 我们还通过新工具语言探索器(https://sites.research.google/languages/language-explorer)延续对开源语言创新的支持。这个交互式工具可视化呈现了全球最大的开源语言数据仓库LinguaMeta,该工具曾获Fast Company设计创新奖(https://www.fastcompany.com/91589828/accessible-design-innovation-by-design-2026),持续映射超过7000种口语、书面语和手语。 当这些创新和合作能触达将数据与洞察转化为社区实际变革的人群时,其影响力将最大化。Google.org支持的数字语言包容中心(https://www.cdl-inclusion.com/)和AI新加坡「水族馆项目」(https://sea-lion.ai/blog/aquarium-open-data-platform/)等努力,正帮助将多语言工具带给全球农民、医护人员、教师及其他重要社区成员。 ## 克服现实限制 全球超过30亿人仍无法获得稳定网络连接[1](https://blog.google/innovation-and-ai/technology/ai/ai-for-everylanguage/#footnote-1)。技术只有在人们生活的地方——包括连接受限或断断续续的地区——也能发挥作用,才算真正普及。 为此,我们开发了翻译Gemma(https://blog.google/innovation-and-ai/technology/developers-tools/translategemma/),这是一系列基于Gemini构建的轻量级开源翻译模型,在55种语言上训练而成。由于翻译Gemma能在设备端高效运行,高质量翻译不再需要连接云端或互联网。 然而,运行强大AI模型需要性能优良的硬件,这排除了资源匮乏地区仍使用基础功能手机的数亿用户。为弥合这一鸿沟,我们支持Viamo(https://viamo.io/)等组织驱动「问Viamo任何事」(AVA)——一个将Gemini能力带到标准功能手机的语音AI助手。Viamo已在卢旺达与现有交互式语音应答用户成功试点AVA(https://www.youtube.com/shorts/kXtpcVf4O4A),该服务已利用Gemini回答超过200万个问题。 ## 为无障碍而设计 语言不仅关乎地区方言或词汇,还包括人们沟通的其他多种方式。传统语音工具常无法适应非标准语音使用者,迫使他们去适应技术而非相反。 我们正致力于从根本上为无障碍而设计来改变现状,例如手语转文字(SL2T)(https://deepmind.google/blog/putting-sign-language-ai-into-users-hands/)。SL2T在50多种手语上训练,为Pixel 11上的Gboard和实时转录提供手语转文字听写功能,首批支持美国手语(ASL)转英语。这是使我们的产品对全球7000万依赖手语沟通的人群更具包容性的重要一步。 ## 实现地道的本地发音 细节至关重要,尤其在导航等日常工具中。当导航应用错读城镇或街道名称时,不仅会引起混淆,更可能忽视该地的文化传承。 我们认为文化语境应成为语言技术构建的基础,这意味着直接与本地社区合作。例如在新西兰,我们与毛利语言专家合作改进谷歌地图中的地名发音(https://blog.google/products-and-platforms/products/maps/te-reo-maori/),使体验更精准且真正本地化。将文化准确的发音直接融入文本转语音模型,确保技术能反映服务社区的语言与文化遗产。 ## 为所有人构建语言工具 我们在20年AI语言研发中的重要经验是:技术永远不应缩小人类表达的范畴——而应拓展它。 如今,我们的语言技术已嵌入核心生态系统,通过搜索、安卓、Chrome、YouTube和Google Play等九大平台连接超过50亿人。但规模只是故事的一部分。更重要的目标是深度与丰富性——构建能理解语境、尊重文化、颂扬多元沟通方式的系统。 随着我们扩展AI应用以应对社会重大机遇(https://blog.google/innovation-and-ai/technology/ai/ai-applications-sciencepeople),我们将继续与本地社区紧密合作,构建帮助更多人以自己的方式沟通、参与并被理解的技术。

相似文章

Gemini

Reddit r/singularity

谷歌的Gemini AI模型代表了多模态AI能力的重大进步。

我们构建通用AI助手的愿景

Google DeepMind Blog

Google DeepMind 宣布计划将 Gemini 2.5 Pro 扩展为通用AI助手,具备世界建模、规划和模拟世界各个方面的能力。该愿景整合了来自 AlphaGo、Genie 2 及其他项目的突破性进展,旨在推进人工通用智能(AGI)的发展。

Gemini 3.5 Transcribe 智能转录

Google DeepMind Blog

Google 推出 Gemini 3.5 Transcribe,这是一款新的 AI 模型,提供精确且智能的实时语音转文本转录,开发者可通过 API 获取。

我们在2026年6月宣布的最新AI新闻

Google AI Blog

Google总结了2026年6月的主要AI更新,包括推出Gemini 3.5 Live Translate、Android 17、新款Google Home Speaker,以及本地AI模型如Gemma 4 12B,同时还有Gemini 3.5 Flash的计算机使用能力。