为每个人提供每种语言的人工智能
我们正在超越传统的文本翻译,建立能够准确理解世界上丰富、生动的语言的模型。

来自 Google AI 的官方动态,版本与适用范围以发布方说明为准。
Google AI · 查看官方发布中文机器翻译 · 原文附后
为每个人提供每种语言的人工智能
如今,我们的技术和产品为超过 70 亿人(占全球人口的 86%)使用 300 多种语言的日常互动提供动力。实现这一里程碑意义重大,但它也强调了对我们的使命至关重要的工作。几十年来,技术在少数主流语言中发挥了最佳作用,导致数以千计的现存语言和方言在数字世界中表现不佳或完全消失。
当我们在 2006 年推出 Google 翻译时,我们的目标很简单:打破语言之间的障碍。人工智能的进步帮助我们将这一愿景带给更多人,将翻译从少数几种语言扩展到如今的 250 多种语言。但翻译文本还不够。技术需要了解人们在现实世界中的实际沟通方式。因此,我们的研发重点是构建尊重文化差异和人类语言丰富性的系统,使每个人都能以自己的方式参与并被理解。
这是这项工作在实践中的样子。
从文字到真正的理解
从历史上看,语音识别系统遵循严格的多步骤过程:将音频转录为文本,处理该文本,然后将其合成回音频。虽然有效,但这条管道剥夺了人类交流中最丰富的部分:语气、节奏、情感和语境。
人们不会用完全整洁、合乎语法的句子说话。我们会大笑、重叠、犹豫,并在句子中间将多种语言编织在一起,就像我们说西班牙英语或印度英语时一样。
为了捕捉这一点,我们超越了文本记录,转向了原生音频智能——训练 Gemini 等模型直接按原样处理音频,同时掌握声音和意图。这些努力包括:
流畅的实时对话工具:如今,Gemini 3.5 Live Translate 支持 70 种语言和 2,000 多种语言对的实时口语翻译,自然地捕获语码转换和情感线索。Gemini 3.5 Transcribe 是我们迄今为止最精确的语音到文本模型,即使在嘈杂的环境或复杂的行话中,也能将原始音频转换为精美的格式化文本。它还支持 Android Gboard 上的 Rambler 等功能,可删除填充词、修复语法和标点符号,并允许您使用语音命令进行编辑或重写以及在语言之间无缝切换。千种语言计划:人工智能正在以前所未有的规模帮助我们打破语言障碍。但用更多人喜欢的语言来接触他们意味着超越当今人工智能表现最好的语言:我们的目标是支持世界上 1,000 种最常用的语言。为了帮助实现这一目标,我们的通用语音模型(经过 1200 万小时的音频训练)使用了跨语言迁移学习,这种技术使模型能够迁移从数据丰富的语言中学到的知识,从而提高对训练数据少得多的语言的语音理解。这使得模型能够将从数据丰富的语言中学到的模式应用到资源贫乏的语言中。严谨的基础研究:这项工作建立在 25 年的开放研究和 400 多篇同行评审的演讲论文的基础上,这些论文有助于推动前沿和先进的演讲模型。
将社区置于语言数据的核心
由于网络不成比例地代表了几种主要语言,因此教人工智能理解代表性不足的语言需要我们重新思考如何收集数据。解决方案是当地草根伙伴关系。这种本地化方法推动了我们三个最雄心勃勃的开放数据合作伙伴关系:
WAXAL(Wolof 意为“说话”,发音为“Wah-hal”):WAXAL 是与 Makerere University 和 Digital Umuganda 等合作伙伴共同构建的大规模开放语音数据集,涵盖 27 种撒哈拉以南非洲语言,超过 26 个国家/地区的 1 亿多人使用该数据集,捕捉传统数据集中经常缺失的音调变化和对话节奏。 Vaani 项目:Vaani 项目与印度科学研究所 (IISc) 和 Bhashini 合作,通过区域锚定而非语言锚定的方法绘制印度的语言多样性图,使其能够收集迄今为止超过 155,000 名发言者跨越 109 种语言的超过 30,000 小时的演讲。 Amplify Initiative:我们与 1,600 多名当地专家和四大洲的 20 所大学(包括巴西的 UFMG、印度的 IIT Kharagpur 和乌干达的 Makerere 大学)合作,提供 15,000 个多模式数据点,捕捉当地的细微差别。
查看英文原文
AI for everyone in every language
We’re moving beyond traditional text translation to build models that understand the world’s rich, living languages exactly as they are expressed.
AI for everyone in every language
Today, our technologies and products power everyday interactions in more than 300 languages, spoken by more than 7 billion people — representing 86% of the global population. Reaching this milestone is meaningful, but it also underscores work that is critical to our mission. For decades, technology has worked best for a handful of dominant languages, leaving thousands of living languages and dialects poorly represented or absent altogether from the digital world.
When we launched Google Translate in 2006, our goal was simple: to break down the barriers between languages. Advances in AI have helped us bring that vision to more people, expanding Translate from a handful of languages to more than 250 today. But translating text isn’t enough. Technology needs to understand how people actually communicate in the real world. So we focus our research and development on building systems that honor cultural nuance and the richness of human language, enabling everyone to participate and be understood on their own terms.
Here’s what that work looks like in practice.
Going from text to true understanding
Historically, speech recognition systems followed a rigid, multi-step process: transcribing audio into text, processing that text, and then synthesizing it back into audio. While functional, this pipeline strips away the richest parts of human communication: tone, pacing, emotion, and context.
