近日,谷歌發佈了關於全球語言智能的最新技術成果,宣佈其各項 AI 技術與產品已能夠支持超過300種語言、覆蓋全球71億人口及86% 的人口比例。谷歌表示,真正的語言大模型不僅要完成簡單的文本翻譯,更要深入理解人類在真實世界中充滿語氣、情感與文化細微差別的交流方式。
在技術架構上,傳統的語音識別通常採用將音頻轉爲文本、處理文本再轉回音頻的多步剛性管線,這會剝離掉人類對話中至關重要的語調、節奏、情感與上下文。爲了還原真實的交流質感,谷歌推動了向原生音頻智能的躍遷,讓諸如 Gemini 等模型能夠直接處理和理解音頻本身。

其中,Gemini3.5Live Translate 實現了跨70種語言、2000多個語言對的實時口語翻譯,並自然捕捉語碼轉換和情感線索;Gemini3.5Transcribe 作爲高精度語音轉文本模型,可在嘈雜環境或複雜專業術語下輸出規整文本,同時它也賦能了安卓鍵盤 Gboard 上的 Rambler 功能,支持去除口語贅詞、修正語法並用語音指令直接進行重寫與跨語種無縫切換。
爲了將 AI 的能力延伸至全球更多低資源語種,谷歌正式推進了“1,000種語言計劃”,旨在支持全球使用最廣泛的1000種語言。在此背景下,依託1200萬小時音頻訓練而成的通用語音模型(USM)利用跨語言遷移學習技術,將高資源語言中學到的模式應用到訓練數據稀缺的語種中。這些研究建立在過去25年開放研究和400多篇同行評審語音論文的基礎之上。
在語言數據的採集上,由於互聯網內容天然偏向少數主導語種,谷歌放棄了傳統的單一爬取模式,轉而通過在地基層的開源數據合作來獲取真實的文化語境。
其中包括與多個機構合作打造、覆蓋27種撒哈拉以南非洲語言的 WAXAL 大規模開源語音數據集;與印度科學研究所及 Bhashini 合作、採用區域錨定方式收集了109種語言超3萬小時語音的“瓦尼計劃”(Project Vaani);以及匯聚全球四大洲1600多名本地專家與20所大學共同貢獻多模態數據點的“放大計劃”(Amplify Initiative)。
此外,谷歌還推出了互動式語言探索工具 Language Explorer,用於持續可視化映射全球超過7000種語言的 LinguaMeta 數據倉庫。這些技術成果正通過數字語言包容中心等公益項目賦能全球的農民、醫護人員與教師。
針對全球仍有超過30億人無法獲得穩定互聯網連接的現實痛點,谷歌打造了 TranslateGemma 輕量級開源翻譯模型家族。該系列模型針對55種語言在端側設備上高效運行,無需連接雲端即可實現高質量翻譯。同時,針對低資源地區廣泛使用功能機的羣體,谷歌通過支持 Viamo 等機構在盧旺達試點推出“詢問 Viamo 任何事”(AVA)語音人工智能助手,藉助 Gemini 模型已成功爲功能機用戶解答了超過200萬個問題。
在無障礙設計與文化地標發音的細節打磨上,傳統工具往往迫使非標準發音人羣去適應技術。谷歌通過從頭設計無障礙交互,推出了基於50多種手語訓練、支持美式手語轉英文的“手語轉文本”(SL2T)技術,賦能 Gboard 與 Pixel11的實時轉錄。同時,谷歌深入新西蘭與毛利語專家合作,優化了地圖中地名與街道的本地化發音,將真正地道的文化語境與準確讀音內嵌至文本轉語音模型中。
歷經20年的 AI 語言研發,谷歌的語言技術已深度嵌入搜索、安卓、Chrome、YouTube 和谷歌 Play 等九大核心平臺。谷歌強調,技術的核心意義絕不是削減人類表達的多樣性,而是拓展表達的邊界,在尊重地方文化與真實語境的前提下,幫助更多人以自己的方式參與、表達並被世界理解。
VIP會員