Google近日正式發佈了Gemini系列最新的語音轉文字模型Gemini3.5Transcribe,並將其定位爲該系列迄今爲止準確度最高的語音識別模型。該模型全面面向開發者、企業及廣大普通用戶開放,重點攻克了嘈雜環境、複雜專業術語以及自然口語表達等長期困擾行業的識別痛點。

在覈心技術與應用場景方面,Gemini3.5Transcribe展現出了強大的泛化能力。新模型不僅能夠有效過濾背景噪聲,還對專業領域的複雜詞彙提供了卓越支持。目前,該模型已率先爲macOS平臺的Gemini應用以及Android平臺Gboard鍵盤的Rambler功能帶來了顯著性能改進。對於開發者而言,則可以藉助這一工具高效構建語音智能體、實時字幕工具以及通話後分析流程等創新應用。

image.png

針對人類日常對話的複雜性,新模型在功能設計上進行了多項精細化優化。它能夠更好地捕捉說話者的自然語義意圖、識別自定義詞彙,並輔助用戶通過語音順暢完成各種任務。同時,該模型原生內置了多項實用功能,包括自動自我修正、智能過濾並刪除“嗯”、“啊”等口語填充詞,以及對輸出文本進行自動格式化。更具想象力的是,它還能將文件分析、圖像生成等更復雜的長鏈條任務委派給其他Gemini模型處理,從而爲用戶帶來全鏈路的多模型協作體驗。

在客觀的轉寫準確率表現上,Google公開的數據顯示,Gemini3.5Transcribe在流式語音識別場景中的平均詞錯誤率(WER)僅爲4.0%,而在非流式場景中更是大幅降至2.6%。即便在噪聲較多的複雜環境中,它依然能保持極高的識別穩定性,並且在識別由字母和數字交織組成的關鍵信息(如訂單編號、郵政編碼等)時更加精準無誤。

在多語言與個性化適應性上,該模型同樣表現亮眼。目前其語言支持已全面覆蓋85種語言,並能完美適應不同地區的口音與方言變體。針對預處理音頻,它支持爲最多三名不同的說話者提供帶時間戳的語音歸屬識別。此外,模型還高度支持用戶自定義詞彙表,能夠完美應對各行各業的專業術語、特殊拼寫及專屬名稱。

在開放節奏與產品生態串聯方面,開發者目前已經可以通過Google AI Studio和Google Antigravity中的Gemini API,以公開預覽的形式搶先體驗Gemini3.5Transcribe,而普通用戶則可直接在Android和macOS平臺進行日常體驗。未來,Google還計劃將其無縫引入Chrome瀏覽器,讓用戶能夠在任意網頁輸入框中實現便捷的語音直接輸入。伴隨此前Gemini3.7Flash的推出、Gemini in Chrome面向美國全量安卓用戶開放以及助手接入Waymo自動駕駛出租車,Google正在以極高的節奏持續完善其全場景AI產品矩陣。