谷歌近日發佈Gemini3.8Live和Gemini3.8Live Extended Thinking,新增近實時推理、語音與思考同步處理,以及後臺工具和API調用能力。目前兩款模型已陸續登陸Gemini API、Google AI Studio等開發者平臺,並分別覆蓋Search Live、Gemini Enterprise及Google Workspace、Gemini Live等場景。

QQ20260916-093941.jpg

兩款模型的一項核心能力是支持AI在持續語音對話過程中後臺執行工具和API調用,用戶無需因網絡搜索或任務執行暫停交流。模型還支持97種語言自動檢測及對話中途切換、近實時視覺定位,並可在長時間思考任務中通過“讓我檢查一下……”等語言提示告知用戶當前狀態。

性能方面,Gemini3.8Live Extended Thinking在Artificial Analysis的Speech to Speech Quality Index中獲得82.6分;Gemini3.8Live在Speech Agent Arena排名第二。Extended Thinking版本在T-Voice測試中得分68.6%,在Sierra T-Voice基準測試中爲35.1%,Big Bench Audio測試達到97.7%。

此外,谷歌已與Agora、LiveKit、Vercel、Pipecat、Fishjam和Vision Agents等平臺合作,方便開發者集成新模型。谷歌同時表示,兩款模型生成的全部音頻均嵌入不可見SynthID水印,用於識別AI生成音頻。

此次升級進一步將實時語音交互從“聽與說”擴展至理解、推理和任務執行,推動語音AI向持續、多任務的智能體交互形態發展。