xAI推出新一代語音識別模型 Grok Voice Think Fast2.0,面向構建語音智能體的開發者開放,在智能水平、轉錄準確率、對話能力以及工具調用效率方面實現升級。該模型定價爲每分鐘音頻0.08美元,xAI表示無需修改現有提示詞,Think Fast2.0即可在多數應用場景中帶來性能提升。

在Artificial Analysis語音識別基準測試中,Grok Voice Think Fast2.0綜合得分達到82.9%,高於前代Think Fast1.0的75.7%,同時超過GPT-Realtime-2.1的79.1%和Gemini3.1Flash的69.5%。其中,智能體能力評分達到56.5%,領先於Think Fast1.0的52.1%、GPT-Realtime-2.1的45.7%以及Gemini3.1Flash的37.7%。模型首次音頻播放時間也從1.25秒降低至0.70秒,響應速度進一步提升。

QQ20260730-105746.jpg

在語音轉錄方面,xAI針對24種語言的大量語音片段進行了測試。官方數據顯示,相比Deepgram Nova3和ElevenLabs Scribe v2,Think Fast2.0的轉錄準確率提升約1.5至2倍;相比上一代模型,準確率提升約1.4倍。在背景噪音和電話壓縮等複雜環境下,xAI稱兩者差距可擴大至約10倍。

技術層面,Think Fast2.0支持語音並行推理,通過減少等待時間提升複雜任務處理效率。相比上一代模型,其推理標記使用量中位數下降至0.4次,使工具調用通常能夠在智能體完成首句回覆前執行。同時,強化學習優化了模型對話策略,使其傾向於採用更短回答、單次處理一個問題,並減少無效信息輸出,以更好支持複雜工作流程。

xAI表示,此次升級主要面向真實業務場景中的語音Agent可靠性提升。目前,Grok Voice已在Starlink電話服務中進行A/B測試,並帶來了銷售轉化率和客服響應效率提升。

按照計劃,2026年8月5日,grok-voice-latest別名將自動從grok-voice-think-fast-1.0切換至grok-voice-think-fast-2.0。仍需使用舊版本的開發者需要提前鎖定1.0版本標識符,其他用戶無需額外操作。

隨着AI Agent逐步進入客服、銷售、辦公等實際應用場景,低延遲、高準確率、多工具協同的語音模型正成爲下一階段智能交互的重要基礎。