當地時間9月18日,SpaceX 旗下的人工智能部門 SpaceXAI 放出了新一代語音轉文本模型 Grok Voice Transcribe2.0,最狠的一招是:在把錯誤率壓低約一半的同時,定價一分沒漲。
它紮根於 Grok Voice 底層的音頻基礎模型,而這套底座如今已經深度嵌入真實業務:每天接住數萬通客服電話、轉錄數百萬小時的視頻旁白,還驅動着實體硬件裏的各類語音智能體,其中就包括特斯拉車機上的 Grok 助手。換句話說,它不是實驗室裏跑分的模型,而是已經在一線被海量真實語音反覆打磨過的產物。

在 Artificial Analysis 的公開榜單上,Grok Voice Transcribe2.0在全部32款流式模型裏準確率排到第一,把同賽道對手甩在身後。SpaceXAI 還不滿足於公開基準,從自家線上業務裏抽樣了四個內部數據集做系統評測,涵蓋客服電話錄音、和 Grok 的日常英語對話、口述的電話號碼郵箱地址這類結構化信息,以及多語種短指令——四個數據集上2.0版對1.0版實現了全面碾壓。

真正讓開發者動心的是價格。批量轉錄仍是每小時音頻0.10美元,實時流式轉錄每小時0.20美元,和1.0完全相同;更關鍵的是,說話人分離、精確時間戳和自定義關鍵詞這幾項能力已經全部打包進基礎價,不再單獨收費。等於用舊版的價格,買到了錯誤率近乎減半、還多了功能的新模型——在語音識別這個價格敏感、調用量巨大的賽道里,這種"加量不加價"的打法,往往會比單純刷榜更能撬動落地。
VIP會員