OpenAI 在 7 月 29 日甩出了兩枚新的聽覺引擎。GPT-Live-Transcribe 與 GPT-Transcribe 兩款轉錄模型正式通過 API 開放調用,它們不再只是把聲音轉成文字的搬運工,而是學着去聽懂一句話背後的上下文——口音、術語、數字,乃至背景裏那陣喧鬧的人聲,都不再輕易讓它犯暈。
兩枚模型各有一副脾性。GPT-Live-Transcribe 生來爲低延遲的實時場景而造,像一位貼着說話人同步落筆的速記員,每分鐘收費 0.017 美元,按現匯率約合 0.12 元人民幣。GPT-Transcribe 則把力氣花在已完成的音頻文件和批量任務上,走異步轉錄的路子,價格壓到每分鐘 0.0045 美元,約合 0.03 元人民幣,更適合事後成批消化錄音的活兒。
真正拉開代差的,是它們對語境的消化能力。在 Context Aware ASR 基準上,GPT-Transcribe 的語義準確率從沒有自由形式上下文時的 41.6%,一路爬升到接入上下文後的 45.2%——它開始明白,同一個詞在不同對話裏可能意味着完全不同的東西。
面對 Whisper 這位老前輩,新模型幾乎贏下了一個身位。在 Common Voice 覆蓋的 22 種語言裏,GPT-Transcribe 把轉錄錯誤率壓到了 19.27%,而 Whisper(whisper-1)還停在 40.37%,差距超過一倍;放到真實世界錄音的九種語言基準上,它更是把錯誤率砍到 8.98%,把 Whisper 的 15.21% 遠遠甩在身後。當機器能聽清帶噪環境下的專業術語,語音交互那扇一直半掩的門,似乎又被推開了一道縫。
