OpenAI は7月29日に新しい2つの音声エンジンをリリースしました。GPT-Live-TranscribeとGPT-Transcribeという2つのトランスクリプションモデルがAPI経由で利用可能となり、それらは単に音声を文章に変換するだけではなく、一言の裏にある文脈を理解し始めました。発音や専門用語、数字、あるいは背景にある雑音さえも、簡単に混乱させることはありません。

2つのモデルにはそれぞれ異なる特徴があります。GPT-Live-Transcribeは低遅延のリアルタイムシーンに最適で、話し手に合わせて即座にメモを取る速記者のように働き、1分あたり0.017ドル(現在の為替レートで約0.12元人民元)の料金がかかります。一方のGPT-Transcribeは、既存のオーディオファイルやバッチ処理に力を入れており、非同期トランスクリプションを行うため、1分あたり0.0045ドル(約0.03元人民元)の料金となり、後からまとめて録音を処理する作業に適しています。

本当の差別化ポイントは、これらのモデルが文脈をどれだけ理解できるかです。Context Aware ASRのベンチマークテストでは、GPT-Transcribeの意味的正確率は、自由な形式の文脈がない状態では41.6%だったものが、文脈を組み込むと45.2%まで上昇しました。これは、同じ単語が対話によってまったく異なる意味を持つことがあることを理解し始めたことを示しています。

Whisperという先駆けのモデルに対して、新モデルは大きく優位に立っています。Common Voiceがカバーする22の言語において、GPT-Transcribeは転記誤り率を19.27%に抑えており、Whisper(whisper-1)はまだ40.37%にとどまっているため、誤差は倍以上です。現実的な録音の9言語のベンチマークでは、誤り率は8.98%にまで低下し、Whisperの15.21%を遠く引き離しています。機械がノイズのある環境下でも専門用語を聞き分けられるようになると、音声インタラクションのドアがまた少しだけ開かれたように思えます。