OpenAI は最近、ChatGPT の音声機能に使用されている GPT-Live-1 を開発者向けに正式に公開しました。開発者は今や API を通じてこの音声モデルを自社のアプリケーションや業務プロセスに統合し、ユーザーの話していることをリアルタイムで聞きながら返答できる全二重通信型の音声アシスタントを構築できます。このモデルの音声フロントエンドの料金は1分あたり0.05ドルで、複雑な推論に使用されるバックエンドのモデルはそれぞれのモデルの料金に応じて別途請求されます。

話しながら聞くことができ、途中での中断や停頓も自然に処理
GPT-Live-1 は OpenAI が今年リリースした新しいリアルタイム音声モデルで、最大の特徴はフルデュープレックス構造を採用している点です。伝統的な音声AIは、音声認識、言語モデルの推論、音声合成という3つのステップを順次行い、ユーザーが話を終えてからシステムが処理して返答を作成します。一方、GPT-Live-1 はユーザーの話していることを聞きながら音声出力を生成できるため、途中での中断や停頓、同意や迅速なやり取りなど、より自然に処理でき、いつ話し続けるか、一時停止するか、聞くか、ツールを使用するかを判断できます。
OpenAI はこの構造が音声インタラクションの遅延を明らかに低減し、従来のフローでよく起こる接続問題を解決したと述べています。開発者はもう一度複数の独立したモデル間の複雑な切り替えを調整する必要がありません。テストでは、GPT-Live-1 は Full Duplex Bench で GPT-Realtime-2.1 よりも30ポイント高い成績を収め、特に交代発言の遅延とインタラクティブな行動において顕著な改善がありました。また、GPT-6 Astra と中程度の推論強度で組み合わせた場合、評価されたエンドツーエンド音声インテリジェントエージェントタスクの Tau3 テストでも1位を獲得しました。
複雑な推論はバックエンドモデルに任せ、コストは必要に応じてカスタマイズ可能
GPT-Live-1 はすべての複雑な推論を担当するわけではありません。OpenAI は、リアルタイムで音声の受信と送信を行う音声モデルと、深い推論を担当するバックエンドモデルを分離しています。ユーザーが検索や複雑な分析、または長時間のタスクが必要な質問をした場合、GPT-Live-1 は作業をバックエンドモデルに渡し、同時に自然な音声コミュニケーションを維持します。開発者はこれにより、業務に応じてバックエンドモデルを選択できます。簡単なタスクには速く安いモデルを使い、複雑な問題にはより強力な推論モデルを割当てることができます。
応用面では、GPT-Live-1 は電話の場面をネイティブにサポートしており、レストランの予約やカスタマーサポートなどのフルデュープレックス音声インテリジェントエージェントに使用できます。初期の事例では、言語学習プラットフォーム Speak は、以前のルーチンベースのシステムよりも、GPT-Live-1 によりシステムが学習者を積極的に打ち切る状況がほぼ80%減少したと発見しました。このモデルはネイティブの音声認識と転記、応答テキストを提供し、キーワードバイアスやラウンド検出をサポートし、騒音のある環境にも最適化されています。OpenAI は同時に利用可能な音声を拡大し、多様な口音、方言、言語をカバーしています。開発者は、GPT-Live-1 を Codex などのツールと組み合わせて使用でき、音声モデルがタスクを受け取って、バックエンドツールが処理し、その後音声会話に戻すことができます。
VIP会員