OpenAI は、GPT-Live-1 を API に導入し、開発者がリアルタイムの音声インタラクションをサポートするアプリケーションやビジネスプロセスを開発できるようにしました。このモデルはフルデュプレックスの会話に対応しており、音声を同時に聴取および出力でき、会話中に中断、停止、バックグラウンドノイズを処理できます。
GPT-Live-1 は電話のシナリオにも対応し、レストランの予約やカスタマーサービスなどのフルデュプレックスの音声スマートエージェントに利用できます。OpenAI は、開発者が Codex などのツールと接続したり、OpenAI Presence を使って企業システムを照会し、承認された操作を実行し、必要に応じて人間に引き継げる音声ワークを構築できると述べています。

音声認識と出力を統合し、遅延が少ない
紹介によると、GPT-Live-1 は音声認識と音声出力を同じモデルに統合し、従来の「音声からテキスト→大規模言語モデル→テキストから音声」の複数の接続を減らして遅延を削減しています。また、複雑な推論とツール呼び出しを後方のテキストモデルに委任することも可能です。開発者はシステムプロンプトでトーン、速度、会話スタイルを調整でき、後方モデル、ツール、スマートエージェントフレームワークを設定することもできます。OpenAI は、GPT-Live-1 がネイティブな音声認識とテキストへの変換をサポートし、アルファベットと数字の理解、キーワードバイアス、ラウンド検出能力を持っていると説明しています。
初期評価によると、言語学習プラットフォーム Speak は GPT-Live-1 を使用したことで、学習者が思考を停止している間の誤っての中断回数が前回のラウンドベースのシステムに比べて約 80% 減少しました。医療サービスプラットフォームの共同創業者兼CTOである Tony Stoyanov は、チームがコード量を 80% 減らし、約 2.3 万行のコードを削除したと述べました。OpenAI が公表した評価結果によると、GPT-Live-1 は Full Duplex Bench テストで GPT-Realtime-2.1 より 30 ポイント高い成績を収め、GPT-6 Astra と組み合わせた中程度の推論強度では Tau3 エンド・トゥ・エンド音声スマートエージェントタスクテストで第1位となりました。
VIP会員