OpenAIは公告を発表し、ChatGPTデスクトップアプリのアップグレード(Codexと統合)を発表しました。また、GPT-Liveモデルによって駆動されるChatGPT Voiceという音声モードが導入されました。ユーザーはチャット、オフィス作業およびプログラミングの3つのセクションで、音声を使ってタスクを開始、確認または調整でき、マルチスレッドでの作業協力を実現します。
両方向音声により、会話しながら仕事に取り組む
開発の歴史において、OpenAIは2024年に初めてChatGPTに音声認識機能を導入し、その後継続的に音声技術に投資してきました。最新版のGPT-Liveモデルは、両方向音声を実現し、同時に聞き取って話すことが可能となり、AIの対話が人間同士の会話のように感じられるようになりました。OpenAIは声明の中で、「私たちはAIのビジョンに向かって進んでいます。将来のユーザーは、自分の要望を口頭で述べるだけで、ChatGPTがあなたの考えに沿って迅速に複数のタスクを進行させるようになります」と述べました。
ChatGPT Voiceは、ユーザーが単一の会話から複数のワークフローを開始できるようにし、スマートエージェントのバックグラウンドでタスクを完了する間に会話を続けることができます。ビジネス旅行の計画を例にすると、ユーザーはChatGPTにカレンダーをチェックして衝突がないか確認させ、受信トレイを整理してフライトの変更があるかどうかを確認させ、会議記録を準備させることが可能です。これらすべては「ユーザーがコーヒーを淹れるか、他のことをしている間に」行われます。これはAIが単にあなたが質問したことに答えるツールではなく、本当にあなたのマルチタスクワークフローを引き受けるものであり、音声インタラクションが単純な会話から効率的なスマートエージェントとの協働へと進化することを意味しています。
