OpenAIの最新研究が明らかにした:最先端のAIは依然としてコーディングの問題を解決することができない


OpenAIは、従来の「音声認識→推論→音声合成」という連鎖処理に代わる単一モデル構造を持つ全二重通信音声モデル「GPT-Live-1」をリリースしました。このモデルにより、遅延が顕著に低下し、人間のようにスムーズな対話が可能となりました。このモデルはAPIとして公開されており、開発者向けに設計されており、会話の中断や話題の転換などの複雑なシナリオにもより堅牢に対応できます。
OpenAI は開発者向けに GPT-Live-1 音声モデル API を開放し、ChatGPT の音声機能をアプリケーションに統合して、リアルタイムで発話と受話に対応する双方向音声アシスタントを構築できるようにしました。発話の前端は分間 0.05 ドル、バックエンドの複雑な推論モデルは別途料金がかかる。
OpenAIは正式にAgents APIをリリースし、CodexのハーネスをホストされたRESTインターフェースにカプセル化しました。コアエンドポイントはPOST /v1/agents/sessionsのみで、OpenAI-Betaヘッダーが必要です。OpenAIはセッション、コンポジション、コンテキスト圧縮および復元を担当し、アプリケーション開発者はツールと実行環境を提供します。ドキュメントではAgent(モデル+指示+ツール+MCPサーバー)、Environmentなどの4つの重要な概念およびホスティング機能が提示されています。
OpenAIは9月10日に、ChatGPT Pro 200ドルプラン(Pro 20X)の新規登録およびアップグレードを一時停止することを発表しました。これはFree、Go、PlusおよびPro 100ドルプランのユーザーに影響します。現在200ドルプランを利用しているユーザーには影響しません。100ドルプランの新規および既存ユーザーは引き続き正常に利用できます。200ドルプランのユーザーが解約またはダウングレードした場合、現在の課金サイクル終了後に再度購入することはできず、一時停止が解除されるまで再購入はできません。
OpenAIはGPT-Live-1をAPIで提供開始。開発者はリアルタイム音声対話アプリを構築可能。全二重対話に対応し、割り込みや背景騒音を処理。電話予約やカスタマーサポート向け音声AIに適し、CodexやOpenAI Presenceと連携して企業システムの照会や承認済み操作を実行できる。....