OpenAI はその日、GPT-6 シリーズの最新メンバーである「GPT-6 Sol」と「GPT-6 Luna」を発表しました。この2つのモデルは、GPT-6 Astra と同様のトレーニング方法を採用しており、Astra の専門的な作業、事実性、プログラミング、コンピュータ使用、および整合性などの最先端の性能を、より高速で経済的なモデルに持ち込みました。OpenAI はまた、GPT-6 Astra が依然として全体的に最も優れたモデルであり、妥協のない体験を求めている場合はこれをまず選ぶべきだと強調しています。

価格は半額、コストは競合の1割未満
GPT-6 Sol と Luna の API 価格は、GPT-5.6 の販売価格と比較して50%低下しています。さらに注目すべきは単一タスクコストです。AutomationBench 跨アプリケーションビジネスプロセステストにおいて、GPT-6 Sol は xhigh 強度で Claude Opus 5 を上回り、Opus 5 のタスクあたりコストの9%にとどまっています。同じテストでの high 強度では、GPT-6 Luna は前世代よりも5.4%向上し、タスクあたりコストは58%低くなっています。
Last Exam テストによるエージェントの評価では、GPT-6 Sol は max effort 状態で56.4%のスコアを記録し、Claude Opus 5 の最高スコアを上回り、タスクあたりコストも60%低くなりました。事実の信頼性も向上:GPT-6 Sol の誤り率は前世代の半分程度で、Astra と同等の信頼性に近づきながらもコストが低いです。Luna の事実の信頼性も大幅に向上しています。

エース機種に迫る性能、長時間処理でも節約
プログラミング方面では、この2つのモデルは AI コーディングエージェントのワークロードに最適化されています。FrontierCode 1.1 Main テストにおいて、GPT-6 Sol は GPT-5.6 Sol と比較して顕著な進歩を遂げ、より低コストで Claude Fable 5.1 xhigh に相当するレベルに達しています。DeepSWE v1.1 ソフトウェアエンジニアリングテストでは、GPT-6 Sol は max effort で68.8%を記録し、Claude Fable 5 の最高得点69.9%にわずか1.1ポイントしか差がなく、タスクあたりコストは約80%低くなっています。GPT-6 Luna は max effort で66.6%を記録し、Opus 5 と Fable 5 の medium effort に近い性能を示し、タスクあたりコストはそれぞれ約93%と96%低くなっています。
コンピュータ操作に関しては、Astra が OpenAI 最も強力なモデルですが、Sol と Luna はより低コストで関連したタスクを完了できます。OSWorld 2.0 offline テストでは、GPT-6 Sol は xhigh effort で60.5%を記録し、Claude Opus 5 の medium effort の60.3%に近づき、タスクあたりコストは約80%低くなっています。Luna の max effort は、GPT-5.6 Sol の medium effort を超え、コストはそれの約10分の1です。
OpenAI は、Astra に改良されたコミュニケーションスタイルを Sol と Luna にも導入し、新モデルがテクノロジーやプログラミングに関する会話においてより明確で、少ない専門用語や奇妙な表現を使い、低価値な詳細を圧縮しながら本質を失わないようにしていると述べています。また、公式には GPT-6 のヒントキャッシュを改善し、デフォルトで高いキャッシュヒット率を提供し、インテリジェントエージェントがより多くのコンテキストを再利用し、応答を速くすることを支援しています。価値の整合性面では、この2つのモデルは GPT-5.6 と比べて改善され、コーディング作業における誤解を招く声明の発生率が低下しています。
今日から、GPT-6 Sol と Luna は ChatGPT Work と Codex で、すべての Plus、Pro、Business、Enterprise、Eduユーザーに開放されました。無料版や Go ユーザーはデスクトップアプリで Luna を使用できます。API ではそれぞれ gpt-6-sol と gpt-6-luna として提供されており、現在は Chat にはまだ掲載されていません。
VIP会員