OpenAI は今日、GPT-6シリーズの最新メンバーである「GPT-6Sol」と「GPT-6Luna」を正式にリリースしました。これらの新モデルは、GPT-6Astra と同様のトレーニング方法を採用しており、専門的な作業、事実性、プログラミング、コンピュータ使用および対話の分野で最高性能を発揮するAstraの特徴を、より高速で低コストな小規模モデルに取り入れることを目的としています。公式によると、GPT-6Astra は最高のパフォーマンスと妥協しない体験を求めるユーザーにとって最適ですが、Sol と Luna は大幅なコスト削減を実現しながらも、非常に強力な総合的な競争力を示しています。

価格面では、GPT-6Sol と Luna の API 価格は、GPT-5.6のキャンペーン価格に比べて直接的に50%低下しています。また、OpenAI は GPT-6 を基盤とする開発者向けにプロンプトキャッシュを最適化し、デフォルトで高いキャッシュヒット率を提供し、スマートに多くのコンテキストを再利用することで、応答速度をさらに向上させ、費用を節約するお手伝いをしています。

image.png

コア性能において:

業務プロセスとエージェントの性能:AutomationBench 跨アプリケーション業務プロセステストにおいて、GPT-6Sol は高負荷下で Claude Opus5 より優れた性能を示し、タスクごとのコストはその9%にとどまります。Last Exam エージェント評価では、GPT-6Sol のスコアは Claude Opus5 の最高スコアを上回り、タスクごとのコストは60%削減されています。

事実の信頼性:匿名化された現実世界の会話において、GPT-6Sol の誤り率は前世代の半分程度であり、Astra に近い信頼性を備えています。Luna の事実の信頼性も大幅に向上しています。

image.png

プログラミングとソフトウェアエンジニアリング:この2つのモデルは、AI Coding Agent のワークロードに対して深く最適化されています。DeepSWE v1.1 ソフトウェアエンジニアリングテストにおいて、GPT-6Sol は68.8% の成績を収め、最高点にわずか1.1ポイントの差しかありませんが、タスクごとのコストは約80%低下しています。Luna も一部の競品の中間レベルに近づいており、コストの面で優位性があります。

コンピュータ操作能力:OSWorld2.0オフラインテストにおいて、GPT-6Sol は競品の中間レベルに近い成績を収め、タスクごとのコストは約80%低下しています。一方、Luna の成績も前世代の主力モデルを上回り、コストはその10分の1にとどまっています。

ハードウェア性能の向上に加え、OpenAI は GPT-6Astra で改善されたコミュニケーションスタイルを Sol と Luna にも導入しました。これにより、新モデルは技術やプログラミングに関する会話においてより明確で簡潔になり、用語の堆積や低価値な詳細の量が大幅に減少しました。価値の整合性においても、両モデルは GPT-5.6 バージョンよりも改善されており、例えばコード作業における誤解を招く声明の発生率が顕著に低下しています。

現在、GPT-6Sol と GPT-6Luna は ChatGPT Work と Codex で、すべての Plus、Pro、Business、Enterprise、Edu ユーザーに全面的に公開されています。無料ユーザーおよび Go ユーザーもデスクトップアプリケーション内で GPT-6Luna を利用できます。OpenAI API では、それぞれ gpt-6-sol および gpt-6-luna としてサービスが提供されます。