世界中の最高経営責任者(CEO)が同じ質問を繰り返す中、OpenAIは自らがこの問題を明確に計算することに決めました。人工知能への投資から、実際にどのくらいの価値を得ているのでしょうか?過去数十年間、ソフトウェア業界では採用率で成功や失敗を測っていました。つまり、どれだけのライセンスを販売し、どれだけのアクティブユーザーがいるか、どれだけのリニューアルがあるかなどで評価していました。しかしAIにおいては、その基準は通用しなくなりました。本当の指標とは、モデルが実際にどれだけの作業を遂行したかです。
7月17日にOpenAIが公開したこの長文では、企業リーダーが直面する重要な経済的課題が提示されています。人工知能が果たした仕事の価値が、それを作ったコストよりも速く成長しているのかどうか。この問いに答えるためには、単純に1トークンあたりのコストを見ても十分ではありません。安いモデルはトークンの単価が低いかもしれませんが、良い結果を得るために何度も試行錯誤したり、時間がかかる、人間による検証が必要になる可能性があります。一方で、高いモデルはトークンの単価が高いかもしれませんが、一度で正確な結果を出すことができるかもしれません。本当に重要なのは、成功した結果を得るための総合的なコストであり、その結果が生み出す価値と比較する必要があります。

これにより、OpenAIはAI時代における最終的なスコアカード「1ドルあたりの有用な知能」を提案しました。この指標は4つのことを問うものです。人工知能が意味のある仕事を果たしているか?それぞれの成功したタスクにかかるコストはどのくらいか?人々はその結果を信頼できるか?使い勝手が増すにつれて、1ドルのAI投資がより多くの価値を生み出しているか?
まず第一に、何人の有用な仕事を行ったか。価値はトークンが直接使用可能な実際の成果に変換されるときのみ生まれます。モデルが強ければ、扱えるタスクは長く複雑になります。上下文を保持し、複数ステップの推論を行い、ツール間での協働をしながら、過程で継続的に調整します。最も現実的な切り口は、具体的なワークフローを特定し、それがどのように完了するかを明確に定義して、実際に起こっているシステム内でその結果を測ることです。サポートチームにとって、完成とは顧客の問題が解決されることです。エンジニアリングチームにとっては、テストを通じたコード変更が行われることです。法務チームにとっては、正確かつ迅速に審査された契約書が作成されることです。OpenAIは財務チームが予測レビューのために準備する例を挙げています。最終的な意思決定を行う前に、最新の予測を探し、データをExcelやSheetsにインポートし、変化を識別し、シートのラベルを確認し、スライドを再構築し、すべての数字が一致しているかをチェックするという一連の作業を、ChatGPT Workに任せることで、チームは本当に重要なこと――変化の原因や次のステップについて考える時間を持ちました。これが、実際の1ドルがもたらす有用な知能です。
第二に、成功したタスクに実際にどれだけの費用がかかったか。AIタスクのコストには大きな違いがあります。簡単な回答はわずかな計算で済むかもしれませんが、プログラミング、研究、財務などのワークフローでは深層の推論やツールの呼び出し、大量の操作が必要であり、それには多くの計算力を使います。モデルレベルでは、1回の成功したタスクのコストは価格、実際に使われた計算量、そして正解を導き出す確率によって決まります。企業側では、このコストに従業員の時間、人間による検証、再試行、修正などが追加されます。アルゴリズムは簡単です。仕事を完了させるための総コストを合計し、品質基準に達したタスク数で割ります。これは、1トークンの最低価格が1結果の最低コストを保証しない理由でもあります。たとえば、通常の要求に対して、先端モデルが一度で正しい答えを出せば、再試行、遅延、検証、総計算量を節約でき、結果として最もコスト効果の高い選択肢となることもあります。
OpenAIが発表したGPT-5.6は、この論理に基づいて設計された3つの階層を持っています。Solはエースモデルで、Terraは性能とコストのバランスを取り、Lunaは高速かつ低コストです。この階層は顧客が式を最適化するための出発点を与えますが、OpenAIは最終的にはどのモデルを使用すべきかを、全体のタスクの経済性によって判断すべきだと強調しています。高スループットのプロセスではLunaを使用し、深い推論が必要な場合はTerraを使用し、より強い推論が少ない試行で最良の結果をもたらす場合はSolを使用します。GPT-5.6のトレーニングでは、各トークンがより多くの有用な成果を生み出すことが目標でした。Artificial Analysisプログラミングスマートエージェント指数では、最大の推論を有効にするGPT-5.6 Solは新しい最優秀記録を樹立し、他のトップモデルよりも54%少ない出力トークンを必要としました。DeepSWE v1.1の長期的な工程タスクでは、GPT-5.6 Solは72.7%という新記録を達成し、Claude Fable5の69.9%を上回りました。予測APIコストは36.2%削減されました。1世代のモデルは、両方の面で進歩することが求められます。より高い効率は古いタスクを安くし、より強力な能力は新たなタイプのタスクを可能にします。
第三に、AIが仕事の正確さをどれだけ高く維持しているか、つまり信頼性です。AIの導入は通常、段階的に深まっていきます。最初は補助的な起草から始め、その後ツールとデータの間で文脈を理解し、推論を行っていきます。さらに進むと、主動的に行動を取ったり、異常処理や完全なワークフローを処理するようになり、人間は必要に応じて判断や制御を行うだけになります。各段階で価値が増すだけでなく、システムにもより高い要件が求められます。信頼性そのものがお金であり、結果が正確で、出典が信頼でき、一貫性があり、適切なアップグレードが行われていれば、人々が審査、修正、再作業に費やす時間は減り、成功したタスクのコストも下がります。組織はAIを重要プロセスに組み込む自信を持つことができます。
OpenAIは、この点を測るための3つの結果をチームが追跡することを推奨しています。直接使用可能かどうか、修正が必要かどうか、アップグレード処理が必要かどうか。これらは単なるモデルの正確度以上に、AIがプロジェクトの完了に必要な作業量を本当に減らしているかどうかを示すものです。信頼性には明確な境界が必要です。AIが起草から行動へと移る前に、組織はシステムがアクセスできるデータ、使用または変更できるシステム、およびある操作を人間が審査または承認する必要があるタイミングを定義する必要があります。セキュリティ、保障、プライバシー、制御は、深く使用するための基礎です。ChatGPT Workは、ChatGPT Enterpriseのセキュリティ、コンプライアンス、ワークスペース管理を基盤としており、監督を保ちながらAIに価値あるプロセスに接続させることができます。能力が初めての使用を可能にし、信頼性がAIを仕事の一部として確立します。
第四に、使用量が増えるにつれて、1ドルのAI投資がどれだけ多くの仕事をこなせるか。企業は同じワークフローを長期的に追跡することで、これを測ることができます。品質基準に達したタスク数、それらを完了するための総コスト、およびそれぞれの成功したタスクのコストを統計的に集計してください。もし作業量が総コストより速く増加し、品質が一定または向上しているなら、1ドル当たりの価値が増加したことになります。演算力はこの等式の中心です。それは研究を駆動し、AIが行うすべてのタスクを駆動し、製品の品質、速度、信頼性、可用性、コストを決定します。訓練用の演算力は未来の能力を構築し、推論用の演算力は現在の価値を提供します。最終的には、すべてがより良い顧客成果に結びつきます。
より優れたモデル、より効率的な推論、専用ハードウェア、より高い利用率、より賢いルーティング、そしてより強力な製品設計は、演算力の報酬を高めます。顧客はこれらの改善を感じ取ることができます。答えがより正確で、レスポンスがより速く、修正が少なく、製品がより信頼性があり、仕事に必要なコストが低いのです。これらの利益は自己増幅します。より良いインフラストラクチャーが研究を加速し、研究がより強力で効率的なモデルを生み出し、モデルが製品を改善し、製品が採用、学習、収益の増加を促進します。そしてその結果、次世代の研究、演算力、展開、セキュリティへの継続的な投資が支えられていきます。OpenAIは、すべての要素を統合した単一の知能プラットフォームを使ってこれをまとめています。ユーザーはChatGPTやChatGPT Workを通じて使用し、開発者はCodexやAPIを通じて構築し、企業はリアルな作業が行われるシステムに導入します。あらゆる層の改善は、すべての製品と顧客に恩恵をもたらします。
