當全世界的首席財務官都在追問同一個問題時,OpenAI決定親自下場把這筆賬算明白:我們從人工智能的投入裏,到底換回了多少價值?過去十幾年,軟件行業習慣了用採用率衡量成敗——賣了多少席位、有多少活躍用戶、續費了多少許可證。但到了AI這裏,這套尺子失靈了。真正的刻度,應該是模型到底幹完了多少活。

OpenAI在7月17日發佈的這篇長文裏,把企業領導者面對的核心經濟命題攤開:人工智能完成的工作,其價值增長是否快過了生產它的成本增長?要回答這個問題,光看每token成本遠遠不夠。一個便宜的模型,token單價或許低,但爲了得到好結果,可能要反覆試錯、耗費更多時間、疊加更多人工審覈;一個昂貴的模型,token單價高,卻可能一次就把任務做對。真正的成本,是產出一個成功結果的完整代價,再拿它去對照這個成果創造的價值。

image.png

於是OpenAI給出了AI時代的終極記分卡——有用智能每美元。這個指標要回答四件事:人工智能是否在完成有意義的工作?每一項成功任務的成本是多少?人們能否信賴它的結果?隨着用量增長,每投入一美元的人工智能,是否創造了更多價值?

先說第一項,完成了多少有用工作。價值只在token變成人們能直接使用的實際產出時才被創造出來。模型越強,能扛下的任務就越長越複雜:它開始保持上下文、做多步推理、跨工具協作,並在過程中不斷調整適應。最務實的切口,是先鎖定一個具體工作流,定義清楚什麼叫完成,然後在工作實際發生的系統裏去度量這個結果。對支持團隊,完成意味着一個客戶問題被解決;對工程團隊,是一筆通過測試的代碼變更;對法務團隊,是一份被準確且及時審查的合同。OpenAI舉了一個財務團隊爲預測評審做準備的例子:在最終決策之前,要去找最新預測、把數據導進Excel或Sheets、識別變化、覈對標籤頁、重建幻燈片、檢查所有數字是否吻合,這一連串雜活大部分都可以交給ChatGPT Work,團隊因此騰出精力去想真正重要的事——發生了什麼變化、爲什麼、下一步該怎麼辦。這就是每一美元在實踐裏換來的有用智能。

第二項,一個成功任務實際花了多少錢。AI任務的成本天差地別,一句快速回答消耗的計算極少,而編碼、研究、財務類工作流往往涉及深度推理、工具調用和大量操作,它們吃更多算力,也創造更大價值。在模型層面,單次成功任務的成本由價格、實際用掉的計算量以及得出正確結果的概率共同決定;對企業而言,總成本還要疊上員工時間、人工審覈、重試和返工。算法很簡單:把完成工作的總成本加起來,除以達到質量標準的任務數量。這正是每token最低價未必換來每結果最低成本的原因——即使對常規請求,如果一個前沿模型能一次給對答案,省下的重試、延遲、審覈和總計算量,反而可能讓它成爲最划算的選擇。

OpenAI剛發佈的GPT-5.6正是按這個邏輯設計的三個層級:Sol是旗艦,Terra在性能與成本間取平衡,Luna最快也最省。這套分層給了客戶優化公式的起點,但OpenAI強調,最終該用哪檔模型,要看整筆任務的經濟性——高吞吐流程用Luna,需要深度時用Terra,當更強推理能以更少嘗試換來最好結果時用Sol。訓練GPT-5.6時,OpenAI的目標就是讓每個token產出更多有用成果:在Artificial Analysis編程智能體指數上,開啓最大推理的GPT-5.6Sol創下新的最優水平,同時比另一款領先模型少用了54%的輸出token;在DeepSWE v1.1長週期工程任務裏,GPT-5.6Sol達到72.7%的新高,高於Claude Fable5的69.9%,預估API成本還降低了36.2%。每一代模型都該在兩方面同時進步——更高效率讓舊任務更便宜,更強能力讓全新類型的工作成爲可能。

第三項,AI正確完成工作的頻率有多高,也就是可靠性。人工智能的採用通常會分階段深化:先是輔助起草,接着在工具和數據之間找上下文、做推理,再往後開始主動採取行動、處理異常、跑完整個工作流,而人只在必要時給出判斷和控制。每一步都創造更多價值,也對系統提出更高要求。可靠性本身就是錢——當結果準確、來源可靠、前後一致且能恰當地升級處理,人們花在審查、糾正和返工上的時間就少了,成功任務的成本隨之降低,組織也更有底氣把AI用進更重要的流程。

OpenAI建議團隊追蹤三種結果來衡量這一點:可直接使用、需要修正、需要升級處理,這比單純的模型準確率更能說明AI是否真的減少了完成項目所需的工作量。可靠性還需要清晰的邊界:在AI從起草走向行動之前,組織必須定義系統能訪問哪些數據、可以使用或更改哪些系統、何時需要人工審查或批准某個操作。安全、保障、隱私和控制構築了深度使用的基礎,而ChatGPT Work正是建立在ChatGPT Enterprise的安全、合規與工作區管理之上,讓組織在保持監督的同時,給AI接入更有價值的流程。能力帶來第一次使用,可靠性才讓AI成爲完成工作的組成部分。

第四項,隨着使用量增長,每一美元AI投入能否完成更多工作。企業可以長期追蹤同一工作流來度量:統計達到質量標準的任務數、完成它們的總成本、以及每項成功任務的成本,如果完成的工作量增長快過總成本、質量還保持不變或提升,那麼每一美元就產出了更多價值。算力處於這個等式的核心——它驅動着研究,也驅動着AI完成的每一項任務,決定了產品質量、速度、可靠性、可用性和成本。訓練算力構築未來能力,推理算力交付當下的價值,兩者最終都要轉化爲更好的客戶成果。

更優的模型、更高效的推理、專用硬件、更高利用率、更聰明的路由和更強的產品設計,都能擡升算力的回報。客戶從體感上接住這些改進:答案更準、響應更快、修正更少、產品更可靠、完成所需工作的成本更低。這些收益會自我累積——更好的基礎設施加速研究,研究催生更強更高效的模型,模型改進產品,產品推動採用、學習與收入增長,而這又反過來支撐對下一代研究、算力、部署和安全的持續投入。OpenAI用一個統一的智能平臺把所有這些要素收攏:用戶通過ChatGPT和ChatGPT Work使用,開發者通過Codex和API構建,企業把它部署進真實工作發生的系統,任何一層改進,所有產品和客戶都隨之受益。

把四項指標合在一起,這張記分卡其實在回答一件事:每單位成本換來的有用智能,是否在持續上升。有用產出告訴我們AI能產生什麼,每項成功任務的成本告訴我們達成結果要付什麼,可靠性告訴我們人們可以放心使用多少成果,規模化價值則告訴我們隨着時間推移,每一美元和每一單位算力是否實現了更多成效。OpenAI把它自己的職責,歸結爲讓這個等式在每一代模型上都變得更好——更強的模型、更快更可靠的結果,以及爲客戶真實所需的工作壓低的成本。當AI開始用每美元的有用智能說話,而不是用token的流水賬,價值這回事,纔算真正被算清。