Anthropic 發佈 Claude Opus 5.5,這是 Claude 5.5 系列的首款模型。Anthropic 稱,新模型在多數任務上的表現與 Claude Fable 5.1 相當,但默認設置下的典型任務成本較上一代 Opus 5 降低 40%,輸出速度提升超過 30%。發佈約兩小時後,OpenAI 也推出了 GPT-6 Sol 和 GPT-6 Luna,GPT-6“宇宙”再添新成員。

image.png

成本降四成、速度提三成,編程測試領跑

在官方公佈的 9 項測試中,Opus 5.5 有 7 項成績領先 Fable 5.1、Opus 5、GPT-6 Astra 和 GPT-5.6 Sol。其中三項編程測試(Terminal-Bench 4.0、FrontierCode v1.1、CursorBench 4.0)均拿下最高分,分別爲 66.4%、54.4% 和 57.8%;但在業務流程和科研 Agent 測試上仍落後於 GPT-6 Astra。第三方機構 Artificial Analysis 的 Intelligence 榜單上,Opus 5.5 以 58 分位列第一,領先 Fable 5.1 與 GPT-6 Astra 的 53 分。

image.png

價格方面,Opus 5.5 每百萬輸入、輸出 Token 分別收費 4 美元(約 26.8 元)和 20 美元(約 134 元),較 Opus 5 下調 20%,緩存讀取價格下降 60%。Claude Code 與 Claude Platform 還提供快速模式,速度最高達普通模式 2.5 倍,相應收費爲輸入 8 美元、輸出 40 美元每百萬 Token。Anthropic 同時提高了多個付費套餐的五小時使用額度,並向訂閱用戶提供一次可自選時間的額度重置機會。

9.5 小時改寫 HAProxy,長任務成賣點

Opus 5.5 的升級重點明顯偏向長時間任務。Anthropic 稱,一名早期測試者用不到一天完成了涉及 68 萬行代碼的遷移;對 20 萬行代碼庫的審查與修復,Opus 5.5 用時不到 3 小時,而 Opus 5 需超 20 小時、消耗 Token 爲前者 2.5 倍。

內部測試中,雙方被要求將負載均衡軟件 HAProxy 從 C 語言改寫爲 Rust,改寫版本均通過幾乎全部迴歸測試——Opus 5.5 用時 9.5 小時、成本比 Fable 5.1 低 51%。財報研究測試更考驗“零編造”:模型只能在難找的網頁副本中檢索並撰寫季度業績報告,自動評分逐一覈對數字與引語。結果 Opus 5.5 生成的 18 份報告中 16 份達標,Fable 5.1 與 Opus 5 均未通過。知識工作方面,其在 GDPval-AA v2.1 取得 1846 分,高於 Fable 5.1 的 1735 分。

image.png

寫作與溝通上,Opus 5.5 被調整爲優先呈現關鍵信息、回答更簡潔;安全評估中,其嘗試突破隔離邊界的頻率較 Opus 5 或 Claude Mythos 5.1 降低約 85%,在 Gray Swan 提示詞注入測試中攻擊成功率與 Fable 5.1 並列最低。不過部分專業任務仍受限制——大多數網絡安全任務會被轉交 Opus 4.8 處理。

Opus 5.5 已上線 Claude 及亞馬遜雲科技、谷歌雲、微軟 Azure 等平臺,開發者可通過標識 claude-opus-5-5 調用,並繼續提供零數據保留選項。Claude Sonnet 5.5 與 Haiku 5.5 計劃在未來幾周推出。