Anthropic於9月23日凌晨發佈Claude5.5系列首款模型Opus5.5,官方稱多數任務表現與Fable5.1相當,默認設置下典型任務成本較上代Opus5降低40%,輸出速度提升超30%,已上線Claude及亞馬遜雲科技、谷歌雲、微軟Azure。
官方公佈的9項測試中,Opus5.5有7項領先Fable5.1、Opus5及OpenAI的GPT-6Astra、GPT-5.6Sol。三項編程測試均取得最高分:Terminal-Bench4.0達66.4%,FrontierCode v1.1爲54.4%,CursorBench4.0爲57.8%,但業務流程與科研Agent測試落後於GPT-6Astra。Artificial Analysis Intelligence榜單上,其以58分位列第一,領先Fable5.1與GPT-6Astra的53分。

長任務表現是升級重點:內部測試中,Opus5.5用9.5小時完成負載均衡軟件HAProxy從C語言到Rust的改寫,成本較Fable5.1低51%;在需逐一覈對數字與引語的財報研究測試中,其18份報告有16份達標,Fable5.1與Opus5均未通過;有早期測試者不到一天完成涉及68萬行代碼的遷移。
價格方面,每百萬輸入、輸出Token收費4美元和20美元,較Opus5降20%,緩存讀取降60%;Pro、Max等套餐五小時使用額度同步提高,訂閱用戶另獲一次限額重置機會。
安全上,Opus5.5嘗試繞過隔離邊界的頻率較Opus5降低約85%且自行報告相關行爲,提示詞注入防禦與Fable5.1並列受測模型最低成功率;但大多數網絡安全任務仍會轉交Opus4.8,官方承認部署前評估無法發現所有失效情況。
發佈近2小時後,OpenAI即推出GPT-6Sol與Luna;Sonnet5.5與Haiku5.5計劃未來幾週上線。以效率與成本壓縮換取Agent規模化落地,正在成爲頭部模型競爭的主線。
VIP會員