Anthropicは9月23日午前、Claude5.5シリーズの初モデルであるOpus5.5を発表しました。公式によると、多くのタスクでFable5.1と同等のパフォーマンスを示し、デフォルト設定下での一般的なタスクのコストは前世代のOpus5より40%低く、出力速度は30%以上向上しています。現在、ClaudeおよびAmazon Web Services、Google Cloud、Microsoft Azureで利用可能です。
公式が公表した9つのテストにおいて、Opus5.5はFable5.1、Opus、OpenAIのGPT-6Astra、GPT-5.6Solの7つに優れています。3つのプログラミングテストでは最高点を獲得しました:Terminal-Bench4.0は66.4%、FrontierCode v1.1は54.4%、CursorBench4.0は57.8%です。ただし、業務プロセスや研究エージェントのテストではGPT-6Astraに劣っています。Artificial Analysis Intelligenceランキングでは、58点で第1位となり、Fable5.1とGPT-6Astraの53点を上回っています。

長時間のタスクにおける性能はアップグレードの重点でした。内部テストでは、Opus5.5は9.5時間かけて負荷分散ソフトウェアHAProxyをC言語からRustに書き換えたことで、Fable5.1よりもコストが51%低くなりました。数字や引用の1つずつ確認が必要な財務報告の研究テストでは、18件の報告書のうち16件が合格し、Fable5.1とOpusはいずれも不合格でした。早期のテスト者の中には、68万行のコードを含む移行を1日以内に完了した人もいました。
価格面では、100万トークンの入力と出力に対して4ドルと20ドルであり、Opus5より20%安くなり、キャッシュ読み込みは60%安くなりました。Pro、Maxなどのサブスクリプションプランでは、5時間の使用枠が同時に増加し、サブスクリプションユーザーは一度限りの枠のリセット機会も提供されます。
セキュリティに関しては、Opus5.5は隔離境界を回避する試みがOpus5より約85%減少し、関連行為を自主的に報告しています。プロンプトインジェクション防御の成功率はFable5.1と同等のモデルの中で最低となっています。しかし、大多数のサイバーセキュリティタスクは依然としてOpus4.8に転送され、公式は導入前の評価ではすべての失敗状況を見つけることはできないと認めています。
VIP会員