Fireworks AI 近日發佈 FireRouter with Opus,這是市場上首個緩存感知路由器,針對 Claude Opus 系列進行了優化,並首次以獨立路由模型形式作爲 serverless 端點開放。經過一個多月的內部 A/B 測試,該方案執行編碼任務的準確率達到單獨使用 Opus 的98.1%,而成本降低了57%。

FireRouter 的核心邏輯是在每次用戶輪次中,評估模型集合中每個模型對當前任務的適合程度,估算每個模型的處理成本(包括提示緩存成本),並權衡切換模型帶來的節省與丟失緩存是否值得,最終路由到質量與成本之間取得最佳平衡的模型。目前路由池包含 Claude Opus5.5、GLM5.3和 GLM5.3Flash,隨着新模型發佈將持續調整。

image.png

測試數據來自內部編碼流量,會話被隨機分配到 FireRouter with Opus 組或僅使用 Opus 的對照組,工作負載和用戶均相同。結果顯示,每次會話成本從15.36美元降至6.63美元,降幅57%(±19個百分點,95% 置信區間)。準確率方面,FireRouter with Opus 在評分輪次中得分78.7%,而僅使用 Opus 爲80.2%,差距僅1.5個百分點(±1.3),即達到 Opus 整體準確率的98.1%。

緩存命中率方面,FireRouter with Opus 爲94.2%,單獨使用 Opus 爲97.8%,差距3.6個百分點。Fireworks AI 解釋稱,這是一個微小而有意的取捨——由於內部編碼工作中開源模型可以處理許多常規輪次,緩存感知路由通過將簡單任務分流至更便宜的模型,大幅降低了整體成本。

image.png

FireRouter with Opus 現已集成至 Claude Code、Codex、Cursor IDE 等多個工具鏈。用戶可通過 `fireconnect login` 和 `fireconnect claude --model firerouter/opus` 兩行命令啓用。Fireworks AI 表示,其 Fireworks Nexus 解決方案旨在讓工程團隊將領先的開源模型接入現有工具鏈,在不犧牲速度或質量的前提下將支出減半。