Neon 和 Castform 兩家公司聯手幹了一件讓人重新打量"小模型"的事——用強化學習後訓練了一個4B 參數的開源模型,在文檔搜索任務上準確率不僅不低於 GPT-5.6Sol,甚至更高,而單次推理成本只有後者的約百分之一。

背後是對搜索範式的重新理解。目前文檔檢索主流做嵌入式搜索,把文檔轉成數值化向量再找相似內容,但隨着 AI 智能體的普及,搜索流程正轉向智能體式搜索:模型把大問題拆成多個小問題,自主決定搜索查詢、檢視結果、再發起下一輪搜索,循環往復直到集齊所需信息。這套思路能處理更復雜的問題,代價是每次搜索都要調一次高性能模型,耗時和成本都不低——按 Neon 給出的典型請求口徑,GPT-5.6Sol 一次搜索請求耗時超10秒,成本約0.03美元。

image.png

Neon 和 Castform 各司其職:Neon 提供文檔存儲位置和搜索能力,Castform 負責訓練模型判斷"該搜什麼"。訓練用的是強化學習,模型先嚐試完成任務,系統給結果打分,評分直接反饋進下一輪試驗。評估維度不只看最終答案對錯,還會看是否找到了正確文檔、是否引用了合適段落。最終,Castform 後訓練的模型在 Neon 的驗證中拿到平均評估分1.447,超過 GPT-5.6Sol 的1.369,也高於作爲對照的 GPT-5.4的1.377,刷新了該驗證的最高紀錄。

成本差纔是真正的殺手鐗:這個4B 小模型單次推理成本0.000929美元,而 GPT-5.6Sol 是0.087338美元,差了約94倍。用4B 參數吃掉 GPT-5.6Sol 級搜索精度,同時把推理開銷壓到幾乎可以忽略不計,這對高度依賴反覆調模型做多輪檢索的智能體應用來說,意味的是單位成本結構被徹底改寫。