嵌入向量模型決定了你的檢索系統到底能撈回什麼——它把每段輸入壓成一個向量,讓相關的東西彼此靠近,應用於是能按語義而非字面去檢索。正因如此,選哪個模型永遠是RAG、多語言檔案庫、代碼倉庫和圖文集合各自不同的考題。OpenRouter在9月11日覈實了自家嵌入模型目錄,共37個條目,並通過embeddings API向19個模型發了批量請求、跑了28項檢查,用一份實測指南把選型邏輯攤開。

最實用的結論是分場景給候選人。英文RAG默認從openai/text-embedding-3-small起步,它價格低、上下文8192token、維度還可調;當輸入超過8192token,或想在Voyage4各檔間切換而不重建索引時,就測voyage-4-large,它給到32000token上下文和四檔可選維度,且與其他Voyage4層級向量兼容;想要開放權重替代,qwen3-embedding-8b有更長上下文窗和更低提示詞價。多語言檢索交給qwen3-embedding-8b(公開權重、支持100多種語言),代碼搜索用voyage-code-4,文本加圖像檢索則選google/gemini-embedding-2或voyage-multimodal-3.5。付費文本里最便宜的是perplexity/pplx-embed-v1-0.6b,每百萬輸入token僅0.004美元;免費文本路由nvidia/nemotron-3-embed-1b:free則帶32768token上下文。

image.png

把入圍選手擺在一張表裏,差異一目瞭然。text-embedding-3-small是文本、8192上下文、1536維、每百萬token0.02美元、閉源;3-large同爲8192上下文但3072維、0.13美元。Voyage4家族整齊劃一:lite、標準版、large、code-4、multimodal-3.5都是32000上下文、1024維,價格從0.02到0.12美元不等,全部閉源。Qwen3Embedding8B是文本、32768上下文、4096維、每百萬token僅0.01美元且開放權重;4B版2560維、0.02美元。Perplexity的0.6B與4B分別是1024維0.004美元、2560維0.03美元,均開放。Gemini Embedding2覆蓋文本與圖像、8192上下文、3072維,文本每百萬token0.20美元、圖像token0.45美元,閉源;NVIDIA那條免費路由則是32768上下文、2048維、覆蓋34種語言。目錄裏還有bge-m3、mistral-embed、codestral-embed等備選,不過指南重點測的是前面這批。

實測方法值得一說。OpenRouter向19個模型發了雙字符串批量請求,覆蓋批量輸入、可配置維度、圖像輸入、文本加圖像和錯誤處理共28項檢查,16個付費模型每個輸入都穩穩返回一個向量。dimensions參數在OpenAI3Small、Gemini2和Voyage4Large上均生效,比如把值設成256或512就真返回對應長度的向量;向不存在的模型發請求會收到400錯誤並提示模型不存在。不過要劃清邊界:這些檢查確認的是請求與響應行爲,不是檢索質量,響應時間也被排除,因爲每個模型的服務條件不同。三條免費路由在測試賬戶裏返回了404,原因是該賬戶隱私設置關掉了允許用免費模型提示詞訓練的提供商——這恰恰提醒開發者,免費開關、工作區護欄或provider.data_collection設爲deny,都會讓這類請求直接404。

落到具體場景,英文RAG默認1536維的Small是Large的一半,首次評估保留默認,只有存儲或搜索成本成爲瓶頸才考慮縮減;用dimensions=256能進一步壓小向量,但可能傷檢索質量,改現有索引前務必先試。Voyage4系列支持256、512、1024、2048四檔維度,且官方聲明4系列向量彼此兼容,換檔位不必重建索引。多語言這邊Qwen3Embedding8B默認返回4096維、MTEB多語言得分廠商報出70.58,4B版只要2560維、更省資源;bge-m3作爲第二開放多語言選項,8192上下文、1024維。代碼搜索首選voyage-code-4,codestral-embed-2505可作對比,CoIR基準能幫着橫向比。圖文檢索裏Gemini Embedding2把兩種輸入放進同一向量空間,一張64乘64的PNG算258個token、費用0.000128美元;voyage-multimodal-3.5同樣驗證過,64乘64PNG僅89個token、費用0.00003美元,但兩者向量空間不同,建索引前得先定一個。

評測上OpenRouter的建議很剋制:同一套語料庫、查詢、相關性標籤、分塊和指標,只換模型,其餘全部固定,結果纔可比。英文RAG從512到1024token的塊加重疊起步,用nDCG衡量多塊相關時的排序;多語言要逐語言上報別讓平均數掩蓋短板;代碼搜索把issue描述映射到解決它的文件和分塊。存儲成本也要算進賬:100萬個4096維float32向量約佔16.4GB,100萬個1024維約4.1GB,公式是向量數乘維度乘每值字節數,選滿足目標的最小維度最划算。

最後是一道鐵律:不同模型族的向量不共享座標空間,用3-small建的索引就必須用它生成查詢向量,混用只會得到不可靠結果;Gemini2和001也不同空間,切換要重建。唯一有文檔記錄的例外是Voyage4族內兼容,換檔位前先在樣本上驗證檢索質量。部署時記得把模型slug、輸出維度、提示詞格式和創建日期隨索引元數據一起存好,方便後續覈對配置。至於那些常見疑問——換模型通常要重嵌整個語料、最快模型沒跑延遲基準、ada-002已不再作爲新索引默認、免費路由404先查隱私設置——指南都給了直白答覆。對正要搭檢索系統的開發者來說,這份把19個模型按用例、價格、維度排好隊的清單,省下的試錯成本相當可觀。