近日,微信 AI 官方正式宣佈將通用多模態嵌入模型WeMM-Embedding向全球開源,並推出了包含2B、4B 以及9B 在內的三個不同參數版本。該模型展現出了極強的多模態兼容能力,不僅全面支持文本、圖像、視頻,還能原生處理視覺文檔以及任意交錯的混合多模態輸入。
技術底座與多模態同構的核心優勢
據微信視覺團隊透露,WeMM-Embedding 的核心技術邏輯在於讓系統能夠同時深度理解文字、圖片與視頻,並將其映射並統一在同一個語義空間中進行高效比較與精準檢索。
在國際權威多模態檢索與評估榜單 MMEB-v2上,該模型憑藉出色的綜合表現在同類方案中斬獲第一名,成績成功超越了此前所有已提交的開源及閉源商業模型。
大規模業務實戰落地與開源生態
作爲一款在內部經過高強度打磨的技術成果,WeMM-Embedding 絕非停留在實驗室階段。目前,該模型已經在微信生態的多項核心業務中實現大規模落地應用,其實際覆蓋場景包括朋友圈搜索、視頻號推薦、公衆號推薦以及微信電商等核心板塊,日均調用量已經突破了10億次。
爲了進一步推動技術社區的繁榮與前沿創新,微信團隊此次同步公開了完整的技術生態資源。開發者和研究人員不僅可以通過相關代碼倉庫進行深入研究,還能在模型託管平臺上獲取對應的模型集合。
VIP會員