谷歌把"在本地把東西找出來"這件事,做成了一個能裝進手機的小模型。它最新推出的EmbeddingGemma2,是自家首個原生多模態的開源嵌入模型,參數規模740M,卻能把文字、代碼、圖片、視頻、音頻一股腦兒映射進同一個語義空間,讓跨模態檢索第一次在端側跑得這麼輕。
最直觀的賣點是小和能離線。完整的多模態模型內存佔用不到600MB,意味着它能在手機、筆記本、瀏覽器裏直接運行,全程不必把任何內容上傳到雲端——你的相冊、錄音、視頻,都留在自己設備上被檢索,隱私這道關天然就守住了。上下文窗口給到8K,是上一代的四倍,能吞下更長的材料再做匹配;語言覆蓋也拉到100多種,跨語種找東西不再是障礙。
性能上,谷歌宣稱它在圖像、視頻和代碼這幾類檢索任務上,明顯領先同量級的開源對手。更貼心的是模塊化設計:用不上的部分可以按需加載,索引體積也能壓一壓,省下的既是空間也是算力。落到真實場景,它能幹的事很具體——在本地相冊裏按語義翻出某張照片或某段媒體,在長視頻裏直接定位到某個片段,離線檢索散落各處的文件,或者在本地代碼庫裏按意圖搜函數與片段,而不必先把倉庫推到某個遠程服務去查。
當一個多模態嵌入模型小到能揣進手機、又開源到誰都能改,AI檢索的重心正在從"把數據交給雲端"悄悄挪回"讓能力待在設備裏"。谷歌這步,給端側隱私化搜索撕開了一道口子。
VIP會員