Google DeepMind 於二零二六年十月六日發布 EmbeddingGemma 2,一款以 Apache 2.0 授權開源的多模態嵌入模型。它建基於 Gemma 4 架構,具備七億四千萬參數,首次把文字、圖像、音訊與影片原生映射到同一個向量空間,讓開發者能在裝置端完成跨模態的搜尋與檢索。距離首代 EmbeddingGemma 推出約一年,該系列在 Hugging Face 等平台的累積下載量已超過二千萬次。
EmbeddingGemma 2 是 Google DeepMind 於二零二六年十月發布的開源多模態嵌入模型,能把文字、圖像、音訊與影片映射到同一個向量空間。
這次升級的重點並非單純提高分數,而是把嵌入能力由文字擴展到四種模態。首代模型主打輕量文字嵌入,新一代則在此基礎上加入視覺與音訊編碼器,並且延續相同的文字分詞器與音訊編碼器,讓它能與 Gemma 4 在同一條管線中協同運作,進一步壓低整體記憶體佔用。
EmbeddingGemma 2 是什麼?
EmbeddingGemma 2 是 Google DeepMind 開發的開源嵌入模型,把文字、圖像、音訊與影片轉換成統一向量,供裝置端搜尋、檢索與分類使用。
嵌入模型的角色,是把各種內容轉成可供比較的數值向量,讓程式能依語意相似度找出相關項目。EmbeddingGemma 2 的突破在於單一模型即可處理四種模態,開發者不必為文字、圖像與音訊分別維護不同的嵌入管線。它與 Gemini Embedding 系列源自相同技術,並以 Gemma 系列一貫的開源模式釋出,目標受眾是需要在本機執行檢索與分類的開發者。
EmbeddingGemma 2 有哪些技術亮點?
其亮點包括模組化編碼器、Matryoshka 向量截斷與八千詞元上下文。文字工作負載最低只需二億七千萬參數,向量可由 768 維縮減至 128 維,最多節省六倍儲存空間。
在架構層面,EmbeddingGemma 2 採取模組化設計。純文字工作負載最少只需二億七千萬參數,若需完整多模態能力,可再疊加一億七千萬參數的視覺編碼器與三億參數的音訊編碼器。模型同時採用 Matryoshka 表示學習,開發者可把輸出向量由 768 維動態截斷至 512、256 或 128 維,為本機向量資料庫換取最多六倍的儲存與記憶體縮減。上下文視窗亦由首代的二千詞元擴大至八千詞元,足以一次處理約五點五分鐘音訊、二十九張圖像或五十八格影片畫面。
EmbeddingGemma 2 的效能表現如何?
Google 稱 EmbeddingGemma 2 在同級少於十億參數的模型中表現領先,程式碼任務於 MTEB Code 由 68.76 升至 78.68,提升近 10 分。
官方公布的評測結果,主要集中在同級模型的比較。在程式碼嵌入的 MTEB Code 基準上,EmbeddingGemma 2 的分數由首代的 68.76 提升至 78.68,九點九二分的進步對本機程式碼索引與語意搜尋尤其關鍵。在音訊的 MAEB 基準上,它同樣取得同級領先,並在文字、視覺與音訊任務中追平甚至超越部分體積大一倍的專門模型。官方強調,其定位是「每個參數的品質」而非絕對分數最高。
EmbeddingGemma 2 如何在裝置端運行?
經量化後,EmbeddingGemma 2 在 Pixel 11 Pro 上運行純文字權重只需約 191MB 記憶體,完整多模態模型約 567MB,適合邊緣硬體。
裝置端效能是這次發布的核心訴求。官方數據顯示,在 Google Pixel 11 Pro 上,量化後的純文字權重僅需約 191MB 記憶體,完整多模態模型的佔用則約為 567MB。由於嵌入計算全部在本機完成,資料無需離開使用者裝置,既降低管線延遲,也讓檢索能在離線狀態下運作。當它與 Gemma 4 搭配時,兩者共用分詞器與音訊編碼器,可在統一管線中執行裝置端的檢索增強生成流程。
開發者如何取得與使用 EmbeddingGemma 2?
模型權重可於 Hugging Face 與 Kaggle 下載,並支援 MediaPipe、LiteRT、vLLM、llama.cpp 與 Ollama 等工具部署。
取得管道相當完整。模型權重已上架 Hugging Face 與 Kaggle,官方亦預告將進駐 Gemini Enterprise 代理平台的模型園區。部署方面,Google 提供 MediaPipe 與 LiteRT 兩條路徑,前者對應開箱即用的嵌入、檢索與決策任務,後者供自訂模型整合,網頁端則可透過 transformers.js 或 WebGPU 執行。服務端可選 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 與 LM Studio,向量儲存建議搭配 Qdrant,微調則可參考 Unsloth 的指引。
EmbeddingGemma 2 對邊緣 AI 有什麼影響?
它把跨模態檢索帶到離線裝置,同時降低延遲與雲端成本,並讓私隱敏感資料無需離開本機,為邊緣 AI 的檢索與分類應用提供更實用的基礎。
從產業角度觀察,嵌入模型長期被視為雲端服務的附屬品,開發者往往要把資料上傳才能換取語意能力。EmbeddingGemma 2 把這項能力下放到手機與個人電腦,對醫療、法律或企業內部文件等私隱敏感的場景尤其有意義。它與 Gemma 4 的組合,亦讓裝置端檢索增強生成不再只是概念演示,而具備可實際部署的記憶體與延遲條件。
出處連結有哪些?
本文資訊來源為 Google 於二零二六年十月六日發布的官方公告,內容涵蓋 EmbeddingGemma 2 的架構、效能數據、裝置端表現與取得方式。
- 來源:Google
- 原文連結:https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
常見問題有哪些?
EmbeddingGemma 2 與首代最大差別,在於原生支援圖像、音訊與影片,並把上下文由二千詞元擴大至八千詞元,參數量亦提升至七億四千萬。EmbeddingGemma 2 與首代有什麼差別?
首代專注文字嵌入,第二代則把圖像、音訊與影片納入同一個向量空間,上下文視窗由二千詞元增至八千詞元,並透過模組化編碼器控制實際參數量。
它真的能在手機上運行嗎?
官方在 Pixel 11 Pro 上的量測顯示,量化後的純文字權重約需 191MB 記憶體,完整多模態模型約 567MB,屬於手機可承擔的範圍。
EmbeddingGemma 2 採用什麼授權?
它採用 Apache 2.0 授權,屬於商業友善的開源條款,企業可在自家產品中整合與修改,無需支付授權費用。
它與 Gemini Embedding 有什麼關係?
兩者源自相同的嵌入技術,Gemini Embedding 以雲端服務形式提供,EmbeddingGemma 2 則以開源權重釋出,讓開發者在本機自行部署。
總結:EmbeddingGemma 2 適合什麼開發者?
EmbeddingGemma 2 適合需要在本機完成跨模態檢索、且重視私隱與延遲的開發者,例如邊緣應用、離線工具與裝置端檢索增強生成專案。
整體而言,EmbeddingGemma 2 把多模態嵌入從雲端帶到裝置端,並以開源授權降低採用門檻。對於需要處理敏感資料、追求低延遲,或必須在離線環境運作的專案,它提供了一個兼顧品質與資源佔用的選項。其模組化設計與向量截斷機制,也讓開發者能依實際硬體條件調整,而非只能在能力與成本之間二選一。