Google 在 10 月 6 日發表 EmbeddingGemma 2,把文字、程式碼、圖像、音訊、影片收進同一個向量空間。參數 7.4 億,Apache 2.0 授權,可以直接在手機和筆電上跑,整套離線也沒問題。
第一代 EmbeddingGemma 是純文字嵌入,累積下載超過 2,000 萬次。這一代把多模態一次補齊,而且維持輕量路線:純文字工作只需要 2.7 億參數,加上視覺編碼器 1.7 億、音訊編碼器 3 億才是完整體。Pixel 11 Pro 上量化後實測,純文字權重只吃約 191MB 記憶體,全模態約 567MB。
規格一眼看完
- 架構:Gemma 4,7.4 億參數,Apache 2.0,可商用
- 上下文:8K token,前代的 4 倍,可處理 5.5 分鐘音訊、29 張圖、58 格影格
- 程式碼檢索:MTEB Code 從 68.76 漲到 78.68,多了 9.92 分
- 儲存:MRL 可以把 768 維向量砍到 512、256、128 維,向量資料庫最高省 6 倍
- 搭配:跟 Gemma 4 共用斷詞器和音訊編碼器,檢索加推理可以塞進同一條管線
實際用途很直覺:用一句話從錄音堆裡撈出某段影片,用照片找到語意相近的媒體檔,整套 RAG 都在裝置端做完。Google 也給了幾個現成入口,AI Edge Gallery 的 Instant Media Search 和 Video Moments Finder,以及 Foresight App,都可以直接試。
HN 上大家在吵什麼
這篇在 Hacker News 拿到 225 分、29 則留言,討論比官方文好看,幾個重點整理如下。
simonw 的留言按讚數最高:嵌入模型會存下幾百萬個向量,廠商哪天停掉舊模型,使用者就得自費重算。開權重加 Apache 2.0,至少保證廠商跑路時自己還能接手。他說自己不是想省託管費,而是想買個保險。
技術派盯著 MRL。aabhay 指出這代用 MRL 訓練,只能壓向量維度,模型權重不會跟著縮水,不像 MatFormer 兩邊一起省。也有人問能不能改用二進位量化,目前還沒有答案。
實測數字是 minimaxir 貢獻的,M3 Pro 本地跑:短文字每秒 78 筆,圖像每秒 4 筆,音訊 30 秒切塊每秒 6 筆,影片每分鐘 0.2 筆。以這體量的模型來說不差。
也有翻車回報。Zambyte 照官方範例跑分類,「立刻取消航班並退款」這句被判不是金融請求,信心只有 0.22,同場測試的 Laya 反而判對。正式採用前,自己的情境還是要先測過。
一頁圖解
手機上 iframe 太窄的話,直接開這頁看:https://derek-static.pages.dev/embeddinggemma-2.html
上手連結
- 官方公告:https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/
- HN 討論串:https://news.ycombinator.com/item?id=49980487
- 模型權重:Hugging Face 和 Kaggle 可下載,LiteRT Community 有裝置端最佳化版
- 工具支援:transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama、LMStudio,瀏覽器走 transformers.js 或 WebGPU
- 微調指引:Unsloth 有整理一份做法
我自己的看法:這條路線是對的。中尺寸、開權重、可拆模組,裝置端多模態搜尋總算有堪用的預設選項。接下來就看微調生態跟不跟得上。
