四十八個德瑞克

Google EmbeddingGemma 2登場,支援全模態embedding的小鋼炮

EmbeddingGemma 2 裝置端多模態嵌入示意圖

Google 在 10 月 6 日發表 EmbeddingGemma 2,把文字、程式碼、圖像、音訊、影片收進同一個向量空間。參數 7.4 億,Apache 2.0 授權,可以直接在手機和筆電上跑,整套離線也沒問題。

第一代 EmbeddingGemma 是純文字嵌入,累積下載超過 2,000 萬次。這一代把多模態一次補齊,而且維持輕量路線:純文字工作只需要 2.7 億參數,加上視覺編碼器 1.7 億、音訊編碼器 3 億才是完整體。Pixel 11 Pro 上量化後實測,純文字權重只吃約 191MB 記憶體,全模態約 567MB。

規格一眼看完

實際用途很直覺:用一句話從錄音堆裡撈出某段影片,用照片找到語意相近的媒體檔,整套 RAG 都在裝置端做完。Google 也給了幾個現成入口,AI Edge Gallery 的 Instant Media Search 和 Video Moments Finder,以及 Foresight App,都可以直接試。

HN 上大家在吵什麼

這篇在 Hacker News 拿到 225 分、29 則留言,討論比官方文好看,幾個重點整理如下。

simonw 的留言按讚數最高:嵌入模型會存下幾百萬個向量,廠商哪天停掉舊模型,使用者就得自費重算。開權重加 Apache 2.0,至少保證廠商跑路時自己還能接手。他說自己不是想省託管費,而是想買個保險。

技術派盯著 MRL。aabhay 指出這代用 MRL 訓練,只能壓向量維度,模型權重不會跟著縮水,不像 MatFormer 兩邊一起省。也有人問能不能改用二進位量化,目前還沒有答案。

實測數字是 minimaxir 貢獻的,M3 Pro 本地跑:短文字每秒 78 筆,圖像每秒 4 筆,音訊 30 秒切塊每秒 6 筆,影片每分鐘 0.2 筆。以這體量的模型來說不差。

也有翻車回報。Zambyte 照官方範例跑分類,「立刻取消航班並退款」這句被判不是金融請求,信心只有 0.22,同場測試的 Laya 反而判對。正式採用前,自己的情境還是要先測過。

一頁圖解

手機上 iframe 太窄的話,直接開這頁看:https://derek-static.pages.dev/embeddinggemma-2.html

上手連結

我自己的看法:這條路線是對的。中尺寸、開權重、可拆模組,裝置端多模態搜尋總算有堪用的預設選項。接下來就看微調生態跟不跟得上。

Exit mobile version