Gemini 3.5 Transcribe 是 Google 在2026-08-26 推出的專用語音轉文字(ASR)模型,主打「智慧聽寫」——它不是輸出逐字稿,而是直接把口語轉成乾淨、格式化、去掉填充詞的文字。它取代了前代轉寫模型 Chirp 3 的定位,在 WER 與延遲上都有大幅進步,目前為 public preview。
兩個 Model ID,兩種用途
| 模型 | API | 用途 | 限制 |
|---|---|---|---|
gemini-3.5-transcribe |
Interactions API(unary) | 錄音檔/會議/通話批次轉寫 | 標準上限 60 分鐘;開 diarization 或 word timestamps 剩 30 分鐘 |
gemini-3.5-transcribe-live |
Live API(雙向串流) | voice agent、即時字幕 | sub-second 延遲;session 上限 10 分鐘;無 diarization |
核心功能
| 功能 | 內容 |
|---|---|
| Smart transcription | 自動處理自我修正、刪填充詞、自動格式化 |
| Custom vocabulary | 專有名詞/拼字 biasing,上限 1000 詞(建議 ≈100) |
| 語言 | 自動偵測 85+ 語言,處理口音方言,串流中可 live 切換 |
| Multi-speaker | 批次模式 speaker attribution(上限 8 人,官方只對 3 人以內背書)+ word-level timestamps |
| 字母數字實體 | 郵遞區號、訂單編號等 alphanumeric 在噪音環境下準確捕捉 |
Benchmark
| 指標 | 數值 | 來源 |
|---|---|---|
| AA-WER(非串流) | 2.6% | Artificial Analysis(AA 排行第 5) |
| AA-WER(串流) | 4.0% | 同上 |
| FLEURS(非串流) | 5.04% | Google 官方(公開 benchmark,跨廠可比) |
| FLEURS(串流) | 5.50% | 同上 |
| Time to final | 比 Chirp 3 快 70% | Artificial Analysis |
頭條數字 2.6% 是 Artificial Analysis 自家資料集混合(AA-AgentTalk 50% / VoxPopuli 25% / Earnings22 25%)。若跟其他家自報數字比較,用公開的 FLEURS(5.04%)更公平。前四名:Fun-Realtime-ASR(1.7%)、ElevenLabs Scribe v2(2.2%)、MAI-Transcribe-1.5 與 Smallest Pulse Pro(2.4%)。
定價(token 計費)
| 端點 | 音訊輸入 | 文字輸出 | 換算 |
|---|---|---|---|
| Batch(Agent Platform) | $2.50 / 1M tokens | $12 / 1M tokens | ~$0.005/分鐘(~$0.30/hr) |
| Live(Agent Platform) | $3.50 / 1M tokens | $21 / 1M tokens | ~$0.009/分鐘(~$0.54/hr) |
它不是價格領導者(AssemblyAI batch ~$0.0025/min 更便宜),但把 diarization/timestamps/custom vocab 包進單一價格,整包算反而划算。
Speaker Diarization 技術路線
不走聲紋聚類(pyannote/AssemblyAI/Deepgram 的 embedding + clustering),走 LLM-native 語言線索歸因——轉寫同時用輪替模式、稱呼、問答配對判斷誰在講話。強項是處理 crosstalk 與短插話(加掛式 diarization 最容易崩的場景)…
產品整合
- Gboard on Android(Rambler):語音輸入直接產出格式化文字,可語音改錯字、換風格
- Gemini app on macOS:聽寫+語音指令+螢幕上下文,背景呼叫其他 Gemini 模型
- Antigravity:搭配螢幕上下文與 chat history,準確聽寫 file names、agent thoughts
- Chrome:coming soon,任何網頁輸入框語音輸入
結論
對 2-3 人會議、訪談、中文音檔轉文字,它是很實用的一站式方案(批次 ~$0.005/分鐘、60 分鐘檔案上限、智慧聽寫去填充詞)。但 5+ 人、大量未知speaker、或長音檔,還是建議走 py-annote / AssemblyAI / Deepgram。繁中 WER 尚未對外揭露,需自行測試。
