四十八個德瑞克

Gemini 3.5 Transcribe:Google 新一代智慧語音轉文字模型

Gemini 3.5 Transcribe 是 Google 在2026-08-26 推出的專用語音轉文字(ASR)模型,主打「智慧聽寫」——它不是輸出逐字稿,而是直接把口語轉成乾淨、格式化、去掉填充詞的文字。它取代了前代轉寫模型 Chirp 3 的定位,在 WER 與延遲上都有大幅進步,目前為 public preview

兩個 Model ID,兩種用途

模型 API 用途 限制
gemini-3.5-transcribe Interactions API(unary) 錄音檔/會議/通話批次轉寫 標準上限 60 分鐘;開 diarization 或 word timestamps 剩 30 分鐘
gemini-3.5-transcribe-live Live API(雙向串流) voice agent、即時字幕 sub-second 延遲;session 上限 10 分鐘; diarization

核心功能

功能 內容
Smart transcription 自動處理自我修正、刪填充詞、自動格式化
Custom vocabulary 專有名詞/拼字 biasing,上限 1000 詞(建議 ≈100)
語言 自動偵測 85+ 語言,處理口音方言,串流中可 live 切換
Multi-speaker 批次模式 speaker attribution(上限 8 人,官方只對 3 人以內背書)+ word-level timestamps
字母數字實體 郵遞區號、訂單編號等 alphanumeric 在噪音環境下準確捕捉

Benchmark

指標 數值 來源
AA-WER(非串流) 2.6% Artificial Analysis(AA 排行第 5)
AA-WER(串流) 4.0% 同上
FLEURS(非串流) 5.04% Google 官方(公開 benchmark,跨廠可比)
FLEURS(串流) 5.50% 同上
Time to final 比 Chirp 3 快 70% Artificial Analysis

頭條數字 2.6% 是 Artificial Analysis 自家資料集混合(AA-AgentTalk 50% / VoxPopuli 25% / Earnings22 25%)。若跟其他家自報數字比較,用公開的 FLEURS(5.04%)更公平。前四名:Fun-Realtime-ASR(1.7%)、ElevenLabs Scribe v2(2.2%)、MAI-Transcribe-1.5 與 Smallest Pulse Pro(2.4%)。

定價(token 計費)

端點 音訊輸入 文字輸出 換算
Batch(Agent Platform) $2.50 / 1M tokens $12 / 1M tokens ~$0.005/分鐘(~$0.30/hr)
Live(Agent Platform) $3.50 / 1M tokens $21 / 1M tokens ~$0.009/分鐘(~$0.54/hr)

它不是價格領導者(AssemblyAI batch ~$0.0025/min 更便宜),但把 diarization/timestamps/custom vocab 包進單一價格,整包算反而划算。

Speaker Diarization 技術路線

不走聲紋聚類(pyannote/AssemblyAI/Deepgram 的 embedding + clustering),走 LLM-native 語言線索歸因——轉寫同時用輪替模式、稱呼、問答配對判斷誰在講話。強項是處理 crosstalk 與短插話(加掛式 diarization 最容易崩的場景)…

產品整合

結論

對 2-3 人會議、訪談、中文音檔轉文字,它是很實用的一站式方案(批次 ~$0.005/分鐘、60 分鐘檔案上限、智慧聽寫去填充詞)。但 5+ 人、大量未知speaker、或長音檔,還是建議走 py-annote / AssemblyAI / Deepgram。繁中 WER 尚未對外揭露,需自行測試。

Exit mobile version