四十八個德瑞克

Gemini 3.5 Transcribe:Google 智慧語音轉文字模型評析

Gemini 在 2026 年 8 月底推出了一支專用語音轉文字模型,叫 Gemini 3.5 Transcribe。它不是那種「把語音變成逐字稿」的普通工具,而是帶了點想法:它會自動把口語裡的雜訊清掉,直接丟給你一份乾淨、格式正確的文字,也就是官方所說的「智慧聽寫」。

我把發布文、API 文件、第三方測評跟定價都翻了一遍。結論先講:大部分宣傳是真的,定價也算合理,但 diarization(判斷誰在講話)有它的使用範圍,後面單獨說明。

兩個 API,兩種用法

模型 ID API 用途
gemini-3.5-transcribe Interactions API 錄音檔、會議、通話記錄的批次轉寫
gemini-3.5-transcribe-live Live API(雙向串流) 語音 agent、即時字幕,sub-second 延遲

兩個目前都是公開預覽(public preview),走 Gemini API(AI Studio)或 Gemini Enterprise Agent Platform。要批次處理錄好的音檔就用第一個,要即時互動就用第二個,界線很清楚。

核心功能

辨識準確度

Google 引用 Artificial Analysis 的數據:非串流 WER 平均 2.6%、串流 4.0%。在 AA 排行榜排第五,前面是 Fun-Realtime-ASR(1.7%)、ElevenLabs Scribe v2(2.2%)那幾家。

不過想跟別家比,建議改用公開的 FLEURS 測值:非串流 5.04%、串流 5.50%。AA 那顆 2.6% 是用自家混合資料集算的,跨廠商比較不如 FLEURS 公允。另外從「最後結果出現」的時間 latency 相比前代 Chirp 3 快 70%,這一顆是實打實的進步。

定價

端點 換算(第三方估)
批次 $0.005/分鐘(約 $0.30/小時)
串流 $0.009/分鐘(約 $0.54/小時)

官方採 token 計費,音訊約 25 tokens/秒。批次端比 AssemblyAI batch 那 0.0025/分鐘貴,也比 Deepgram Nova-3(0.0043)略高,不是最便宜的。但 Gemini 把 diarization、時間戳、custom vocab 全包進同一支價格,AssemblyAI 那些是加購項。整包算起來反而划算。串流端 0.009 則比 ElevenLabs、AssemblyAI 串流略貴。

Speaker Diarization:為什麼只保證 3 個

這是爭議最大的一塊。發布文寫「最多三位說話者,3+ 是實驗性」,但 API 文件其實上限是 8 位。發布文只是把「有把握的範圍」設定成 3。兩個數字都要記對。

更重要的是,它的技術路線跟業界不同。傳統做法(pyannote、AssemblyAI、Deepgram)是聲紋聚類:把聲音轉向量、數學聚類、再對齊詞邊界。Gemini 走的是 LLM 原生路線:轉寫當下就用語言脈絡判斷,靠輪替節奏、有人喊「thanks Priya」、問答配對,來分辨誰發言。這對對話場景其實是優勢,尤其 crosstalk 和插話(「right」、「mhm」)這種傳統算法最易崩的地方;代價是「多於三或四個人的會議」辨識就下降到需要謹慎。

而且有幾個硬性限制:開 diarization 或詞級時間戳後,單檔上限從 1 小時降到 30 分鐘;diarization 只能在 verbatim 模式用,所以「去填充詞的 smart 模式」和 diarization 只能二選一;串流版完全沒有 diarization。要用之前先看懂這些,免得試到一半才踩雷。

產品端整合

它不只是 API。Google 已把它塞進多個入口:Gboard 的 Rambler(語音直接變格式化文字,或語音下指令改錯)、Gemini macOS app(聽寫+語音指令+螢幕上下文,背後再調其他 Gemini 模型幫你摘要檔案、在游標處生圖)、Antigravity(搭配螢幕上下文來聽寫檔名跟 agent 想法)。Chrome 也說之後會在任意網頁輸入框支援「用講的打字」。消費端的框架看得出它的布局。

一句話總結

Gemini 3.5 Transcribe 是一支「誠實版」的智慧聽寫模型——準度排前段、定價算合理、把 diarization / 時間戳 / 自定義詞彙打包成一站式;但 diarization 有限制,先知道它哪裡不好,再去用它擅長的部分。

原始發布文:Introducing Gemini 3.5 Transcribe

Exit mobile version