四十八個德瑞克

Gemini 3.8 Live:即時語音 AI,讓對話更自然、更智慧

即時語音 AI 示意圖:發光球體與聲波光帶

本文為 Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking 之繁體中文翻譯整理,原文版權歸原作者所有。

2026 年 9 月 15 日

10 分鐘閱讀

Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 是我們目前最先進的即時對話模型。智慧與平行推理能力的大幅升級,讓使用者能更直覺地與模型協作,並透過語音執行複雜任務。

Malini Jaganathan

Gemini Audio 團隊技術人員,代表團隊撰文

今日,我們推出兩款新模型,藉由近乎即時的推理能力,讓語音代理更有效,也讓人與 AI 的對話更直覺、更聰明。

對開發者與企業而言,這些模型提供了建構可靠、生產就緒語音代理所需的基礎元件。它們也讓使用者在 Gemini 應用程式、Google Workspace 與 Google 搜尋中與 Gemini 對話時更加流暢、協作性更高,只需透過語音即可處理複雜任務。

更流暢、更智慧的對話體驗

Gemini 3.8 Live Extended Thinking 提供企業級的任務完成與智慧能力,在 Artificial Analysis 的 Speech to Speech Quality Index 中以 82.6 分位居整體第一;在代理式任務完成方面,於 τ-Voice 取得 68.6%,在 Sierra 的 τ-Voice-banking 基準測試則取得 35.1%。其推理能力同樣出色,在 Big Bench Audio 獲得 97.7%,同時相較其他前沿模型仍維持極具競爭力的價格。

Gemini 3.8 Live 獲得使用者高度偏好,在 Speech Agent Arena 中排名第二。除了具備良好效能,它也維持高度成本效益,為開發者與企業提供一款能夠大規模部署、功能完整且高效率的模型。

在 ServiceNow 的 EVA-Bench 語音代理評測中,這兩款模型在複雜工作流程上推進了 Pareto Frontier,成功兼顧準確度與對話品質。

註:此測試透過 Gemini Enterprise Agent Platform 上的 Live API 執行。

Gemini 3.8 Live 能近乎即時處理視覺輸入,讓對話獲得更多情境資訊並提供更實用的回應。它支援 97 種語言,能在對話途中自動偵測並切換語言。模型還可在背景執行工具與 API 呼叫,同時繼續對話;因此,它能先確認使用者的要求,並在背景任務執行期間維持互動。

對於需要更深入推理的任務,Gemini 3.8 Live Extended Thinking 可以一邊推理、一邊說話。它在不中斷對話流程的情況下,為複雜工作流程提供更高智慧:模型會以「讓我確認一下……」等自然的早期口頭提示回應,並即時說明多步驟背景任務的執行進度。

在 Google Workspace 與搜尋服務中,Live 模型能帶來更直覺、更具協作性的體驗,尤其適合處理最複雜的任務。

強化開發者與企業的語音生態系

透過 Gemini Live APIAgoraFishjamLangChainLiveKitPipecatVercelVision Agents 等開發平台,讓開發者可以更輕鬆地建構及部署高效能的語音介面。這些平台在幕後管理複雜的即時媒體串流基礎設施,讓開發者能專注於使用者體驗。

我們也與 Salesforce、Genspark 和 Lumeris 等公司合作。這些合作夥伴看好 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,並特別肯定其延遲表現、對話流暢度及工具呼叫能力。

透過 SynthID 浮水印確保透明度

我們 AI 產品生成的所有音訊都會加入 SynthID 浮水印。這種無法被人耳察覺的浮水印會直接嵌入音訊輸出,使 AI 生成內容仍可被偵測,協助防範錯誤資訊。若要進一步了解我們對安全與責任的作法,請參閱模型卡

開始使用最新的 Gemini Audio 模型

Gemini 3.8 Live 自今日起陸續推出:

Gemini 3.8 Live Extended Thinking 自今日起陸續推出:

Hacker News 網友討論整理

此討論串在整理時約有 279 分、184 則留言。整體評價偏正面,但對代理可靠性、程式開發能力、隱私與產品推出方式仍有明顯疑慮。[1]

1. 多語言與語言學習是最受肯定的應用

2. 即時語音體驗、延遲與自然度普遍獲得好評

3. 「自然好讀」與「程式能力」形成鮮明對比

4. 對基準測試與 Extended Thinking 的質疑

5. 版本推出與帳號權限令人困惑

6. 隱私、安全與可靠性仍是阻力

7. 對 Google AI 策略的看法兩極

綜合觀察

Hacker News 的回饋顯示,Gemini 3.8 Live 最有說服力的地方,不是抽象的「更高智慧」,而是低延遲語音、多語言切換、自然表達及背景工具呼叫所形成的連續互動體驗。它很適合語言練習、行車問答、搜尋與日常協作;若要用於程式代理、複雜決策或自動執行工作流程,仍應加入驗證、權限控管與人工覆核。[1]


Derek 觀點:Google 選了另一條路

看到這次 HN 討論的對比很有意思:一面是「說人話」一面倒的好評,另一面是程式代理能力的保留和質疑。這基本上就是 Google 目前給市場的印象,而且這個印象已經定型了。

我的解讀是,Google 已經不在前沿 Coding 這個戰場跟 Claude 和 OpenAI 硬拚了。Gemini 3.8 Live 的賣點全是實用性:低延遲、97 種語言、背景工具呼叫、便宜可大規模部署,配上搜尋、Workspace、Android 的整合。這是做給一般使用者、非前沿使用者的模型,不是做給每天跑高難度 agent 任務的那群人。

這不是壞事。多數人需要的本來就不是前沿 coding 模型,而是回得快、讀起來像人話、隨叫隨到的日常模型。「把別家模型的輸出丟給 Gemini 改寫成人話」這種用法出現,就說明它在這個位置已經贏了。短期分工大概就是這樣:前沿程式任務找 Claude 或 OpenAI,日常對話、語音、多語言就用 Gemini。

Exit mobile version