本文為 Gemini 3.8 Live & Gemini 3.8 Live Extended Thinking 之繁體中文翻譯整理,原文版權歸原作者所有。
2026 年 9 月 15 日
10 分鐘閱讀
Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking 是我們目前最先進的即時對話模型。智慧與平行推理能力的大幅升級,讓使用者能更直覺地與模型協作,並透過語音執行複雜任務。
Malini Jaganathan
Gemini Audio 團隊技術人員,代表團隊撰文
今日,我們推出兩款新模型,藉由近乎即時的推理能力,讓語音代理更有效,也讓人與 AI 的對話更直覺、更聰明。
- Gemini 3.8 Live:針對大規模部署與成本效益而建,結合對話智慧、流暢互動及視覺理解能力。
- Gemini 3.8 Live Extended Thinking:針對高複雜度任務而建,具備更高智慧與多步驟推理能力。
對開發者與企業而言,這些模型提供了建構可靠、生產就緒語音代理所需的基礎元件。它們也讓使用者在 Gemini 應用程式、Google Workspace 與 Google 搜尋中與 Gemini 對話時更加流暢、協作性更高,只需透過語音即可處理複雜任務。
更流暢、更智慧的對話體驗
Gemini 3.8 Live Extended Thinking 提供企業級的任務完成與智慧能力,在 Artificial Analysis 的 Speech to Speech Quality Index 中以 82.6 分位居整體第一;在代理式任務完成方面,於 τ-Voice 取得 68.6%,在 Sierra 的 τ-Voice-banking 基準測試則取得 35.1%。其推理能力同樣出色,在 Big Bench Audio 獲得 97.7%,同時相較其他前沿模型仍維持極具競爭力的價格。
Gemini 3.8 Live 獲得使用者高度偏好,在 Speech Agent Arena 中排名第二。除了具備良好效能,它也維持高度成本效益,為開發者與企業提供一款能夠大規模部署、功能完整且高效率的模型。
在 ServiceNow 的 EVA-Bench 語音代理評測中,這兩款模型在複雜工作流程上推進了 Pareto Frontier,成功兼顧準確度與對話品質。
註:此測試透過 Gemini Enterprise Agent Platform 上的 Live API 執行。
Gemini 3.8 Live 能近乎即時處理視覺輸入,讓對話獲得更多情境資訊並提供更實用的回應。它支援 97 種語言,能在對話途中自動偵測並切換語言。模型還可在背景執行工具與 API 呼叫,同時繼續對話;因此,它能先確認使用者的要求,並在背景任務執行期間維持互動。
對於需要更深入推理的任務,Gemini 3.8 Live Extended Thinking 可以一邊推理、一邊說話。它在不中斷對話流程的情況下,為複雜工作流程提供更高智慧:模型會以「讓我確認一下……」等自然的早期口頭提示回應,並即時說明多步驟背景任務的執行進度。
在 Google Workspace 與搜尋服務中,Live 模型能帶來更直覺、更具協作性的體驗,尤其適合處理最複雜的任務。
強化開發者與企業的語音生態系
透過 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 與 Vision Agents 等開發平台,讓開發者可以更輕鬆地建構及部署高效能的語音介面。這些平台在幕後管理複雜的即時媒體串流基礎設施,讓開發者能專注於使用者體驗。
我們也與 Salesforce、Genspark 和 Lumeris 等公司合作。這些合作夥伴看好 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,並特別肯定其延遲表現、對話流暢度及工具呼叫能力。
透過 SynthID 浮水印確保透明度
我們 AI 產品生成的所有音訊都會加入 SynthID 浮水印。這種無法被人耳察覺的浮水印會直接嵌入音訊輸出,使 AI 生成內容仍可被偵測,協助防範錯誤資訊。若要進一步了解我們對安全與責任的作法,請參閱模型卡。
開始使用最新的 Gemini Audio 模型
Gemini 3.8 Live 自今日起陸續推出:
- 開發者:可透過 Gemini API 與 Google AI Studio 使用。
- 企業:已在 Gemini Enterprise 展開私人預覽,並將於近期支援 Gemini Enterprise for Customer Experience。
- 所有使用者:可在 Search Live 中使用。
Gemini 3.8 Live Extended Thinking 自今日起陸續推出:
- 開發者:可透過 Gemini API 與 Google AI Studio 使用。
- 企業:已在 Gemini Enterprise 展開私人預覽,並將於近期支援 Gemini Enterprise for Customer Experience 與 Google Workspace 企業客戶。
- 所有使用者:可在 Gemini Live 使用;Google AI Pro 與 Ultra 訂閱者可在 Workspace 的 Docs 中使用,所有 Google AI 訂閱者則可在 Gmail 與 Keep 中使用。
Hacker News 網友討論整理
此討論串在整理時約有 279 分、184 則留言。整體評價偏正面,但對代理可靠性、程式開發能力、隱私與產品推出方式仍有明顯疑慮。[1]
1. 多語言與語言學習是最受肯定的應用
- 多位網友分享以 Gemini 練習南非語、加泰隆尼亞語、冰島語、日語等語言的經驗;其中南非語使用者認為發音與對話品質出色,甚至讓母語家人感到驚訝。
- 有人會在開車時進行即興文法課、翻譯或自由問答,將 Gemini 視為可互動的「個人 Podcast」。
- 也有人指出品質依語言而異,例如冰島語仍有文法錯誤與非母語口音,日語 TTS 的音高重音也未必準確。
- 社群希望評測不只聚焦程式設計與「AGI」,也能加入不同語言社群的自然度、翻譯及在地化基準。
2. 即時語音體驗、延遲與自然度普遍獲得好評
- 試用者稱讚模型能理解濃重口音、聲音自然、延遲低,部分人認為 Gemini Live 比其他語音模式更像真人對話。
- 多人喜歡它回應速度快、文字與口語表達較自然,適合腦力激盪、查資料、日常問答與知識工作。
- 多語環境的即時翻譯被視為亮點,但吵雜場所可能同時翻譯背景人物;實際效果也會受到手機麥克風與收音硬體影響。
- 有人不喜歡過度擬人的語調、情緒模仿或合成聲音,認為長時間聆聽會造成疲勞,企業代理也不應代替真人表達情感性話語。
3. 「自然好讀」與「程式能力」形成鮮明對比
- 不少網友認為 Gemini 的文字最容易閱讀,翻譯、在地化、文件與知識工作表現突出;有人甚至讓 Gemini 專門把其他模型的輸出改寫成人類易讀版本。
- 程式設計評價則高度分歧。部分使用者稱讚它在 R、SQL、Elixir、COBOL 邊界案例等特定領域的表現;另一些人認為其整體程式代理能力仍落後 Claude 或其他模型。
- 有實務使用者警告,Gemini 可能自行發明額外需求與實作細節,不適合直接委派高風險代理任務。社群普遍同意:良好的對話體驗,不等於可靠的任務執行能力。
4. 對基準測試與 Extended Thinking 的質疑
- 網友質疑僅用綜合智慧指數或西洋棋示範評斷模型;有人批評展示影片中的模型輸給常見將殺棋型,也有人認為即時模型能合法下完整盤棋已相當不容易。
- 部分使用者認為 Extended Thinking 名稱言過其實,推理時間與正確率並未達到預期;另有人強調其語音對語音專項評測確實領先。
- 討論中的共識較接近「依任務選模型」:Gemini 在語音、速度、搜尋與自然表達有明確優勢,但不代表所有推理及代理任務都同樣可靠。
5. 版本推出與帳號權限令人困惑
- 多位付費或 Workspace 使用者仍只看到較舊模型,不清楚 3.7/3.8 的開放時程、方案差異及管理員應加購的項目。
- 有人肯定這次終於能用 Workspace 帳號使用;也有人批評 Google 公布新模型的速度,實際開放給既有付費使用者的時程卻慢得多。
- Vertex/Gemini Enterprise 的定位與命名也引發疑問,顯示企業端產品資訊仍不夠清楚。
6. 隱私、安全與可靠性仍是阻力
- 有網友要求 Google 提供「保留對話紀錄但不供訓練」的明確選項,否則不願將 Gemini 用於嚴肅工作。
- SynthID 音訊浮水印獲得注意,但有人認為它除防止錯誤資訊外,也有避免未來模型吸收大量 AI 生成內容的用途。
- 有人遇到模型回答自己、無限循環及隨機切換語言等錯誤,顯示真實產品穩定性仍需觀察。
7. 對 Google AI 策略的看法兩極
- 支持者認為 Google 未必需要在程式模型競賽中奪冠;它在搜尋、地圖、Workspace、Android、YouTube、雲端與 TPU 上的整合及規模化能力,可能更具長期價值。
- 批評者則認為,Google 擁有研究、資料、硬體與資金優勢,前沿模型卻未持續全面領先,是策略與執行上的失誤。
- 較折衷的看法是:Gemini 未必每項第一,但在速度、價格、多模態、語音與大規模服務能力之間取得了實用平衡。
綜合觀察
Hacker News 的回饋顯示,Gemini 3.8 Live 最有說服力的地方,不是抽象的「更高智慧」,而是低延遲語音、多語言切換、自然表達及背景工具呼叫所形成的連續互動體驗。它很適合語言練習、行車問答、搜尋與日常協作;若要用於程式代理、複雜決策或自動執行工作流程,仍應加入驗證、權限控管與人工覆核。[1]
Derek 觀點:Google 選了另一條路
看到這次 HN 討論的對比很有意思:一面是「說人話」一面倒的好評,另一面是程式代理能力的保留和質疑。這基本上就是 Google 目前給市場的印象,而且這個印象已經定型了。
我的解讀是,Google 已經不在前沿 Coding 這個戰場跟 Claude 和 OpenAI 硬拚了。Gemini 3.8 Live 的賣點全是實用性:低延遲、97 種語言、背景工具呼叫、便宜可大規模部署,配上搜尋、Workspace、Android 的整合。這是做給一般使用者、非前沿使用者的模型,不是做給每天跑高難度 agent 任務的那群人。
這不是壞事。多數人需要的本來就不是前沿 coding 模型,而是回得快、讀起來像人話、隨叫隨到的日常模型。「把別家模型的輸出丟給 Gemini 改寫成人話」這種用法出現,就說明它在這個位置已經贏了。短期分工大概就是這樣:前沿程式任務找 Claude 或 OpenAI,日常對話、語音、多語言就用 Gemini。
