Gemini 3.5 Transcribe:Google 新一代智慧語音轉文字模型

Google 在 2026-08-26 推出專用語音轉文字模型 Gemini 3.5 Transcribe,主打「智慧聽寫」——不是逐字稿,而是直接把口語(含自我修正、填充詞)轉成乾淨格式化文字。串流/批次兩個 API、85+ 語言、AA-WER 2.6% 排行第 5、token 計費約 $0.005/分鐘。

Google 在 2026-08-26 推出專用語音轉文字模型 Gemini 3.5 Transcribe,主打「智慧聽寫」——不是逐字稿,而是直接把口語(含自我修正、填充詞)轉成乾淨格式化文字。串流/批次兩個 API、85+ 語言、AA-WER 2.6% 排行第 5、token 計費約 $0.005/分鐘。

Google 2026 年 8 月推出專用語音轉文字模型 Gemini 3.5 Transcribe。本篇評析核心功能、辨識準確度、定價與 Speaker Diarization 的技術路線與限制。

阿里 Qwen 無預警開源 Qwen3.8-Flash-Next,config 裡直接寫著 qwen4_exp。GDN 加 QSA 稀疏注意力、四分支 residual stream、51B N-gram 查表記憶體、Muon optimizer,訓練成本宣稱只要前代的九分之一。定價 $0.16/M tokens,但授權不是 Apache 2.0。

智譜發布 GLM 系列首個原生多模態模型 GLM-5.3-Flash:320B 總參數僅激活 18B,稀疏+線性注意力混合架構把長上下文成本砍到旗艦的零頭。Artificial Analysis 智能指數 57 分與 Claude Opus 4.8 持平,每任務成本 $0.045,MIT 開源。

全文翻譯自 The 70% problem: Hard truths…
「Llama 2」模型的範例與配方庫(llama-recipes)提供了關於如何快速開始對特定領域進行細調(fine-tuning)及執行細調模型推論的範例。此庫使用 Hugging Face 轉換版本的模型,以便使用。除了提供示範應用程式外,還展示了在本地、雲端和企業內部運行 Llama 2 的方法。它還包括了關於如何安全地使用 Llama 2 模型的指南,並提醒使用此技術可能帶來的風險。更多資訊可在 GitHub 的 llama-recipes 頁面查看。