Gemini 3.5 Transcribe:Google 新一代智慧語音轉文字模型

Google 在 2026-08-26 推出專用語音轉文字模型 Gemini 3.5 Transcribe,主打「智慧聽寫」——不是逐字稿,而是直接把口語(含自我修正、填充詞)轉成乾淨格式化文字。串流/批次兩個 API、85+ 語言、AA-WER 2.6% 排行第 5、token 計費約 $0.005/分鐘。

Google 在 2026-08-26 推出專用語音轉文字模型 Gemini 3.5 Transcribe,主打「智慧聽寫」——不是逐字稿,而是直接把口語(含自我修正、填充詞)轉成乾淨格式化文字。串流/批次兩個 API、85+ 語言、AA-WER 2.6% 排行第 5、token 計費約 $0.005/分鐘。

Google 2026 年 8 月推出專用語音轉文字模型 Gemini 3.5 Transcribe。本篇評析核心功能、辨識準確度、定價與 Speaker Diarization 的技術路線與限制。

阿里 Qwen 無預警開源 Qwen3.8-Flash-Next,config 裡直接寫著 qwen4_exp。GDN 加 QSA 稀疏注意力、四分支 residual stream、51B N-gram 查表記憶體、Muon optimizer,訓練成本宣稱只要前代的九分之一。定價 $0.16/M tokens,但授權不是 Apache 2.0。

智譜發布 GLM 系列首個原生多模態模型 GLM-5.3-Flash:320B 總參數僅激活 18B,稀疏+線性注意力混合架構把長上下文成本砍到旗艦的零頭。Artificial Analysis 智能指數 57 分與 Claude Opus 4.8 持平,每任務成本 $0.045,MIT 開源。

NVIDIA 傳出以 130 億美元收購 Hugging Face。Hacker News 上 221 則留言從「Nvidia 對開源一向糟糕」吵到「它最有動機維持開放」,本文整理這筆交易的重點、社群正反論戰,以及最值得關注的後續觀察點。
上週 OpenRouter 出現匿名模型 Ox Alpha,免費、百萬 context、還會看影片。六天後 Z.ai 證實它就是 GLM-5.3-Flash。整理這一週社群怎麼用 tokenizer 指紋、錯誤字串和 stack trace 把它驗明正身,以及 Google 員工帶風向翻車的過程。

Apple 一次端出 M6 Ultra、新 Mac Studio 與 Mac mini,但 Hacker News 上八百多則留言的焦點不是晶片性能,而是「我的 M1 還能再戰幾年」。整理三串討論的正反觀點與定價風暴。
隨著8/1號到來,川普發動的關稅大戰暫時告…

全文翻譯自 The 70% problem: Hard truths…
StreamDiffusion是一個由Akio Kodaira、Chenfeng Xu等開發的創新擴散管道,旨在提升即時互動圖像生成的效能。它的核心功能包括數據處理的流線化、改進的指導機制、GPU利用效率的提高、輸入輸出操作的高效管理、KV-Caches的優化預計算,以及模型加速工具的使用。項目提供了安裝指南、互動式txt2img演示,以及圖像到圖像和文本到圖像的應用示例。此外,還包括了隨機相似性過濾器和殘差CFG(RCFG)等功能,以進一步提高效率。