四十八個德瑞克

Gemini 4 Argon 官方案文翻譯與 Hacker News 網友反應

聚光燈下悬浮在基座上的紫藍色水晶,四周是暗處觀望的人形剪影

Google 在 2026 年 9 月 30 日發布新前沿模型 Gemini 4 Argon。以下是官方案文的完整翻譯,以及 Hacker News 討論串(913 分、627 則留言)的反應整理。

原文:Gemini 4 Argon: our next era of frontier intelligence|討論串:Hacker News

官方案文翻譯

Gemini 4 Argon:我們的新前沿智慧時代

Google 官方博客|2026 年 9 月 30 日

作者:科雷·卡武克喬魯(Koray Kavukcuoglu),Google DeepMind 資深副總裁、Google 首席 AI 架構師

Gemini 4 Argon 在真實世界的軟體工程、法律與金融等企業知識工作、以及網路安全防禦等複雜工作流上,達到前沿等級表現。


今天,我們宣布新前沿模型 Gemini 4 Argon,它正透過我們的 Fairwind 計畫,向一批可信的網路防禦者開放。Argon 為在複雜、長時間跨度的工作流中維持深度推理而設計,正根本性地改變我們在 Google 內部工作與開發的方式。它在真實世界軟體工程、法律與金融等企業知識工作、以及網路安全防禦等複雜工作流上,提供前沿等級的表現。

在這個等級安全地釋出前沿能力,需要分階段推進。我們正積極參與美國政府針對模型發布前取得存取權的自願性程序,同時逐步擴大開放範圍。在我們持續打磨防護機制的過程中,會繼續收集早期測試者的回饋,盡快讓 Argon 面向開發者、企業與一般消費者推出。

Argon 上市導入價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入 token 為輸入價的 5%(95% 折扣)。腳註:導入期結束後,將改為每百萬輸入 token 4 美元、每百萬輸出 token 20 美元。

改變我們在 Google 的工作與開發方式

Gemini 4 Argon 已經在驅動我們的內部工作流,數以千計的 Googler 說它強在三處:專業編碼任務、更深入的研究、更好的寫作品質。它幫助團隊更快建構、推進工程生產力的邊界、加速突破:

以 Google 的開源影片解碼庫 libgav1 為例:Argon agent 拿到一個既有的 Rust 移植版本,靠多輪 profile 導向實驗、研究編譯器輸出、產出能讓編譯器自動向量化的安全 Rust,取代了 3.2 萬行 SIMD 程式碼。最終成果是記憶體安全的影片解碼器,執行速度比該 Rust 移植版快 2.7 倍、影片輸出完全一致,更接近優化後的 C++ 版本。

更用力解你最複雜的問題

為支撐 Gemini 4 Argon 在更長、更複雜場景下的能力,我們大幅擴大模型的輸出 token 上限,從過去的 64K,提升到業界領先的 100 萬 token。當模型有足夠空間深入思考、單次軌跡生成數十萬 token,推理深度就達到新層級,能一次把難題解到底。

跨領域驅動編碼與企業工作流

Gemini 4 Argon 在編碼、推理與多模態上的能力,加上維持長時間多步驟任務的穩定度,讓它在多種企業工作流中表現出色。

Google 工程師日常使用 Argon 處理從除錯到大規模程式碼遷移、演算法設計的各類任務。它在 DeepSWE v1.1 上創下新最優成績(77.9%),該基準衡量模型在真實世界長時間跨度軟體工程任務上的表現。

超越編碼,Argon 在 Vals Index 上是領先模型。該指標衡量金融、編碼、法律與稅務工作的經濟影響,各領域依其對美國 GDP 的貢獻加權。我們在其他領域特定評測上也看到同樣領先的表現,例如 Vals Finance Agent v2(多步驟金融研究)與 Harvey 的 Legal Agent Benchmark(法律研究與撰稿)。在 Zapier 的 AutomationBench(衡量核心商業職能端到端執行)上,Argon 以 51.3% 排名第 1。

當知識工作需要視覺理解時,Argon 也格外強:能進行專業圖表分析、從長影片中辨識細節、並依據一串文件採取行動。例如在衡量長影片理解的 LVBench 上,Argon 以 91.7% 達到最優。

領先防禦性網路安全

為讓網路防禦者更能應對新時代的攻擊,我們訓練 Gemini 4 Argon 具備高度網路安全防禦能力。Argon 能自主找出、驗證並修補關鍵軟體漏洞。對可信防禦者與 Google 內部團隊,我們將推出不設網路防護欄的 Argon,讓他們能運用其完整的前沿等級網安防禦能力。

Wiz 已透過其 Scan for Good 計畫(免費保護關鍵公共基礎設施、找出並修復高風險暴露面的專案)使用 Argon 進行網安防禦。在早期展示中,模型找出一個關鍵漏洞:它暴露的敏感個資,遍布全球醫院使用的醫療軟體,先前的前沿模型都漏掉了這項嚴重風險。

在評估模型修補安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一,延續 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表現。

Gemini 4 Argon 在漏洞發現上相對 3.8 Flash Cyber 有驚人躍升,例如:

廣泛開放前強化前沿防護

在廣泛推出 Gemini 4 Argon 之前,我們持續在四大面向強化關鍵的前沿防護:

即將推出

我們開發具備編碼、知識工作、網路安全防禦與創意寫作前沿能力的 Gemini 4 Argon,是為了成為開發者、專業人士與企業對抗最困難問題的夥伴。感謝首批網路防禦者與可信測試者,他們的實測回饋將幫助我們在向開發者、企業與消費者發布前強化系統,首波開放對象為付費 API 客戶與 Google AI Ultra 訂戶。

〔譯註〕原文有 9 張 benchmark 圖表(DeepSWE、Vals Index、Vals Finance、Harvey、AutomationBench、CWE、漏洞發現、Gray Swan 等),皆為圖片、無可轉載的數據表格,上列數字均取自正文。

Hacker News 網友反應

討論串 913 分、627 則留言,發布後約 1 小時內湧入。以下按聲量分組整理。

1. 發了公告但模型拿不到(dominant)

最強共識是先官宣、後上架,等於飢餓行銷,重演歷次 Gemini 發不出模型的循環。

2. 對實際能力的評價(contested)

少數接觸過 Argon 的人給高分,多數人維持 Gemini 日用最差的舊印象。

3. Benchmark 可信度(contested)

每個模型都宣稱 75% 類別第一的統計不可能感是主調;務實派以新基準未飽和、幻覺率數據反擊。

4. C/C++ 到 Rust 大遷移與 Carbon 之死(majority)

這是全串少數認為比模型本身更重要的技術主張。

5. 安全敘事與對齊爭議(majority)

兩條線:要求 2024 年「Please die.」事件的技術檢討,以及對「無網安護欄」與思維鏈監控的攻防。

6. 護城河與產業格局(contested,跨段最大辯論簇)

7. 命名與行銷劇本(minority)

8. 定價(minority,偏正面)

9. 開發者體驗與平台風險(majority)

10. Google 內部視角(少數但關鍵)

主要事實爭點

爭點 正方 反方
模型何時能用 官方僅說 Rolling out soon,有人猜大概 11 月(id=49914774) Gemini 4 根本沒發布、也沒有計畫發布日(id=49914822)
付費使用者為何沒新版 小部分 Pro 使用者的 bug(id=49914929) Workspace 卡 3.6、app 只到 3.6-flash-lite(id=49913884);有人反問 3.6-flash-lite 根本不存在(id=49916027)
是否遠遠落後 比 Claude 有效率地無用(id=49913681) blog 上的基準顯示它優於 Opus 5.5 和 Astra 6?(id=49913801)
2.7 倍 Rust 解碼器 行銷文自打臉:還是比優化 C++ 慢(id=49914119) 原本就有優化 C++ 版,相對 Rust 移植版快 2.7 倍相當不錯(id=49914241)
思維鏈監控歸屬 OpenAI 最早提出並推廣(id=49913836) 暗示是 Google 因謹慎吃虧的做法(id=49913665)
是否從零訓練 新模型從不從零訓練(id=49914758) 從零訓練新 base model 偶爾會發生(id=49915417)

軼事精選

金句

兩邊對照

博客重點 HN 反應重心
新前沿模型發布 根本沒 GA,913 分貼文的最高聲量竟是質疑這算發布嗎
量子優化 40%、300 TiB 記憶體等內部成果 被反諷「量子優化當第一賣點,好方便的日用功能」(id=49913813);真正被重視的是 80 萬行 C++ 到 Rust
1M output token、DeepSWE 77.9% 等規格 被「75% 類別都第一」的不可能感沖淡,改吵 benchmark 操弄
無網安護欄給可信防禦者 舊帳重提:Please die. 事件從未做技術檢討
分階段、安全優先的發布節奏 解讀為行銷飢餓行銷,或「太可怕不敢發」的 vaporware 諷刺
隱含的 Google 回來了敘事 護城河大辯論:從「沒人有護城河」到「Google 是新的微軟」,HN 對 winner-take-all 論(阿莫迪)普遍嗤之以鼻

結構差異很明顯:博客全是能力宣稱與安全承諾,HN 則完全不買行銷帳,焦點壓倒性放在可用性、可信度與 Google 的平台不可靠性(帳號連坐、文件難找、harness 綁死)。兩邊幾乎沒有交集,唯一重合點是 C++ 到 Rust 遷移,HN 認為那才是本文真正的新聞。

Exit mobile version