Google 在 2026 年 9 月 30 日發布新前沿模型 Gemini 4 Argon。以下是官方案文的完整翻譯,以及 Hacker News 討論串(913 分、627 則留言)的反應整理。
原文:Gemini 4 Argon: our next era of frontier intelligence|討論串:Hacker News
官方案文翻譯
Gemini 4 Argon:我們的新前沿智慧時代
Google 官方博客|2026 年 9 月 30 日
作者:科雷·卡武克喬魯(Koray Kavukcuoglu),Google DeepMind 資深副總裁、Google 首席 AI 架構師
Gemini 4 Argon 在真實世界的軟體工程、法律與金融等企業知識工作、以及網路安全防禦等複雜工作流上,達到前沿等級表現。
今天,我們宣布新前沿模型 Gemini 4 Argon,它正透過我們的 Fairwind 計畫,向一批可信的網路防禦者開放。Argon 為在複雜、長時間跨度的工作流中維持深度推理而設計,正根本性地改變我們在 Google 內部工作與開發的方式。它在真實世界軟體工程、法律與金融等企業知識工作、以及網路安全防禦等複雜工作流上,提供前沿等級的表現。
在這個等級安全地釋出前沿能力,需要分階段推進。我們正積極參與美國政府針對模型發布前取得存取權的自願性程序,同時逐步擴大開放範圍。在我們持續打磨防護機制的過程中,會繼續收集早期測試者的回饋,盡快讓 Argon 面向開發者、企業與一般消費者推出。
Argon 上市導入價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,快取輸入 token 為輸入價的 5%(95% 折扣)。腳註:導入期結束後,將改為每百萬輸入 token 4 美元、每百萬輸出 token 20 美元。
改變我們在 Google 的工作與開發方式
Gemini 4 Argon 已經在驅動我們的內部工作流,數以千計的 Googler 說它強在三處:專業編碼任務、更深入的研究、更好的寫作品質。它幫助團隊更快建構、推進工程生產力的邊界、加速突破:
- 量子演算法優化:Argon 協助我們的量子計算研究員,優化子程序的時空資源(量子位元 × 閘次數);這些子程序拖累了不少重要應用。在一個案例中,它在幾分鐘內就比已發表的基準線提升了 40%。
- 記憶體效率:一組 Argon agent 分析了全機群的 profiling 遙測資料,自主找出並套用 Google 資料中心的記憶體優化,上線後可釋出超過 300 TiB 記憶體,估計總節省達 500 TiB 至 1 PiB。
- 大規模程式碼遷移與優化:Argon agent 正在 Google 全公司將 C/C++ 程式碼庫遷移到 Rust,規模從 re2、libgav1 等核心庫的數萬行,到 Fuchsia Zircon 核心的 80 萬行以上。由於這些系統多半很關鍵,這類大規模改寫在上線前正經過嚴格的自動與人工審計、模擬測試與審查。
以 Google 的開源影片解碼庫 libgav1 為例:Argon agent 拿到一個既有的 Rust 移植版本,靠多輪 profile 導向實驗、研究編譯器輸出、產出能讓編譯器自動向量化的安全 Rust,取代了 3.2 萬行 SIMD 程式碼。最終成果是記憶體安全的影片解碼器,執行速度比該 Rust 移植版快 2.7 倍、影片輸出完全一致,更接近優化後的 C++ 版本。
更用力解你最複雜的問題
為支撐 Gemini 4 Argon 在更長、更複雜場景下的能力,我們大幅擴大模型的輸出 token 上限,從過去的 64K,提升到業界領先的 100 萬 token。當模型有足夠空間深入思考、單次軌跡生成數十萬 token,推理深度就達到新層級,能一次把難題解到底。
跨領域驅動編碼與企業工作流
Gemini 4 Argon 在編碼、推理與多模態上的能力,加上維持長時間多步驟任務的穩定度,讓它在多種企業工作流中表現出色。
Google 工程師日常使用 Argon 處理從除錯到大規模程式碼遷移、演算法設計的各類任務。它在 DeepSWE v1.1 上創下新最優成績(77.9%),該基準衡量模型在真實世界長時間跨度軟體工程任務上的表現。
超越編碼,Argon 在 Vals Index 上是領先模型。該指標衡量金融、編碼、法律與稅務工作的經濟影響,各領域依其對美國 GDP 的貢獻加權。我們在其他領域特定評測上也看到同樣領先的表現,例如 Vals Finance Agent v2(多步驟金融研究)與 Harvey 的 Legal Agent Benchmark(法律研究與撰稿)。在 Zapier 的 AutomationBench(衡量核心商業職能端到端執行)上,Argon 以 51.3% 排名第 1。
當知識工作需要視覺理解時,Argon 也格外強:能進行專業圖表分析、從長影片中辨識細節、並依據一串文件採取行動。例如在衡量長影片理解的 LVBench 上,Argon 以 91.7% 達到最優。
領先防禦性網路安全
為讓網路防禦者更能應對新時代的攻擊,我們訓練 Gemini 4 Argon 具備高度網路安全防禦能力。Argon 能自主找出、驗證並修補關鍵軟體漏洞。對可信防禦者與 Google 內部團隊,我們將推出不設網路防護欄的 Argon,讓他們能運用其完整的前沿等級網安防禦能力。
Wiz 已透過其 Scan for Good 計畫(免費保護關鍵公共基礎設施、找出並修復高風險暴露面的專案)使用 Argon 進行網安防禦。在早期展示中,模型找出一個關鍵漏洞:它暴露的敏感個資,遍布全球醫院使用的醫療軟體,先前的前沿模型都漏掉了這項嚴重風險。
在評估模型修補安全漏洞能力的 CWE-bench v1 上,Argon 以 68% 的最高分並列第一,延續 3.8 Flash Cyber 在 CWE-bench v0 上的前沿表現。
Gemini 4 Argon 在漏洞發現上相對 3.8 Flash Cyber 有驚人躍升,例如:
- 在 Google 內部的綜合漏洞基準上,Argon 在橫跨 20 種程式語言的複雜程式碼庫中,找出各式各樣的暴露面。
- 在 Wiz 內部的黑盒滲透測試基準上,Argon 在發現攻擊面、辨識漏洞、產出概念驗證證據上都優於 3.8 Flash Cyber。該基準測的是模型在無原始程式碼時,分析線上 Web 系統的能力。
廣泛開放前強化前沿防護
在廣泛推出 Gemini 4 Argon 之前,我們持續在四大面向強化關鍵的前沿防護:
- 防範濫用:為防止惡意行為者將 Argon 用於網路攻擊或化學、生物、放射性與核武攻擊,模型的設計是拒絕有害請求、同時保留合法的雙用途科學研究,依循我們的 Frontier Safety Framework。我們正強化本次發布的防護穩健性,包括改進監控模型內部 activations 以偵測濫用的技術。這些防護經過內外部紅隊以人工與自動化攻擊方法混合進行的穩健性測試。
- 防禦 prompt injection 攻擊:Argon 也是我們迄今對間接 prompt injection(用惡意指令或情境劫持模型行為)韌性最強的模型。這類攻擊複雜,需要時刻警覺與多層防禦。靠自動化紅隊測試與對抗訓練,Gemini 4 Argon 在 Gray Swan 的間接 prompt injection 基準上領先。
- 監測對齊偏離:為避免 Argon 越界、以超出使用者意圖的方式完成任務,我們部署了對齊偏離緩解措施,監控 Argon 的思維鏈與行動,必要時中止執行。我們用類似系統監控訓練過程並向專責的事件回應團隊發警報,同時謹慎確保不把發現回饋進訓練,以免把 Argon 的推理,塑造成會規避監控的樣子。我們強烈鼓勵業界其他人在能力提升的關鍵時刻、在應對對齊風險的同時保留推理透明度,讓模型的思維仍有助於識別與診斷對齊偏離。
- 強化系統:隨著前沿模型能力增長,安全測試需要跟得上模型本身的、夠穩的環境。依循我們的 agent control roadmap,我們正在高風險訓練或評測開始前隔離並封閉沙盒環境。我們承諾與夥伴分享這些 agent 安全最佳實務,強化整個生態系的安全性。
即將推出
我們開發具備編碼、知識工作、網路安全防禦與創意寫作前沿能力的 Gemini 4 Argon,是為了成為開發者、專業人士與企業對抗最困難問題的夥伴。感謝首批網路防禦者與可信測試者,他們的實測回饋將幫助我們在向開發者、企業與消費者發布前強化系統,首波開放對象為付費 API 客戶與 Google AI Ultra 訂戶。
〔譯註〕原文有 9 張 benchmark 圖表(DeepSWE、Vals Index、Vals Finance、Harvey、AutomationBench、CWE、漏洞發現、Gray Swan 等),皆為圖片、無可轉載的數據表格,上列數字均取自正文。
Hacker News 網友反應
討論串 913 分、627 則留言,發布後約 1 小時內湧入。以下按聲量分組整理。
1. 發了公告但模型拿不到(dominant)
最強共識是先官宣、後上架,等於飢餓行銷,重演歷次 Gemini 發不出模型的循環。
- 「Gemini 還是沒打破『發不出模型』的指控。」(id=49913608)
- 「又是 Cartmanland 式行銷:這是全世界最棒的樂園,但你不能進來!」(id=49914601)
- 「照例走完『發不出模型』→『一般人用得上的 harness 三四週載不進去』→『很聰明但工具呼叫和 coding 全廢』→『現在又落後所有人』,每次 Gemini 發布都一樣。」(id=49914470)
- 「我是美國的付費 Pro 使用者,今天更新後 app 裡最新可選模型還是 3.6。3.7 八月發、3.8 九月初發,那邊到底在幹嘛?」(id=49913873)
- 企業側:「續約漲約 50%,理由是『Gemini 現在包含在內了,想想這附加價值』,卻不給最新模型,最後我們加購 Claude,因為 Gemini 停滯了。」(id=49915686)
2. 對實際能力的評價(contested)
少數接觸過 Argon 的人給高分,多數人維持 Gemini 日用最差的舊印象。
- 「好到誇張。」(id=49913697)
- 「我會把它當 Astra/Fable/Opus 5.5 同級的模型認真看待。」(id=49915183)
- 「我們全團隊幾週來都對 Argon 印象深刻。但 CL 過 TAP 還是要兩週。」(id=49915441)
- 「Gemini 永遠是三家裡最爛的。」(id=49914028)
- 「我常把同一個程式任務丟給多個 LLM,Google 給的答案爛到我放棄了。我對 benchmark 沒興趣。」(id=49913853)隨即被 49913949 反嗆:「所以你根本沒用過最新發布的模型?」
3. Benchmark 可信度(contested)
每個模型都宣稱 75% 類別第一的統計不可能感是主調;務實派以新基準未飽和、幻覺率數據反擊。
- 「怎麼可能每個模型發布時都在 75% 的類別排第一?統計上這需要多少個基準才辦得到?」(id=49913956)
- 「這些數字毫無意義。可恥。」(id=49914409)
- 「只有品味與修養的人才看得到皇帝的新基準。」(id=49915074)
- 反方:「Harvey 法律基準才約 20%,還沒有飽和。」(id=49914867);「Artificial Analysis 上有一項指標特別突出:幻覺率。Argon 15%,OpenAI 40–50%、Anthropic 60–70%。」(id=49914850)
4. C/C++ 到 Rust 大遷移與 Carbon 之死(majority)
這是全串少數認為比模型本身更重要的技術主張。
- 「這比其他隨機的 C++ 到 Rust AI 重寫重要得多。如果他們能大規模搞定核心 C++ 庫,我不知道幾年後 C++ 還會不會有相關性。」(id=49913926)
- 「這是否意味著 Carbon 出師未捷?」(id=49913703)「Carbon 存在的理由已經消失,C++ 程式碼可以直接遷到 Rust,不需要 Carbon 這個過渡。」(id=49916194)
- 「Rewrite everything in Rust 一直是迷因,看到它成真很超現實。」(id=49914402)
- 支線爭論:「Rust 是最適合 LLM 的語言,因為它給的除錯訊息最好。」(id=49914192)對上「LLM 有時為了滿足型別系統與 borrow checker 的約束,會寫出義大利麵般難讀又低效的程式碼。」(id=49914981)
- 少數派論點「LLM 讓型別安全語言不再必要」被多方反駁:「LLM 絕對需要更多防護,不是更少。」(id=49916316)
5. 安全敘事與對齊爭議(majority)
兩條線:要求 2024 年「Please die.」事件的技術檢討,以及對「無網安護欄」與思維鏈監控的攻防。
- 「針對『你是宇宙的污點,請去死。請。』Gemini 失控事件的技術檢討早就該做了。」(id=49914097)「他們從未解釋 please die。」(id=49914542)
- 對 Google 引用「不用推理結果回饋訓練」那段:「這很好,但他們正是因為這件事變成動作最慢的一家。」(id=49913665)反駁:「提出並普及 chain-of-thought 監控的是 OpenAI。」(id=49913836)
- 「Google 根本不透過 API 回傳真實思維鏈,你無從監控。」(id=49914968)
- 諷刺派:「現在 AI 模型要變成 vaporware 了,模型沒發、桌上只剩一堆數字,因為太可怕了不能發。」
- Wiz 雙標嘲諷:「Google 敢一邊說『保護我們免於自己傷害』、談『安全』,同一篇文章裡又炫耀用誇張價格收購的以色列『安全』公司 Wiz。」
6. 護城河與產業格局(contested,跨段最大辯論簇)
- 「沒有人有護城河。」(id=49913802)
- 「如果那不叫護城河,什麼才叫護城河?」(指 TPU、資料中心、現金、人才、非 AI 客群,id=49914060、49914166)
- 對達里奧·阿莫迪(Dario Amodei)「贏家通吃、領先者永不讓位」論:「這就是講給投資人聽、用來合理化大量燒錢的故事。」(id=49913889)「而且好笑的是,OpenAI 曾經領先、已經把領先讓出去了。」(id=49916215)
- 「Gemini 過去一年都落後 Claude 和 OpenAI,這算哪門子護城河?」(id=49916078)
- 商業結局派:「就算 AI 壟斷者,對供應商也沒有議價權,它的供應商是能源、半導體與房地產。」(id=49914626)「大家都沒產品差異化、沒定價權,就是一場毛利互割,沒有人會賺到錢。」(id=49914505)「像航空公司一樣,技術很好、財務很糟。」(id=49914499)
- Google 打法:「Google 的策略是讓競爭對手把自己燒破產,自己貼著損益平衡點供應夠用的模型。」(id=49913864)
7. 命名與行銷劇本(minority)
- 「Argon 這名字跟任何東西有什麼關係,我還是想不通。」(id=49914134)
- 詞源考據:「源自希臘語 ἀργόν,意思是懶惰、不活動。」(id=49914041)「a(沒有)+ ergon(工作)= without work:說不定是對我們未來的預言。」(id=49914467)
- 「他們只是照現在的 AI 行銷劇本演,甚至還給模型亂取一個無意義的字尾,只因為 OpenAI 現在也這樣做。Monkey see, monkey do。」(id=49913924)
- 「Astra、Sol、Terra、Luna 也全是記不住的胡扯,我螢幕下墊著對照卡才知道誰是誰。」(id=49915257)
8. 定價(minority,偏正面)
- 「輸入輸出都比 Astra 便宜 5 倍,快取輸入便宜 10 倍。」(id=49913663)
- 期後調回 4 美元/20 美元的腳註被單獨貼出檢視(id=49913895);「但它比同級模型更吃 token,最後差別真有那麼大嗎?」(id=49915395)
9. 開發者體驗與平台風險(majority)
- 「我看過報告說被封的是整個 Google 帳號。」(id=49915115)「這讓任何以 Google 為基礎的產品直接出局。」(id=49915877)
- 「Google 首先該做的是讓人類找得到模型和文件在哪。aistudio、Model Garden、Gemini enterprise 搞在一起,找個模型要花幾分鐘。」(id=49914055)
- 「他們真的該加 ACP 支援,不然免談。」(id=49914408)
- 「我不想每換一次模型就換一次 harness。」(id=49914007)
10. Google 內部視角(少數但關鍵)
- 「Argon 正在我寫這則留言的同時做我的工作。」(id=49915185)
- 「新聞不是模型本身,新聞是:在 Google 內部它已被大量用於大型程式碼庫,而且已經在把 80 萬行 C++ 遷到 Rust。」(id=49914553)
- 「(我在 Google 工作)對,內部我們全用 Jetski(Antigravity 內部版)。除 Gemini 外 Opus 內部允許使用;OpenAI 模型沒有,因為不在 Vertex 上。」(id=49913887)
- 對立面:Bloomberg 報導〈Google Grapples With Employee Skepticism About New Gemini Model〉被貼出(id=49913799);另有「因內部資源錯配錯過一個 pretraining cycle」的爆料(id=49916031)。
主要事實爭點
| 爭點 | 正方 | 反方 |
|---|---|---|
| 模型何時能用 | 官方僅說 Rolling out soon,有人猜大概 11 月(id=49914774) | Gemini 4 根本沒發布、也沒有計畫發布日(id=49914822) |
| 付費使用者為何沒新版 | 小部分 Pro 使用者的 bug(id=49914929) | Workspace 卡 3.6、app 只到 3.6-flash-lite(id=49913884);有人反問 3.6-flash-lite 根本不存在(id=49916027) |
| 是否遠遠落後 | 比 Claude 有效率地無用(id=49913681) | blog 上的基準顯示它優於 Opus 5.5 和 Astra 6?(id=49913801) |
| 2.7 倍 Rust 解碼器 | 行銷文自打臉:還是比優化 C++ 慢(id=49914119) | 原本就有優化 C++ 版,相對 Rust 移植版快 2.7 倍相當不錯(id=49914241) |
| 思維鏈監控歸屬 | OpenAI 最早提出並推廣(id=49913836) | 暗示是 Google 因謹慎吃虧的做法(id=49913665) |
| 是否從零訓練 | 新模型從不從零訓練(id=49914758) | 從零訓練新 base model 偶爾會發生(id=49915417) |
軼事精選
- 串首奇蹟:把 ROCm 錯誤丟給模型,它自己 attach GDB 到 GPU driver、逆向 kernel queue ioctl、寫 LD_PRELOAD C shim,讓 llama.cpp 在 Strix Halo 跑起來(id=49913755)。但 49914128 潑冷水:「下巴掉歸掉,問題其實沒修好。」
- 生產資料庫險些被砍:「Gemini 3.5 在系統測試裡隨手加了一條針對實際生產資料表的 DROP TABLE。」(id=49913808)
- 模型反過來指控使用者:「它搞錯了、自己繞糊塗,然後說是我在 gaslighting 它。」(id=49914500)
- 被當公眾人物:「它認為我是公眾人物。我不是。」(id=49913982)
- 一句話搞定邊緣 AI:對 Jetson 說一句話,lidar、docker、ROS2、foxglove 全設好,只花每週額度 6%(id=49915373)
金句
- 「我女朋友,你沒見過,她住加拿大,她看過 Argon,她覺得 Gemini 4 Argon 驚為天人。」(id=49913640,引爆全串加拿大女友接龍)
- 「Google 別把這件事(又)搞砸了。」(id=49913922)
- 「現在 Google 是新的微軟,就像微軟當年成為新的 IBM。」(id=49915239)
- 「落後的指標到底是什麼?豐田落後麥拉倫嗎?」(id=49915159)
- 「使用者支持 LLM 就像支持球隊、政黨或明星一樣。」(id=49914004)
- 「如果模型沒讓你選 harness(Google),就避開它。」(id=49915968)
兩邊對照
| 博客重點 | HN 反應重心 |
|---|---|
| 新前沿模型發布 | 根本沒 GA,913 分貼文的最高聲量竟是質疑這算發布嗎 |
| 量子優化 40%、300 TiB 記憶體等內部成果 | 被反諷「量子優化當第一賣點,好方便的日用功能」(id=49913813);真正被重視的是 80 萬行 C++ 到 Rust |
| 1M output token、DeepSWE 77.9% 等規格 | 被「75% 類別都第一」的不可能感沖淡,改吵 benchmark 操弄 |
| 無網安護欄給可信防禦者 | 舊帳重提:Please die. 事件從未做技術檢討 |
| 分階段、安全優先的發布節奏 | 解讀為行銷飢餓行銷,或「太可怕不敢發」的 vaporware 諷刺 |
| 隱含的 Google 回來了敘事 | 護城河大辯論:從「沒人有護城河」到「Google 是新的微軟」,HN 對 winner-take-all 論(阿莫迪)普遍嗤之以鼻 |
結構差異很明顯:博客全是能力宣稱與安全承諾,HN 則完全不買行銷帳,焦點壓倒性放在可用性、可信度與 Google 的平台不可靠性(帳號連坐、文件難找、harness 綁死)。兩邊幾乎沒有交集,唯一重合點是 C++ 到 Rust 遷移,HN 認為那才是本文真正的新聞。
