編按:本文綜合整理自 Google 官方部落格、VentureBeat、9to5Google、MarkTechPost 與 Techzine 等一手來源,並加入 Siami 編輯部觀點與分析。
Home Innovation & AI Models & research Gemini Models
x.com Facebook LinkedIn Mail Copy link
Gemini 4 Argon 在真實世界的軟體工程、企業知識工作(如法律與金融),以及網路安全防禦等複雜工作流程中,提供前沿效能表現。
Koray Kavukcuoglu
SVP, Google DeepMind 暨 Google 首席 AI 架構師
x.com Facebook LinkedIn Mail Copy link
Your browser does not support the audio element.
Google 最新發布的 Gemini 4 Argon 模型,為複雜且長時程的專業任務帶來進階推理能力。該模型擁有業界領先的 100 萬 token 輸出上限,可進行深度的多步驟問題求解。它在程式設計、金融研究、法律起草,以及自主網路安全漏洞修補方面表現卓越。Argon 目前正透過 Fairwind Program 向受信賴的網路防禦者推出。Google 在更廣泛地開放給公眾之前,會優先重視安全性與嚴謹測試。今天,我們正式發布前沿模型 Gemini 4 Argon,它正透過 Fairwind Program 逐步向一組受信賴的網路防禦者推出。Argon 為了在複雜、長時程的工作流程中維持深度推理而打造,從根本上改變了我們在 Google 內部工作與建構的方式。它在真實世界的軟體工程、企業知識工作(如法律與金融),以及網路安全防禦等複雜工作流程中,提供前沿的效能表現。要在這個層級安全地釋出前沿能力,必須採取分階段的方式。我們正積極參與美國政府的自願性預發布模型存取流程,同時逐步擴大存取範圍。我們會持續收集早期測試者的回饋,迭代完善安全護欄,再盡快將 Argon 開放給開發者、企業和消費者使用。
Argon 上市時的定價為每百萬輸入 token 2 美元、每百萬輸出 token 10 美元,緩存輸入 token 享有原價 95% 的折扣。
改變 Google 內部的工作與建構方式
Gemini 4 Argon 已在 Google 內部工作流程中上線運作,數千名 Google 員工都肯定它在專業程式設計任務、深度研究與寫作品質方面的優勢。它協助團隊更快地開發、推進工程生產力的極限,並加速突破性進展:
- 量子演算法最佳化:Argon 協助我們的量子運算研究人員,最佳化瓶頸應用程式子常式的時空資源(量子位元 × 閘數)。在某一個案例中,它在幾分鐘內就比已發表的基準改善了 40%。
- 記憶體效率:一支由 Argon agent 組成的團隊分析了整個機群的效能遙測資料,自動辨識並套用記憶體最佳化配置到 Google 的資料中心。全面部署後,已釋放出超過 300 TiB 的記憶體,預估總共可節省 500 TiB 到 1 PiB。
- 大規模程式碼庫遷移與最佳化:Argon agents 正協助 Google 將 C/C++ 程式碼庫遷移到 Rust——規模從核心函式庫(如 re2、libgav1)的數萬行,一路擴展到 Fuchsia Zircon 核心的 80 萬行以上。考量到許多系統的關鍵性,這些大規模改寫在正式上線前,都會經過嚴格的自動化與人工稽核、模擬測試及審查。以 libgav1(Google 開源的影片解碼軟體)為例,Argon agents 以既有的 Rust 移植版本為基礎,經過多輪 profile-guided 實驗,研究編譯器輸出,產出能讓編譯器自動向量化(vectorize)的安全 Rust 程式碼,替換了 32K 行的 SIMD 程式碼。最終成果是一個記憶體安全、執行速度比原 Rust 移植版本快 2.7 倍、且影片輸出完全相同的影片解碼器,更接近最佳化的 C++ 效能。
在最複雜的問題上更努力為了支援 Gemini 4 Argon 在更長、更複雜使用情境下的能力,我們將模型的輸出 token 上限大幅擴張到業界領先的 100 萬 token,從先前的 64K token 提升。當模型有足夠空間深度思考、並在單次軌跡中產生數十萬 token 時,它為推理帶來全新層次的深度,能一次解決艱難問題。
跨領域支援程式設計與企業工作流程
Gemini 4 Argon 在程式設計、推理、多模態上的能力,以及它對長時程、多步驟任務的延續執行能力,使它能在各種企業工作流程中脫穎而出。
Google 工程師已將 Argon 應用於日常工作——從日常除錯到大規模程式碼庫遷移與演算法設計。它在 DeepSWE v1.1(衡量模型在真實世界長時程軟體工程任務表現的基準)上以 77.9% 創下新紀錄。除了程式設計之外,Argon 也是 Vals Index 的領先模型。Vals Index 以美國 GDP 貢獻度加權,衡量金融、程式設計、法律與稅務工作的經濟影響。我們在其他領域專用評測中同樣看到領先表現,例如 Vals Finance Agent v2(多步驟金融研究)和 Harvey 的 Legal Agent Benchmark(法律研究與起草)。在 Zapier 推出的 AutomationBench(衡量跨核心業務功能端到端執行能力)上,Argon 以 51.3% 的成績名列第一。當知識工作需要視覺理解時,Argon 也獨具優勢。它能驅動專業圖表分析、從長影片中識別細節,並根據一系列文件採取行動。例如,在衡量長影片理解的 LVBench 上,Argon 以 91.7% 創下業界最佳。
領先的防禦性網路安全為了讓網路防禦者在新型網路攻擊時代中更有所準備,我們訓練 Gemini 4 Argon 在網路安全防禦方面具備高度能力。Argon 能自主發現、驗證並修補關鍵軟體漏洞。對於受信賴的防禦者及 Google 內部團隊,我們將釋出沒有網路安全護欄版本的 Argon,讓他們能運用其前沿等級的網路安全防禦能力。
Wiz 已透過其「Scan for Good」倡議使用 Argon 進行網路安全防禦——這項計畫透過免費發現並修復高風險漏洞,保護關鍵公共基礎設施。在一場早期展示其影響力的實測中,該模型揭露了一個橫跨全球醫院所用醫療軟體、會導致敏感個資外洩的重大漏洞,找到了先前前沿模型未能察覺的嚴重風險。在 CWE-bench v1(評估模型修補安全漏洞能力的基準)上,Argon 以 68% 的最高分並列第一,延續 3.8 Flash Cyber 在 CWE-bench v0 的前沿表現。
Gemini 4 Argon 在漏洞發掘方面,相較 3.8 Flash Cyber 展現令人印象深刻的躍進。舉例來說:
- 在 Google 內部的綜合漏洞評測中,Argon 揭露了橫跨 20 種程式語言、複雜程式碼庫中的各種漏洞。
- 在 Wiz 的內部黑盒滲透測試基準(測試模型在沒有原始碼的情況下分析線上 Web 系統的能力)上,Argon 在發現攻擊面、識別漏洞,以及產生概念驗證佐證方面,都勝過 3.8 Flash Cyber。
在廣泛釋出前強化前沿防護在廣泛釋出 Gemini 4 Argon 之前,我們持續強化四個關鍵領域的前沿防護:
-
防範濫用:為防止不肖人士將 Argon 用於網路攻擊或化學、生物、放射與核子(CBRN)攻擊,模型設計為拒絕有害請求,同時保留合法、雙重用途的科學研究(依循我們的 Frontier Safety Framework)。我們正在強化本次發布的安全防護穩健性,包括改進用於監控模型內部啟動以偵測濫用的技術。這些防護經過內外部紅隊使用手動與自動化攻擊方法的穩健性測試。
-
防範提示注入攻擊:Argon 也是我們迄今為止對間接提示注入最具韌性的模型——惡意指令或情境會被用來劫持模型的行為。這類攻擊相當複雜,需要持續警覺與多層防禦。透過自動化紅隊與對抗性訓練,Gemini 4 Argon 在 Gray Swan 的間接提示注入(IPI)基準上領先群雄。
-
監控目標錯位:為防止 Argon 越界、以超出使用者意圖的方式嘗試完成任務,我們部署了錯位緩解措施,監控 Argon 的思維鏈與動作,必要時停止執行。我們用類似的系統監控訓練過程,並向專責事件應變團隊發出警示,謹慎避免將發現結果回灌到訓練中,以免影響 Argon 的推理方式使其規避監控。在這個能力提升、伴隨錯位風險的關鍵時刻,我們強烈鼓勵業界保存推理透明度,讓模型思維有助於識別與診斷錯位。
-
強化系統:隨著前沿模型能力日益提升,安全測試它們需要能跟上系統腳步的安全環境。依循我們的 agent control roadmap,我們透過在開始高風險訓練或評估前進行隔離與密封,強化沙盒環境。我們承諾與合作夥伴分享這些 agent 安全最佳實務,以提升整個生態系的安全。
即將推出我們打造 Gemini 4 Argon,使其在程式設計、知識工作、網路安全防禦與創意寫作方面具備前沿能力,成為開發者、專業人士與企業在處理最困難問題時的合作夥伴。我們感謝首批網路防禦者與受信賴測試者的真實世界評測與回饋,協助我們在向開發者、企業及消費者(從付費 API 用戶與 Google AI Ultra 訂閱者開始)釋出之前,先強化系統。
為什麼這件事重要
Google 在 2026 年 9 月 30 日正式發表的 Gemini 4 Argon,標誌著 AI 前沿模型競爭進入新階段。三個關鍵變化值得注意:第一,輸出長度從 64K 暴增到 100 萬 token——這是業界首次達到百萬等級輸出上限。對企業應用來說,這意味著能一次處理完整的程式碼庫遷移、長篇法律文件、或整段學術論文,而不必切分成多個對話。第二,定價策略極具侵略性:$2/百萬輸入 token + $10/百萬輸出 token,與 GPT-6.1 Sol 完全同價,但 Argon 在多項基準上表現更佳。這直接挑戰 Anthropic Claude Opus 5.5 與 OpenAI GPT-6 Astra 的定價空間。第三,網路安全防禦能力首次作為前沿模型的核心賣點。Argon 在 CWE-bench v1 拿下 68% 並列第一,並透過 Fairwind Program 開放給受信賴的網路防禦者(含 Wiz 的 Scan for Good)。Google 內部已用 Argon agents 把 C/C++ 程式碼自動遷移到 Rust,速度比人工移植快 2.7 倍。
數據解讀 / 質疑從 benchmark 數字看 Argon 的領先幅度:在 DeepSWE v1.1(衡量真實世界長時程軟體工程)拿到 77.9%,比 Claude Opus 5.5 的 74.2% 高出近 4 個百分點;在 Vals Index(衡量經濟價值,含金融、法律、稅務、程式設計)拿下 68.9%,領先 Opus 5.5(67.0%)與 GPT-6 Astra(63.1%);在 Harvey 法律 Agent Benchmark 上更是 19.6%,比 GPT-6 Astra 的 5.4% 與 Opus 5.5 的 3.8% 高出三倍以上。但要注意三個限制:
- 可取得性受限:Argon 目前只開放給「Fairwind Program」的受信賴網路防禦者,開發者與一般消費者還無法使用。Google 強調這是「前置安全評估」,但實質上是延遲全面釋出。
- 無網路安全護欄版本:對受信賴夥伴釋出的版本「無 cyber guardrails」,這是雙面刃——防禦者拿到完整能力,攻擊者也可能透過資安公司取得。
- 內部使用案例尚需獨立驗證:Google 自家揭露的「libgav1 Rust port 速度提升 2.7 倍」雖然驚人,但這是供應商自報數字,需要第三方獨立基準才能確認。
業界與社群回應
Argon 發表後在 Hacker News 迅速衝到第一(分數 651、408 則留言),社群反應熱烈但也有保留:
- 官方 Google 帳號:強調 Argon 透過 Fairwind Program 提供給受信賴防禦者
- 知名 AI 開發者 @_philschmid:肯定輸出 100 萬 token 與 $2/$10 定價,期待開發者存取盡快開放
- Reddit 開發者:「100 萬 token 輸出 + $2/$10 定價對 Claude Opus 5.5 是毀滅性打擊」
- VentureBeat 分析:法律 Agent Benchmark 19.6% vs Opus 5.5 的 3.8%,是法律 AI 的里程碑
網友熱門留言 (7)