← 返回 Siami 首頁

Google Gemini 3.7 Flash 正式發表:三週迭代一次、定價砍半,主攻 coding 與 agent 工作流

▲ 480 💬 297
Google Gemini 3.7 Flash 正式發表:三週迭代一次、定價砍半,主攻 coding 與 agent 工作流

編按:本文綜合整理自 Google 官方部落格公告、Reuters 報導、Ars Technica 報導、The New Stack 分析、VentureBeat 評測 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

Google 在 2026 年 8 月 13 日正式發表 Gemini 3.7 Flash — 距離 3.6 Flash 上線僅僅三週。新模型主打「更聰明的工作馬」,重點放在 coding 與 agent 工作流,並把 API 定價直接砍到 3.6 Flash 的一半。這是 Google 在中階 Flash 系列上罕見的高頻迭代,也反映整個產業的價格戰正在往「每兩三週出新模型、每次都更便宜」的方向傾斜。


三週迭代 + 半價,這次 Google 玩真的

Gemini 3.7 Flash 的官方定位是「目前為止最聰明的工作馬模型」,主打 software engineering、knowledge work 跟 web dev workflows。從產品節奏來看,這是 Flash 系列第一次在不到一個月內推出新版本;Google 也罕見地在同一份公告裡把「開發者反饋」當成迭代主因,強調演算法創新會延伸到未來的 Pro 模型。最關鍵的數字是價格:到 2026 年底為止,input $0.75 / 1M tokens、output $3.75 / 1M tokens,相當於 3.6 Flash 的一半;2027 年 1 月 1 日起價格漲回 $1.50 / $7.50。Google 同時把這個特價延長套用到 3.6 Flash,等於兩代 Flash 模型同步半價促銷。可用性方面,新模型從發表當天就同步上架:

  • 開發者:Google Antigravity、Gemini API、Google AI Studio、Android Studio
  • 企業:Gemini Enterprise Agent Platform、Gemini Enterprise app
  • 個人:Gemini app(透過 AI Pro / Ultra 訂閱,覆蓋 160+ 國家)

Gemini Spark(Google I/O 推出的 24/7 個人 AI agent)也同步切換到 3.7 Flash,提供改進的 Workspace 工具整合。


Benchmark 跳很大,但贏家不是 Google 自己

Google 官方公布的 benchmark 對比全跟 3.6 Flash 比較,幅度確實驚人:

項目3.7 Flash3.6 Flash增幅
FrontierCode 1.1 Main43.6%34.4%+9.2 pp
DeepSWE v1.165.3%49.0%+16.3 pp
GDP.pdf(複雜文件)34.0%22.0%+12.0 pp
AutomationBench30.4%17.0%+13.4 pp
WebDev Arena Elo15881538+50

但 VentureBeat 的獨立分析指出,3.7 Flash 在不同維度的「贏面」並不一致:

  • Coding(FrontierCode / DeepSWE):領先 Claude Sonnet 5 與 GPT-5.6 Terra
  • Terminal-bench 2.1:3.7 Flash 85.8% vs GPT-5.6 Terra 87.4%(輸)
  • Agent’s Last Exam 多模態桌面任務:Claude Sonnet 5 33.3% vs 3.7 Flash 26.3%(明顯輸)
  • GDP.pdf:3.7 Flash 34.0% vs Claude Sonnet 5 28.0% vs GPT-5.6 Terra 24.7%(領先)

Reuters 報導則直接點出另一個訊號:Google 把下一代旗艦 Gemini(外界推測是 Gemini 3.5/4 Pro)推遲了兩個月,理由是內部測試顯示性能不夠。


開發者體驗:更會規劃、更少重試除了分數,Google 強調 3.7 Flash 的「執行紀律」是這次升級的真正重點:

  • 多步規劃更扎實:在 multi-step planning 跟 tool calls 上投入更多 reasoning effort
  • 主動釐清意圖:遇到 ambiguity 會停下來問,而不是硬猜
  • 更少 manual oversight:retry 率明顯下降,適合跑 production agent

官方 demo 也展示了幾個新能力:

  • 文字 → 可玩的 3D 遊戲(搭配 Nano Banana 動態生成角色、道具、貼圖)
  • 單次 prompt 生成有視差的互動 landing page(透過 Gemini Omni 串接子代理)
  • 機器人訓練:3-agent graph loop 用多模態理解幫機器人加速學習
  • PDF → 互動式資料故事:把年報自動轉成網頁並內嵌即時圖表這些 demo 主要是「能跑」,不是「能跑得比 Opus 5 / Sonnet 5 更好」—— HN 上開發者 jjcm 的實測就把 Gemini 3.7 跟 Opus 5、Grok 4.6 同台比 image→HTML,最終結論是「Opus 5 仍是同類最佳,但 Grok 4.6 真的追上來了」。

價格陷阱:「半價只到年底」是業界新標配這次發表最值得拿出來單獨討論的不是 benchmark,而是 2026/12/31 的價格回漲。Google 不是第一個這樣做的廠商,但 Flash 系列的時程揭露得太明確,反而引起社群不安。

兩家社群媒體上的開發者直接用「laughable」形容這個排程:「到 2027 年 1 月,至少已經有三個新世代的模型從別家出來了。沒人會在 2027 年初還在用 Flash 3.7。」(npn, HN)

另一個關鍵的觀察來自 Artificial Analysis 的對比:

「Grok 4.6 跑完整 suite 要 $1,068,Gemini 3.7 Flash 只要 $485。真正的世界裡 Gemini 3.7 Flash 是對手的一半以下。」每 token 價格不是好指標,因為有些模型用 token 用得兇得多。(mdasen, HN)

The New Stack 評論員 Amanda Caswell 直接下了一個結論:

「拿到 65% DeepSWE 分數的那個模型,不是 Google 承諾的那個。3.7 Flash 確實帶來巨大的 coding agent 跟自動化進展,但它的促銷 API 價格 1 月就要翻倍 — 團隊現在就要規劃好遷移。」這個節奏的背後訊號是:Google 把「三週一次迭代」當成新的 release cadence,每次都比上一代更便宜,先搶佔工作負載,等用戶的 production pipeline 黏住再漲價回本。


為什麼這件事重要對台灣與全球開發者而言,3.7 Flash 的意義不是「Google 又出了一個模型」,而是 「中階戰場正式變成每三週一次的降價循環」:

  1. 價格戰進入「以週為單位」的新階段:DeepSeek V4、GPT-5.6 Luna、Gemini 3.7 Flash 三家的更新間隔都已經壓到月內。Luna 報價 $0.2 / 1M input(cache $0.02)、$1.2 / 1M output,比 3.7 Flash 又便宜近 4 倍。開發者選模型的決策週期被迫縮短。
  2. 「旗艦 Pro 模型缺席」訊號:Reuters 報導 Google 把 Gemini Pro 旗艦推遲兩個月,加上 HN 上「Google 是不是已經不是 frontier lab」的質疑聲量變大,反映 Google 的「差異化定位」問題不是技術而是「Pro 模型在哪」。
  3. Vision 仍是 Gemini 的護城河:在 image→HTML、video ingestion 等多模態任務上,3.7 Flash 仍是性價比最高的選擇。PunchTornado (HN) 直接講:「我試過每一家做 1M documents/hour 的吞吐,只有 Gemini Flash 在 GCP 上跑得起來,其他家 3 個 request 就有 1 個 fail。」
  4. API friction 變成新的競爭變數:jjcm 的 75-reply 熱門 thread 最後結論是 — 即便模型再強,「要走 8 個 GCP dashboard 才能拿到 API key」這件事會把開發者推到 OpenRouter 或其他 provider。Google 的商業化摩擦力正在侵蝕它的技術紅利。這一波對台灣新創最直接的影響:不要把任何一個模型的「introductory pricing」當成預設假設計成本,而是把 2027 年 1 月 1 日當作隱形的 deadline — 在那之前要嘛把 pipeline 抽象化、要嘛準備好下一代的遷移路徑。

🚨 數據解讀 / 質疑

Google 自己公佈的 benchmark 是「對 3.6 Flash 的進步幅度」,沒有放跟 Sonnet 5 / GPT-5.6 Terra / DeepSeek V4 的 head-to-head 全表格。VentureBeat 從 Google 自己的延伸資料整理出來的對比,顯示 3.7 Flash 在 Terminal-bench 跟 Agent’s Last Exam 兩項關鍵 agent benchmark 上其實輸給對手。

「3.7 Flash 並不是 frontier-flash 模型。它在 3.7 之前缺席的整個 agentic 多模態任務類別上依然落後。Google 應該把 benchmark 拿去對 Luna / Terra 比較才對 — Luna 便宜很多,等於直接打掉 Flash 的存在意義。」(wxw, HN)

換句話說,3.7 Flash 的真實定位是「比上一代好的中階模型」,而不是「領先業界的工作馬」。社群上的「3 週一次降價」敘事,掩蓋了 Google 在旗艦 Pro 與企業級 agent 兩個維度上仍然沒有突破的現實。


🚨 留言區兩派對嗆:到底是好模型還是過渡產品?

Hacker News 留言區(480 分 / 297 則回應)大致分成兩派:

「Gemini 又回來了」派(nickandbro 等):認為 3.7 Flash 在 benchmark 上壓過 Sonnet 5 但價格只要一半,是 Google 重新回到賽局裡的證據。

「Google 已經落後」派(jjcm 等 75-reply 熱門 thread):認為即使在高速這個定位,Cerebras Sol preview + GPT-5.6 Luna 都在追、甚至超車;更別說 API key 申請還是要走 8 個 GCP dashboard — 「high friction 又 non-pareto」,真的不知道什麼情境會第一個選它。中間派的 euazOn 提出最尖銳的問題:「多模態很強,但純文字任務用 3.7 Flash 的價值在哪?DS V4 便宜 13–26 倍、智力差不多、多家 inference providers 都能用。」


影片:用 Gemini 3.7 Flash 跑 Google Antigravity 實測

Google 官方 Antigravity 頻道在發表當天上架了一支實測影片,示範怎麼用 Gemini 3.7 Flash 跑網站審計 + 自動優化(用 /goal 內建指令把 Lighthouse 分數拉到滿分):


🚨 業界高層怎麼看

  • Sundar Pichai(Google CEO):「Flash 是 CP 值最高的工作馬,所以我們頻繁迭代。3.6 Flash 才三週,3.7 Flash 在 coding 跟 agent 工作上都有明顯進步。」
  • Tulsee Doshi(Gemini 產品資深總監):「3.7 Flash 會用 2026 年底前的特價方案,搭配更強的模型效能,讓開發者跟企業客戶能把 production-ready agent 規模化。」
  • The Rundown AI(@TheRundownAI, X):「$0.75 / $3.75 per M tokens 把 Sonnet 5、GPT-5.6 Terra、Muse Spark 1.2 全部砍到半價以下。但 Reuters 同時報導旗艦 Gemini 推遲兩個月 — 看得出來 Google 把『快速廉價』當作短期戰略,把『Pro 旗艦』留到更晚。」

接下來看什麼

  • 2026/12/31:3.7 Flash 特價到期,價格翻倍。觀察有多少 production pipeline 在那之前完成遷移。
  • 2026 年 Q4:Gemini 旗艦 Pro 預計釋出(Reuters 報導被推遲兩個月)。觀察 Google 是否能在 frontier 級 agentic 工作流上重新領先。
  • 2027 年 1 月起:DeepSeek V5、Kimi K4、Luna 後繼模型會不會繼續以更低的價格衝擊 Flash 系列定位。
  • Google Antigravity:這個 agent-first IDE 才剛起步,是 Google 把 3.7 Flash 推向量產開發者的一個關鍵灘頭堡。

參考來源

網友熱門留言 (8)

#1 jjcm (HN) ▲ 75
做了一個 image→html 測試。Gemini 在視覺任務上一直是「以小搏大」的代表,這次迫不及待拿來試。把設計稿轉成網頁,Opus 5 還是同類最佳,但跟價格更接近的對手比起來,3.7 Flash 跟 Grok 4.6 都追得很近。我以前都覺得 Gemini 在這類任務會把 Grok 海放,結果這次 Grok 真的追上來了。
#2 wxw (HN) ▲ 26
Google 應該把 benchmark 拿去對 Luna / Terra 比較才對。Luna 便宜很多,等於直接打掉 Flash 的存在意義。Flash 系列在我印象裡一直是給「低成本、高量、偏文字」的任務用(摘要、解析、格式化),重點在低價。編按:原 Po 補充 Google 有放 benchmark,更像是 Terra 對位而不是 Luna,中階模型的差異化真的很難做。
#3 Alifatisk (HN) ▲ 23
自從 GPT-5.6 Luna 那個不可思議的折扣之後,什麼新模型都很難讓我興奮了。你看 benchmark 就知道,3.7 Flash 在 DeepSWE 雖然不錯,但 Luna (Max) 還是強很多。我個人一直用 Luna (Xhigh),對我來說已經很夠,而且不會因為堆 reasoning tokens 把 context window 撐爆。Luna 是 $0.2/1M input(cache $0.02)跟 $1.2/1M output。
#4 simonw (HN) ▲ 18
3.7 Flash 這個「introductory pricing」真的很怪。它排程在 2026/12/31 漲一倍,但誰會預期自己五個月後還在用這個模型?3.6 Flash 才三個禮拜前才出啊!我先用預設 thinking 跑了一隻「ambitious pelican」SVG(被一輛壞掉的腳踏車拖下水),換成 high / medium / low thinking 之後前兩者跑出很不錯的成果。Safari 顯示正常,但 Firefox / Chrome 會壞掉(疑似是 Gemini 產生了不合法的空 filter 元素)。
#5 twelvechairs (HN) ▲ 16
Gemini 一直以來的賣點還是速度,特別是 end-to-end response time。Artificial Analysis 那邊有完整評測。
#6 jjcm (HN, depth 1 回覆) ▲ 45
其他想法:我真的覺得 Google 已經落後了。即使是高速這個定位(這個 build 跑 ~7 分鐘算很快了),他們也沒辦法撐太久的主導權 — 今天 Cerebras 才剛發 Sol preview,OpenAI GPT-5.6 Sol 速度起來更恐怖。3.7 Flash 不是不好,但我不知道什麼情境會讓我第一個選它。Google 真的需要差異化,更別說 API key 還超難申請(要走 8 個 dashboard),這樣 high friction 又 non-pareto 真的不行。
#7 euazOn (HN) ▲ 11
多模態能力是真的強,可是純文字任務用這個的價值在哪?DS V4 Flash / Pro 便宜 13–26x、智力差不多、而且多家 inference providers 都能用。我真的看不出有什麼 use case 是 3.7 Flash 比 DS 好的。
#8 nickandbro (HN) ▲ 6
這真的是一個有競爭力的模型 — 幾乎所有 benchmark 都贏 Claude Sonnet 5,但價格只有一半。Google 算是回到賽局裡了,雖然不再是 frontier 領頭羊。