← 返回 Siami 首頁

Google 同日雙發 Gemini 3.8 Live 與 Extended Thinking 語音代理首次站上 Pareto Frontier

▲ 165 💬 106
Google 同日雙發 Gemini 3.8 Live 與 Extended Thinking 語音代理首次站上 Pareto Frontier

Google 同日雙發:Gemini 3.8 Live 與 3.8 Live Extended Thinking

Google 9 月 15 日正式發表 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,定位為旗下「最先進的即時對話模型」。兩者在智慧與平行推理能力上大幅升級,目的是讓使用者用聲音就能直覺地協作 AI、執行複雜任務。兩款模型的分工明確:

  • Gemini 3.8 Live:主打規模化與成本效益,結合對話智慧、流暢的語音對話與視覺脈絡理解。
  • Gemini 3.8 Live Extended Thinking:鎖定高複雜度任務,提供更強的智慧與多步驟推理能力。對開發者與企業而言,這兩款模型提供「可靠、可上線的語音代理」所需的基本組件;對一般使用者,則讓 Gemini App、Google Workspace 與 Search 的語音互動更流暢、更具協作感。

為什麼這件事重要過去兩年,AI 語音助理始終停留在「能聽懂、但不能做事」的階段:使用者講一句話、模型回一句,再講一句、再回一句,所有複雜邏輯都被迫中斷對話。Gemini 3.8 Live 系列真正改變的是「對話不再被打斷」這件事——模型可以在使用者還在說話的同時,於背景執行工具呼叫、視覺辨識、跨語言翻譯、預訂流程,然後用「讓我查一下⋯⋯」之類的語氣詞自然接話,讓人類感覺 AI 真的「在聽、在想」。

想像一下:你走進一間公司,手機相機對著同事,Gemini 3.8 Live 正在幫新人做 onboarding;你用中文問,AI 用日文跟另一個新人對答;同時 AI 還在背景幫你訂機票、查航班。這在 2025 年是 demo,在 2026 年 9 月,是 Google 正式上線的產品。對企業端的意義更直接:客服、行銷、業務開發長久以來被「語音 bot 太笨」拖累,現在 ServiceNow 的 EVA-Bench 顯示 Gemini 3.8 Live 系列已經站上 Pareto Frontier——也就是同樣準確度下對話品質最好,同樣對話品質下準確度最高。這代表企業可以第一次認真考慮「語音優先」的客戶體驗設計。


關鍵 benchmark 一次看

Google 在公告中公布了多項業界指標:

  • Artificial Analysis「Speech to Speech Quality Index」:82.6 分,第一名(3.8 Live Extended Thinking)
  • τ-Voice(agentic task completion):68.6%,領先業界
  • Sierra τ-Voice-banking:35.1%
  • Big Bench Audio:97.7%
  • Speech Agent Arena:第二名(Gemini 3.8 Live)
  • ServiceNow EVA-Bench:Pareto Frontier(同場公告評測影片)

3.8 Live(標準版)則以「Speech Agent Arena 第二名」證明用戶偏好,同時維持高成本效益——對需要大規模部署的開發者來說,這是關鍵指標。


視覺脈絡 + 背景任務:對話不再卡住

Gemini 3.8 Live 最關鍵的升級是兩件事:

  1. 視覺輸入即時處理:模型可以「邊看邊聽」。官方示範中,Gemini 3.8 Live 即時看懂西洋棋盤、走下一步棋,同時用人話解釋為什麼這樣走。
  2. 背景任務執行:當 AI 正在幫你查航班、訂餐廳時,對話可以繼續。模型會用「讓我查一下⋯⋯」自然地接話,最後把結果無縫帶回。更厲害的是 3.8 Live Extended Thinking 展示的「同時推理 + 同時說話」:模型一邊思考,一邊用口語向使用者報告進度,不再像傳統語音助理那樣「轉圈圈十秒、然後丟結果」。官方 demo 包含把草稿圖即時轉成 React 元件、用語音協調多步驟訂位流程、一句話生成完整商業計畫與行銷工具包。語言覆蓋方面,3.8 Live 自動偵測並切換 97 種語言——這對台灣、香港、東南亞市場意義重大,使用者可以用混雜中英文與 AI 對話,模型不再當機。

開發者生態系:七大平台 + 三大企業夥伴

3.8 Live 透過 Gemini Live API 對接七大開發者平台:

  • AgoraFishjamLangChainLiveKitPipecatVercelVision Agents

這些平台處理即時媒體串流的複雜基礎設施,讓開發者專注在使用者體驗設計。對台灣開發者來說,LiveKit 與 Pipecat 是熟面孔——前者開源、後者經常出現在繁中技術社群。企業夥伴方面,Google 點名 Salesforce、Genspark、Lumeris 三家已採用 3.8 Live,特別強調其「低延遲、流暢、tool-calling 能力」。


SynthID 浮水印:所有 AI 音訊強制標記

Google 同步強調,所有 3.8 Live 生成的音訊都會內嵌 SynthID 浮水印——肉眼不可察覺,但可被偵測。這是 Google 對抗 AI 生成音訊詐騙(電話語音克隆、假總統語音等)的標準對策。完整的 model card 已公開於 Google DeepMind 網站。對台灣社會的意義在於:隨著 2024-2025 年 deepfake 電話詐騙在亞洲爆發,SynthID 的普及讓執法機關、銀行客服可以「先驗證再信任」AI 語音。這是產業級別的資安防線,不是單一公司的事。


怎麼用:今天就上線

Gemini 3.8 Live(標準版)

  • 開發者:Gemini API、Google AI Studio
  • 企業:Gemini Enterprise 私有預覽版(即將上線 Customer Experience)
  • 一般使用者:Search Live

Gemini 3.8 Live Extended Thinking

  • 開發者:Gemini API、Google AI Studio
  • 企業:Gemini Enterprise 私有預覽版(即將上線 Workspace 商業版)
  • 一般使用者:Gemini Live、Workspace Docs(Google AI Pro / Ultra 訂閱者)、Gmail 與 Keep(所有 Google AI 訂閱者)

數據解讀與質疑

為什麼 Extended Thinking 要付費,標準版免費?

Google 把 Extended Thinking 鎖在 Google AI Pro / Ultra 訂閱層(每月約 $20 / $250),這呼應 Anthropic Claude、OpenAI o-series 的「推理模型加值策略」。對開發者而言,標準版 3.8 Live 才是真正大眾化的入口,Extended Thinking 是「企業級」加值品。

為什麼 Speech Agent Arena 3.8 Live 只拿第二?

第一名尚未公告,但業界猜測可能是 OpenAI 的 Realtime API 更新版或 Anthropic Claude 的語音模式。Google 自己也承認「用戶偏好評比」會持續波動。但「第二名 + 高 CP 值」的組合對企業部署來說通常比「第一名 + 貴三倍」更有吸引力。

為什麼沒看到 GPT-4o 或 Realtime 直接對標的 benchmark?

Google 這次刻意挑選 Artificial Analysis、τ-Voice、EVA-Bench 這類「agentic task」基準(不是純語音品質),避開與 OpenAI Realtime 在「自然對話感」上的正面交鋒。這是行銷策略——選對自己有利的賽道。

對台灣使用者的影響?

Workspace Docs Live、Gmail Live、Keep Live 對繁中支援度尚待驗證,Google 過去對繁中處理的品質參差(特別是台灣用語 vs 港式用語 vs 中國簡體)。建議企業在導入前先小規模測試。


Siami 觀點

編按:本文綜合整理自 Google 官方 blog 公告Gemini 3.8 Audio Model Card 與 Artificial Analysis 公開評測資料,並加入 Siami 編輯部觀點與分析。這是 Google 在語音 AI 領域「從追趕到並跑」的關鍵節點。OpenAI Realtime 2024 年發表時,Google 確實落後半年;2025 年 Gemini 2.0 系列開始追近;2026 年 9 月的 3.8 Live Extended Thinking,則讓 Google 第一次在「企業級語音代理」這個細分賽道上站到 Pareto Frontier 上。對台灣創業圈與企業 IT 的實質建議:

  1. 客服系統升級窗口已開:如果你還在用「按 1 轉業務、按键 9 重聽」的 IVR,現在是認真評估 AI 語音代理的時機。ServiceNow EVA-Bench 的 Pareto Frontier 結果代表「品質 + 成本」已達甜蜜點。
  2. 教育與 onboarding 場景值得實驗:官方 demo 中的「新員工 onboarding」是台灣中小企業最痛的需求之一,3.8 Live 的視覺脈絡能力正好對應。
  3. 不要忽視 SynthID 帶來的合規紅利:當 deepfake 詐騙成為社會問題,使用有 SynthID 標記的 AI 語音服務會是「負責任企業」的形象資產。

網友熱門留言 (4)

#1 Hacker News 用戶 ▲ 287
Google 把 Extended Thinking 鎖在 Pro/Ultra 訂閱,標準版 3.8 Live 反而是更實用的入口。Speech Agent Arena 第二名 + Pareto Frontier 是合理定位。
#2 Hacker News 用戶 ▲ 156
終於可以在對話中切換 97 種語言了,跨國客服的痛點一次解決。但實際繁中品質還是要測試,Google 對繁中的支援一直參差不齊。
#3 Hacker News 用戶 ▲ 134
SynthID 強制浮水印這步走對了。現在 deepfake 電話詐騙這麼多,企業如果不用有 SynthID 的語音服務,未來合規風險會很高。
#4 Hacker News 用戶 ▲ 98
把 chess demo 跟 React 元件 demo 放一起蠻聰明的——一個是「娛樂向 AI」、一個是「生產力向 AI」,剛好對應 B2C 跟 B2B 兩個市場。