← 返回 Siami 首頁

Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS:30 秒音訊就能複製聲音、Hume AI 語音設計榜首

▲ 256 💬 124
Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS:30 秒音訊就能複製聲音、Hume AI 語音設計榜首

Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS:30 秒音訊就能複製聲音、Hume AI 語音設計榜首

編按:本文綜合整理自 Google 官方部落格、Hume AI 語音設計基準、Voice Arena 排行榜、Hacker News 開發者討論、NDTV Profit 報導、MarkTechPost 技術分析,並加入 Siami 編輯部觀點與分析。

Google 於 2026 年 9 月 23 日正式推出兩個新的文字轉語音(text-to-speech, TTS)模型:Gemini 3.8 Flash TTSGemini 3.8 Flash-Lite TTS。這是 Google 把語音生成從「30 個預設聲音」升級成「無限聲音庫」的一次重大產品定位改變 — 使用者可以用自然語言提示,從零創造全新的角色聲音,也可以用 30 秒的錄音複製自己的聲音,並且逐行程式化導演每句台詞的情緒、節奏、語氣。


一句話打造全新聲音:從 30 個預設升級到「無限聲音庫」

過去 Gemini TTS 只提供 30 個預設聲音,使用者只能在固定清單裡挑選。這次 3.8 Flash TTS 把整個玩法翻過來:你可以用一段普通英文描述(例如「墨爾本的高能量 DJ 風格」、「細小單調的機器人」、「日本神話裡的龍」),模型就會從零生成完全原創的角色聲音。

更關鍵的是「Voice Replication」功能:只要提供 30 秒的參考音訊(必須是有授權的聲音),系統就會建立一致的聲音設定檔。Google 強調這項功能有完整的「consent verification」機制:使用者必須提供一段由聲音本人念出的同意錄音,且與參考樣本的聲紋相符,才會允許複製。

這個設計直接把 TTS 從「配音員的玩具」推向「小說作者、podcaster、遊戲開發者、語言學習 app」的大眾創作市場。Hacker News 用戶 Multicomp 正是因為這個原因興奮 — 他在做 Star Trek 粉絲有聲劇,先前用 GPT-Live 一直無法讓每個角色的聲音足夠獨特,現在 Gemini 3.8 的 voice design 直接解決他的痛點。


不只能選聲音,還能「導演」每一句台詞

新模型的另一個突破是「line-by-line 導演」能力。傳統 TTS 只能接受一整段文字一次輸出,但 Gemini 3.8 Flash TTS 內建 dual-speaker screenplay editor,使用者可以:

  1. 為每個角色指派不同的聲音設定檔
  2. 為每一行台詞指定情緒標記(興奮、悲傷、緊張、低語)
  3. 調整節奏、停頓、重音
  4. 加入 scene direction(導演指令)但不會被念出來

這等於把 TTS 從「讀稿機」升級成「配音工作室」。Simon Willison 在實際測試後特別稱讚這個對話模式 — 他 vibe-coded 一個 playground UI 來試,發現「conversation mode 很棒」,而且即使反覆試驗,花費也「不到一分錢」。

對開發者更實用的是 Google AI Studio 直接內建了 voice design workspace,使用者可以在介面上 prompt 出全新的聲音設定,再丟進 dual-speaker screenplay editor 導演整場戲,最後透過 Gemini API 整合到自家產品。


基準排行:Hume AI 第一、Voice Arena 多語言領先

Google 這次附上了兩個第三方基準的成績,顯示新模型在「自訂語音」這個新戰場上的領先地位:

基準Gemini 3.8 Flash TTS 成績對手
Hume AI Voice Design Benchmark(整體)71.4 分(#1)其他語音設計模型
Hume AI Voice Design Benchmark(口音建模)60.8 分(#1)其他語音設計模型
Hume AI Overall Quality Index#1(Flash)與 #2(Flash-Lite)Gemini 3.1 Flash TTS 等
Voice Arena(盲測人類偏好)多語言榜首日語、巴西葡語、越南語、阿拉伯語、墨西哥西語、印度英語

Voice Arena 的盲測覆蓋超過 100 種語言,這意味著 Google 不只在英語拿下領先,在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語、印度英語這些「非英語大語種」也都進入榜首。這對全球在地化配音、跨國客服機器人、多語言學習 app 是直接利多。


安全機制:SynthID 浮水印、語音同意驗證、地區限制

Google 在聲音複製這個敏感功能上疊了三層保護:

  • Consent Verification(同意驗證):使用者必須上傳一段由聲音本人念出的同意錄音,且與參考樣本的聲紋相符。這是針對「拿別人聲音亂用」的第一道防線。
  • SynthID 浮水印:所有 Gemini Audio 模型生成的音訊都會嵌入 SynthID 隱形浮水印,這是 DeepMind 開發的 AI 生成內容識別技術,即使被剪輯、轉檔也保留偵測能力。
  • 地區限制:語音複製功能在伊利諾州、德州、歐洲經濟區、英國、瑞士、印度不開放。這是因為這些地區對個資與生物特徵有更嚴格的法規(美國的 BIPA 與歐盟 GDPR 都對聲紋這種生物特徵有專門規範)。

但 Hacker News 用戶 accountrequired 對同意驗證的長期資料保存提出質疑:「這份同意錄音會被存多久?會出什麼問題?」這是個合理的追蹤點 — Google 沒有在公告中具體說明留存期限與存取權限。


怎麼開始用、找誰整合

新模型今天起就陸續上線,覆蓋以下通路:

  • Google AI Studio:內建 voice design workspace,可直接試
  • Gemini API:透過 aistudio.google.com/docs/speech-generation 文件呼叫
  • Gemini Enterprise:企業版同步開放
  • Gemini NotebookGoogle Vids:消費端產品也開始整合
  • 第三方開發者平台:Agora、LiveKit、Pipecat、Vercel 都已加入 Gemini API 文件

首波合作夥伴則是 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang — 這些公司把 Gemini 3.8 TTS 整合進自己的服務,主攻全球配音(global dubbing)、在地化媒體、規模化對話語音代理。

對台灣開發者來說,最直接的入口是 Vercel AI Gateway(文件已更新到支援 Gemini TTS),如果本來就在用 Vercel 部署 AI 應用,直接加幾行就能呼叫。


為什麼這件事重要

這次發表的時機跟策略值得拆開看:

第一,Google 在「自訂語音」這個細分市場上明顯是後進者 — ElevenLabs 早在 2023 年就靠 voice cloning 打出名號,OpenAI 的 Voice Engine 雖然謹慎但也已經在 2024 年開始擴展。Google 過去幾年對 TTS 採取保守態度,甚至曾因為怕被濫用而拒絕釋出某些模型(HN 用戶 sharktheone 特別提到這個轉變:「他們幾年前拒絕釋出 TTS,因為怕被濫用。現在毫無顧忌地發表,時代變了」)。這次大動作意味著競爭壓力已經蓋過風險顧慮。

第二,Hume AI Voice Design Benchmark 上 71.4 分的成績是「綜合能力」的展現,不是單一指標。Hume AI 的評分涵蓋情緒表達、口音控制、年齡感、性別感、語速、停頓位置等多個維度 — 拿下 #1 代表 Google 不只能在某一項特別強,而是整體可用度達到生產等級。

第三,與 Gemini 3.8 Live、3.8 Live Extended Thinking 同步推進,Google 在「語音 AI」這個領域的產品線已經從「語音助理」延伸到「語音創作工具」。前者是消費端 B2C 應用,後者則是創作者與企業 B2B 應用。雙軌推進對 ElevenLabs、PlayHT、Resemble AI 等獨立 TTS 廠商是直接衝擊。

對台灣與中文市場的具體影響是:過去要做有聲書、podcast、遊戲配音的最大成本是「配音員工時 + 錄音室租金」,現在 30 秒音訊 + 一段文字描述就能產出專業級聲音。獨立創作者與小型工作室的進入門檻直接砍半。


數據解讀與質疑

幾個值得追蹤的數字與懸念:

  • 71.4 分的對手是誰? Hume AI 沒在公告中列出第二名、第三名的分數與模型名稱。Google 只說「#1」,但沒有提供完整的對比表。建議等 Voice Arena 或 Artificial Analysis 等獨立平台放出完整 leaderboard 再下判斷。
  • Voice Replication 的 30 秒門檻真的夠嗎? ElevenLabs 最低要求是 1 分鐘以上、OpenAI Voice Engine 是 15 秒。Google 用 30 秒屬於中間值。實際聲音相似度(speaker similarity cosine)需要等第三方獨立測試,目前 Google 沒公開這個指標。
  • 費用曲線不明。 Simon Willison 說「大部分實驗不到一分錢」,但這是單次短文本的費用。如果做有聲書(每本 8 萬字),實際帳單會是多少?Google 沒在公告中給出 per-character 或 per-minute 定價。
  • 地區限制的範圍可能擴大。 伊利諾州、德州、歐洲、英國、瑞士、印度 — 這六個地區的禁用涵蓋了相當多英語市場。隨著各國對 deepfake 與 AI 聲音的法規收緊,地區限制可能繼續擴大,使用前要先確認所在地的可近性。
  • SynthID 浮水印能不能被有效移除? Google 與 DeepMind 多年來都聲稱 SynthID 對剪輯、轉檔、加速有抵抗力,但第三方研究(特別是 2024-2025 年的對抗性攻擊研究)已展示部分破解方法。在 deepfake 攻防持續升級的當下,這層保護不能視為絕對安全。

參考資料

網友熱門留言 (6)

#1 rcr-anti 0
Google AI 發布的最大問題是 consumer / prosumer / cloud 三個平台沒有對齊,每次發表都要捲到最底看不同平台的可用性,模型跨平台的能力也不同。Omni Flash 在消費端是 video + text output...
#2 simonw 0
我 vibe-coded 一個 playground UI 來測試這個。Conversation mode 很棒,但費用很貴 — 我大部分實驗花不到一分錢。Gemini TTS 的文字欄位嚴格當作逐字稿,要控制 delivery 又不想讓導演指令被讀出來,要把指令拆到不同欄位。
#3 thangalin 0
我做了一個 Emotive Audiobook Creator (KeenLore),本地架設、不用付 token。我用完整的角色陣容讀一本書。引文歸屬偵測(針對我的小說)達到 97.2% 準確率。
#4 Multicomp 0
我在做 Star Trek 粉絲有聲劇(已到 S2E17),想讓每個場景以有聲書方式被讀出來。GPT-Live 的聲音不夠獨特、難以表達我腦中的 voice direction。Gemini 3.8 看起來就是為這種使用情境設計的。
#5 nater5000 0
我在 AI Studio 用 Voice Design 生聲音時碰到 error,而且 voice replication 在我所在地區不能用。英文也沒有 'neutral gender' 的選項...
#6 sharktheone 0
他們幾年前因為怕被濫用拒絕釋出 TTS 模型,現在卻毫無顧忌地發表。時代變了。