Google 推出 Gemini 3.8 Flash TTS 與 Flash-Lite TTS:30 秒音訊就能複製聲音、Hume AI 語音設計榜首
編按:本文綜合整理自 Google 官方部落格、Hume AI 語音設計基準、Voice Arena 排行榜、Hacker News 開發者討論、NDTV Profit 報導、MarkTechPost 技術分析,並加入 Siami 編輯部觀點與分析。
Google 於 2026 年 9 月 23 日正式推出兩個新的文字轉語音(text-to-speech, TTS)模型:Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS。這是 Google 把語音生成從「30 個預設聲音」升級成「無限聲音庫」的一次重大產品定位改變 — 使用者可以用自然語言提示,從零創造全新的角色聲音,也可以用 30 秒的錄音複製自己的聲音,並且逐行程式化導演每句台詞的情緒、節奏、語氣。
一句話打造全新聲音:從 30 個預設升級到「無限聲音庫」
過去 Gemini TTS 只提供 30 個預設聲音,使用者只能在固定清單裡挑選。這次 3.8 Flash TTS 把整個玩法翻過來:你可以用一段普通英文描述(例如「墨爾本的高能量 DJ 風格」、「細小單調的機器人」、「日本神話裡的龍」),模型就會從零生成完全原創的角色聲音。
更關鍵的是「Voice Replication」功能:只要提供 30 秒的參考音訊(必須是有授權的聲音),系統就會建立一致的聲音設定檔。Google 強調這項功能有完整的「consent verification」機制:使用者必須提供一段由聲音本人念出的同意錄音,且與參考樣本的聲紋相符,才會允許複製。
這個設計直接把 TTS 從「配音員的玩具」推向「小說作者、podcaster、遊戲開發者、語言學習 app」的大眾創作市場。Hacker News 用戶 Multicomp 正是因為這個原因興奮 — 他在做 Star Trek 粉絲有聲劇,先前用 GPT-Live 一直無法讓每個角色的聲音足夠獨特,現在 Gemini 3.8 的 voice design 直接解決他的痛點。
不只能選聲音,還能「導演」每一句台詞
新模型的另一個突破是「line-by-line 導演」能力。傳統 TTS 只能接受一整段文字一次輸出,但 Gemini 3.8 Flash TTS 內建 dual-speaker screenplay editor,使用者可以:
- 為每個角色指派不同的聲音設定檔
- 為每一行台詞指定情緒標記(興奮、悲傷、緊張、低語)
- 調整節奏、停頓、重音
- 加入 scene direction(導演指令)但不會被念出來
這等於把 TTS 從「讀稿機」升級成「配音工作室」。Simon Willison 在實際測試後特別稱讚這個對話模式 — 他 vibe-coded 一個 playground UI 來試,發現「conversation mode 很棒」,而且即使反覆試驗,花費也「不到一分錢」。
對開發者更實用的是 Google AI Studio 直接內建了 voice design workspace,使用者可以在介面上 prompt 出全新的聲音設定,再丟進 dual-speaker screenplay editor 導演整場戲,最後透過 Gemini API 整合到自家產品。
基準排行:Hume AI 第一、Voice Arena 多語言領先
Google 這次附上了兩個第三方基準的成績,顯示新模型在「自訂語音」這個新戰場上的領先地位:
| 基準 | Gemini 3.8 Flash TTS 成績 | 對手 |
|---|---|---|
| Hume AI Voice Design Benchmark(整體) | 71.4 分(#1) | 其他語音設計模型 |
| Hume AI Voice Design Benchmark(口音建模) | 60.8 分(#1) | 其他語音設計模型 |
| Hume AI Overall Quality Index | #1(Flash)與 #2(Flash-Lite) | Gemini 3.1 Flash TTS 等 |
| Voice Arena(盲測人類偏好) | 多語言榜首 | 日語、巴西葡語、越南語、阿拉伯語、墨西哥西語、印度英語 |
Voice Arena 的盲測覆蓋超過 100 種語言,這意味著 Google 不只在英語拿下領先,在日語、巴西葡萄牙語、越南語、現代標準阿拉伯語、墨西哥西班牙語、印度英語這些「非英語大語種」也都進入榜首。這對全球在地化配音、跨國客服機器人、多語言學習 app 是直接利多。
安全機制:SynthID 浮水印、語音同意驗證、地區限制
Google 在聲音複製這個敏感功能上疊了三層保護:
- Consent Verification(同意驗證):使用者必須上傳一段由聲音本人念出的同意錄音,且與參考樣本的聲紋相符。這是針對「拿別人聲音亂用」的第一道防線。
- SynthID 浮水印:所有 Gemini Audio 模型生成的音訊都會嵌入 SynthID 隱形浮水印,這是 DeepMind 開發的 AI 生成內容識別技術,即使被剪輯、轉檔也保留偵測能力。
- 地區限制:語音複製功能在伊利諾州、德州、歐洲經濟區、英國、瑞士、印度不開放。這是因為這些地區對個資與生物特徵有更嚴格的法規(美國的 BIPA 與歐盟 GDPR 都對聲紋這種生物特徵有專門規範)。
但 Hacker News 用戶 accountrequired 對同意驗證的長期資料保存提出質疑:「這份同意錄音會被存多久?會出什麼問題?」這是個合理的追蹤點 — Google 沒有在公告中具體說明留存期限與存取權限。
怎麼開始用、找誰整合
新模型今天起就陸續上線,覆蓋以下通路:
- Google AI Studio:內建 voice design workspace,可直接試
- Gemini API:透過
aistudio.google.com/docs/speech-generation文件呼叫 - Gemini Enterprise:企業版同步開放
- Gemini Notebook 與 Google Vids:消費端產品也開始整合
- 第三方開發者平台:Agora、LiveKit、Pipecat、Vercel 都已加入 Gemini API 文件
首波合作夥伴則是 Figma、HeyGen、Linguana、Wondercraft、99.co、Ollang — 這些公司把 Gemini 3.8 TTS 整合進自己的服務,主攻全球配音(global dubbing)、在地化媒體、規模化對話語音代理。
對台灣開發者來說,最直接的入口是 Vercel AI Gateway(文件已更新到支援 Gemini TTS),如果本來就在用 Vercel 部署 AI 應用,直接加幾行就能呼叫。
為什麼這件事重要
這次發表的時機跟策略值得拆開看:
第一,Google 在「自訂語音」這個細分市場上明顯是後進者 — ElevenLabs 早在 2023 年就靠 voice cloning 打出名號,OpenAI 的 Voice Engine 雖然謹慎但也已經在 2024 年開始擴展。Google 過去幾年對 TTS 採取保守態度,甚至曾因為怕被濫用而拒絕釋出某些模型(HN 用戶 sharktheone 特別提到這個轉變:「他們幾年前拒絕釋出 TTS,因為怕被濫用。現在毫無顧忌地發表,時代變了」)。這次大動作意味著競爭壓力已經蓋過風險顧慮。
第二,Hume AI Voice Design Benchmark 上 71.4 分的成績是「綜合能力」的展現,不是單一指標。Hume AI 的評分涵蓋情緒表達、口音控制、年齡感、性別感、語速、停頓位置等多個維度 — 拿下 #1 代表 Google 不只能在某一項特別強,而是整體可用度達到生產等級。
第三,與 Gemini 3.8 Live、3.8 Live Extended Thinking 同步推進,Google 在「語音 AI」這個領域的產品線已經從「語音助理」延伸到「語音創作工具」。前者是消費端 B2C 應用,後者則是創作者與企業 B2B 應用。雙軌推進對 ElevenLabs、PlayHT、Resemble AI 等獨立 TTS 廠商是直接衝擊。
對台灣與中文市場的具體影響是:過去要做有聲書、podcast、遊戲配音的最大成本是「配音員工時 + 錄音室租金」,現在 30 秒音訊 + 一段文字描述就能產出專業級聲音。獨立創作者與小型工作室的進入門檻直接砍半。
數據解讀與質疑
幾個值得追蹤的數字與懸念:
- 71.4 分的對手是誰? Hume AI 沒在公告中列出第二名、第三名的分數與模型名稱。Google 只說「#1」,但沒有提供完整的對比表。建議等 Voice Arena 或 Artificial Analysis 等獨立平台放出完整 leaderboard 再下判斷。
- Voice Replication 的 30 秒門檻真的夠嗎? ElevenLabs 最低要求是 1 分鐘以上、OpenAI Voice Engine 是 15 秒。Google 用 30 秒屬於中間值。實際聲音相似度(speaker similarity cosine)需要等第三方獨立測試,目前 Google 沒公開這個指標。
- 費用曲線不明。 Simon Willison 說「大部分實驗不到一分錢」,但這是單次短文本的費用。如果做有聲書(每本 8 萬字),實際帳單會是多少?Google 沒在公告中給出 per-character 或 per-minute 定價。
- 地區限制的範圍可能擴大。 伊利諾州、德州、歐洲、英國、瑞士、印度 — 這六個地區的禁用涵蓋了相當多英語市場。隨著各國對 deepfake 與 AI 聲音的法規收緊,地區限制可能繼續擴大,使用前要先確認所在地的可近性。
- SynthID 浮水印能不能被有效移除? Google 與 DeepMind 多年來都聲稱 SynthID 對剪輯、轉檔、加速有抵抗力,但第三方研究(特別是 2024-2025 年的對抗性攻擊研究)已展示部分破解方法。在 deepfake 攻防持續升級的當下,這層保護不能視為絕對安全。
參考資料
- Google 官方公告:Gemini 3.8 text-to-speech says hello
- Hume AI Voice Design Benchmark 完整排行
- Voice Arena 公開 leaderboard
- Hacker News 開發者討論(256 分,124 則留言)
- Gemini 3.8 Flash TTS 模型卡(DeepMind 官方)
- NDTV Profit 報導:100 種語言支援與企業版發布
- MarkTechPost 技術分析:Prompt-based voice design
- The Next Web:30 秒聲音複製功能深度評測
- Simon Willison 的 playground UI 實測
- Gemini API 文字轉語音官方文件
網友熱門留言 (6)