Google 在 8 月 14 日擊敗 AI 訓練新創 Mercor,以 1,000 萬美元在 Spirit Airlines 破產拍賣會上贏得一整批企業內部資料,包括 1 億封員工郵件、5 億則 Microsoft Teams 對話紀錄、超過 3,000 萬通客服錄音、60 萬張 ServiceNow 工單,以及 763,000 個航班、500 萬筆機組員組配對、120 萬張加油單的營運數據。Google 在簡短聲明中表示,這批資料「可用於改善該公司旗下的產品與 Gemini 系列 AI 模型」。
編按:本文綜合整理自 The Register 原始報導、Business Insider 拍賣內幕、Axios 法院文件摘要、Hacker News 討論串、9to5Google 編輯分析,並加入 Siami 編輯部觀點與分析。
拍賣發生了什麼事
Spirit Airlines 在 2020 年 COVID-19 期間開始虧損,資產負債表再也回不到安全水位,2026 年 5 月正式永久停飛,進入清算程序。破產律師團隊從 8 月初開始處分剩餘資產,其中最大的一塊「非實體資產」就是這批資料。Google 先出價 500 萬美元,AI 訓練資料新創 Mercor 立刻以 520 萬美元反擊,並提出「如果能先拿到原始資料再自行匿名化,願意加碼到 700 萬美元」。Google 最後直接把價格拉到 1,000 萬美元,把整批打包帶走。
依據 PJT Partners 副總裁 Dylan Friesner 提交的法院文件,這批資料並不包含乘客個資、信用卡號、忠誠會員資料等可以直接對應到消費者的欄位,僅限於內部營運端的企業資料。Google 已承諾會在收到資料後,由第三方再做一次 PII 清洗,並主動放棄任何嘗試重新識別身份的行為。
| 資料類型 | 數量 | 涵蓋範圍 |
|---|---|---|
| 員工郵件 | 1 億封 | 行銷、HR、專案管理、財會 |
| Microsoft Teams 對話 | 5 億則 | 跨部門協作、即時通訊 |
| OneDrive 檔案 | 1,700 萬份 | 文件、試算表、簡報 |
| SharePoint 內容 | 2,050 萬項 | 內部文件管理系統 |
| 客服錄音 | 3,000 萬通 | 真人電話應答紀錄 |
| 客服文字紀錄 | 1,500 萬則 | 即時對話 chat log |
| ServiceNow 工單 | 60 萬張 | IT 與營運事件單 |
| Oracle Responsys 行銷資料 | 1,370 萬筆 | 電郵行銷名單 |
| 航班紀錄 | 76.3 萬筆 | 執飛、維修、調度 |
| 機組員組配對 | 500 萬筆 | 排班最佳化 |
| 加油單 | 120 萬張 | 燃油成本精算 |
| 機上 Wi-Fi 銷售 | 1,100 萬筆 | 乘客付費體驗 |
| 維修零件採購 | 78.7 萬筆 | 採購供應鏈 |
為什麼這件事重要
這不是又一個「科技公司買資料訓練 AI」的單獨事件,這是 2026 年 AI 訓練資料爭奪戰升級到「企業破產清算變成現成資料市集」的分水嶺事件。過去十年,AI 公司主要靠爬公開網頁(Common Crawl、書籍、學術論文、程式碼)累積訓練語料,但 2025 年之後,公開資料的邊際報酬急速遞減。各家 lab 開始把目光轉向三類「非公開但合法的資料源」:企業內部通訊紀錄、客服中心對話、產業專屬資料。Spirit 這 1 億封郵件加 5 億則 Teams 紀錄,剛好一次補齊 Google 在「真實企業書面溝通」這個維度上欠缺多年的家底。
更具戰略意義的是,這批資料的「結構性」極強。客服錄音與對話紀錄本身就帶有明確的「問題—解決」對結構,機組員組配對與航班紀錄帶有時間序列的營運因果,加油單與零件採購則補上供應鏈的數字端。比起從 Reddit 抓一卡車閒聊對話,這批資料的「可學習訊號密度」高得多。Google 拿這套資料去 fine-tune 一個專門處理企業客戶服務、營運 SOP、內部流程諮詢的垂直模型,理論效果會遠比通用模型更貼近實戰。
而從產業面來看,這次競標揭示了一個新的「破產資料套利」商業模式。Spirit 才剛進入清算,就已經有 AI 訓練公司願意砸 750 萬美元搶標,未來只要任何一家中型企業倒閉,這批內部郵件、Slack/Teams 紀錄、CRM 資料、薪資系統匯出都可能變成待價而沽的 AI 訓練燃料。企業從此多了一條隱性資產負債表上的「資料處分價值」項目,連法務、HR 都得開始思考:「平常寫的內部信,會在破產後變成哪家公司模型的訓練素材?」
「Google 取得了 Spirit Airlines 的一部份企業資料集,可以用來改善 Google 的產品與 AI 模型。Google 不會從這份資料集收到任何個資;任何 Google 收到的資料,都會在交付前由第三方嚴格清洗掉所有可識別個人的資訊。」
— Google 發言人對 Axios 的聲明
最後,這也是 Mercor 等「純 AI 訓練資料供應商」與「AI 模型自營者」之間資源落差的一次具體展示。Mercor 在這場競標裡只能當配角,但也意味著未來會有更多「資料代理」型的新創企業崛起,專門在破產清算、併購重整、歇業拍賣等場合代理買方或賣方,把過去被當成「垃圾資產」的企業內部資料變現。
爭議點與質疑
1.「去識別化」到底可不可信? Business Traveler 引述的法院文件顯示,銷售協議規定買方必須保留「referential integrity」(資料之間的參考完整性),意思是不同記錄之間的關聯必須保留下來,但同時必須移除可以對應到個人的欄位。這兩件事在實務上互相矛盾:保留關聯意味著「誰寄給誰、什麼時候、附什麼附件」這些中繼資料還在,只是把姓名欄拿掉。對 Google 這種擁有頂級 NLP 能力、又有十億 Gmail 帳戶當對照實驗室的買家而言,這層「去識別化」能不能真的擋住 re-identification,理論上仍是個開放問題。The Register 編輯部直接寫道:「The Register 正在等待(不可避免的)SNAFU 證據出現,也就是有一天某人的個資因為某個 prompt 或搜尋被吐了出來。」
2. 拍賣本身的程序正當性。 AI 訓練新創 Mercor 在拍賣中曾提議「先拿到原始資料再自行匿名化」這個對消費者更友善的方案,但被法院駁回,最後只拿到 750 萬美元的次順位。如果 Spirit 的受託人採用 Mercor 的提議,這 1,000 萬美元的全額可以維持,但代價是資料在移交前必須徹底重新處理;現在的程序讓 Google 承擔清洗義務,反而替 Google 省了一道前置作業。破產律師選了「價格最高」的選項,但從消費者保護的角度,未必是「對社會成本最低」的選項。
3. 訓練資料「來自一家破產公司」的諷刺感。 某位 HN 留言者直接吐槽:「要訓練一家公司怎麼搞到破產,請問還有什麼比這更完美的訓練素材?」這個說法雖然是黑色幽默,但觸及一個更深的問題:如果 AI 模型要在「真實企業內部溝通」上學習,它學到的是「怎麼讓一家廉價航空多撐兩年」這種逆境的訊號,還是「怎麼在內部報告中掩飾財務黑洞」這種訊號?訓練語料本身的政治經濟學,會直接影響模型在真實職場輔助上做出的判斷。
4. 個資疑慮的延伸:員工端。 雖然乘客資料被明確排除,但 1 億封員工郵件、HR 資料、薪資單、績效考核紀錄,全部都會被 Google 拿走。Business Insider 引述的法律專家指出,這些員工從未同意自己的內部通訊「在離職後變成 AI 訓練燃料」,而 Spirit 的隱私權條款就算寫得很寬,也未必覆蓋到「公司被賣掉、賣給一個完全不同的產業買家」這種情境。歐盟 GDPR 在這種跨國資料移轉下會自動啟動更嚴格的同意審查,但 Spirit 是美國公司,目前適用的是美國破產法,員工的同意權遠比歐洲薄弱。
後續追蹤與時間軸
這樁交易仍須經美國紐約南區破產法院 Sean H. Lane 法官批准,庭審訂於 2026 年 8 月 19 日舉行。法官的決定會影響三件事:
- 批准:Google 在資料清洗後開始實際接收,預計 9 月底前第一批可用於 fine-tune Gemini 系列模型的版本就會開始訓練。
- 駁回:可能迫使 Spirit 重新拍賣,或要求 Google 對清洗流程提出更詳細的可審計規範。
- 附條件批准:要求 Google 提交外部稽核報告、定期接受獨立隱私審查,這會把整個流程拉長 3-6 個月。
值得關注的是,這不是孤例。8 月初 Anthropic 才被揭露砸了上百萬美元購買冥想 App 與保健網站的「真實用戶對話紀錄」做模型微調;OpenAI 也在洽談與多家 SaaS 公司談合作,取得客服中心對話轉成訓練資料。Spirit 案一旦完成交割,將會成為 AI lab 與破產受託人之間的第一份「標準模板」,未來 12 個月內預計還會有 5-10 家中大型企業的內部資料循類似管道流入 Gemini、Claude、GPT 的下一代模型。
Siami 編輯部會持續追蹤這個案子的法官裁定結果,以及 Google 是否會在清洗流程中揭露具體的 PII 移除率、去識別化失敗案例數量、以及實際使用這批資料的模型版本與訓練目的。
本文資料來源(依引用順序):The Register 8/18 原報 → Business Insider 拍賣內幕 → Axios 摘要 → 9to5Google 分析 → Hacker News 討論串 → Business Traveler 法律檢視
網友熱門留言 (5)