← 返回 Siami 首頁

Google 以 1,000 萬美元標下 Spirit 航空 1 億封郵件與 5 億則 Teams 對話:用破產航空公司的內部資料訓練 AI

▲ 348 💬 229
Google 以 1,000 萬美元標下 Spirit 航空 1 億封郵件與 5 億則 Teams 對話:用破產航空公司的內部資料訓練 AI

Google 在 8 月 14 日擊敗 AI 訓練新創 Mercor,以 1,000 萬美元在 Spirit Airlines 破產拍賣會上贏得一整批企業內部資料,包括 1 億封員工郵件、5 億則 Microsoft Teams 對話紀錄、超過 3,000 萬通客服錄音、60 萬張 ServiceNow 工單,以及 763,000 個航班、500 萬筆機組員組配對、120 萬張加油單的營運數據。Google 在簡短聲明中表示,這批資料「可用於改善該公司旗下的產品與 Gemini 系列 AI 模型」。

編按:本文綜合整理自 The Register 原始報導、Business Insider 拍賣內幕、Axios 法院文件摘要、Hacker News 討論串、9to5Google 編輯分析,並加入 Siami 編輯部觀點與分析。


拍賣發生了什麼事

Spirit Airlines 在 2020 年 COVID-19 期間開始虧損,資產負債表再也回不到安全水位,2026 年 5 月正式永久停飛,進入清算程序。破產律師團隊從 8 月初開始處分剩餘資產,其中最大的一塊「非實體資產」就是這批資料。Google 先出價 500 萬美元,AI 訓練資料新創 Mercor 立刻以 520 萬美元反擊,並提出「如果能先拿到原始資料再自行匿名化,願意加碼到 700 萬美元」。Google 最後直接把價格拉到 1,000 萬美元,把整批打包帶走。

依據 PJT Partners 副總裁 Dylan Friesner 提交的法院文件,這批資料並不包含乘客個資、信用卡號、忠誠會員資料等可以直接對應到消費者的欄位,僅限於內部營運端的企業資料。Google 已承諾會在收到資料後,由第三方再做一次 PII 清洗,並主動放棄任何嘗試重新識別身份的行為。

資料類型數量涵蓋範圍
員工郵件1 億封行銷、HR、專案管理、財會
Microsoft Teams 對話5 億則跨部門協作、即時通訊
OneDrive 檔案1,700 萬份文件、試算表、簡報
SharePoint 內容2,050 萬項內部文件管理系統
客服錄音3,000 萬通真人電話應答紀錄
客服文字紀錄1,500 萬則即時對話 chat log
ServiceNow 工單60 萬張IT 與營運事件單
Oracle Responsys 行銷資料1,370 萬筆電郵行銷名單
航班紀錄76.3 萬筆執飛、維修、調度
機組員組配對500 萬筆排班最佳化
加油單120 萬張燃油成本精算
機上 Wi-Fi 銷售1,100 萬筆乘客付費體驗
維修零件採購78.7 萬筆採購供應鏈

為什麼這件事重要

這不是又一個「科技公司買資料訓練 AI」的單獨事件,這是 2026 年 AI 訓練資料爭奪戰升級到「企業破產清算變成現成資料市集」的分水嶺事件。過去十年,AI 公司主要靠爬公開網頁(Common Crawl、書籍、學術論文、程式碼)累積訓練語料,但 2025 年之後,公開資料的邊際報酬急速遞減。各家 lab 開始把目光轉向三類「非公開但合法的資料源」:企業內部通訊紀錄、客服中心對話、產業專屬資料。Spirit 這 1 億封郵件加 5 億則 Teams 紀錄,剛好一次補齊 Google 在「真實企業書面溝通」這個維度上欠缺多年的家底。

更具戰略意義的是,這批資料的「結構性」極強。客服錄音與對話紀錄本身就帶有明確的「問題—解決」對結構,機組員組配對與航班紀錄帶有時間序列的營運因果,加油單與零件採購則補上供應鏈的數字端。比起從 Reddit 抓一卡車閒聊對話,這批資料的「可學習訊號密度」高得多。Google 拿這套資料去 fine-tune 一個專門處理企業客戶服務、營運 SOP、內部流程諮詢的垂直模型,理論效果會遠比通用模型更貼近實戰。

而從產業面來看,這次競標揭示了一個新的「破產資料套利」商業模式。Spirit 才剛進入清算,就已經有 AI 訓練公司願意砸 750 萬美元搶標,未來只要任何一家中型企業倒閉,這批內部郵件、Slack/Teams 紀錄、CRM 資料、薪資系統匯出都可能變成待價而沽的 AI 訓練燃料。企業從此多了一條隱性資產負債表上的「資料處分價值」項目,連法務、HR 都得開始思考:「平常寫的內部信,會在破產後變成哪家公司模型的訓練素材?」

「Google 取得了 Spirit Airlines 的一部份企業資料集,可以用來改善 Google 的產品與 AI 模型。Google 不會從這份資料集收到任何個資;任何 Google 收到的資料,都會在交付前由第三方嚴格清洗掉所有可識別個人的資訊。」
— Google 發言人對 Axios 的聲明

最後,這也是 Mercor 等「純 AI 訓練資料供應商」與「AI 模型自營者」之間資源落差的一次具體展示。Mercor 在這場競標裡只能當配角,但也意味著未來會有更多「資料代理」型的新創企業崛起,專門在破產清算、併購重整、歇業拍賣等場合代理買方或賣方,把過去被當成「垃圾資產」的企業內部資料變現。


爭議點與質疑

1.「去識別化」到底可不可信? Business Traveler 引述的法院文件顯示,銷售協議規定買方必須保留「referential integrity」(資料之間的參考完整性),意思是不同記錄之間的關聯必須保留下來,但同時必須移除可以對應到個人的欄位。這兩件事在實務上互相矛盾:保留關聯意味著「誰寄給誰、什麼時候、附什麼附件」這些中繼資料還在,只是把姓名欄拿掉。對 Google 這種擁有頂級 NLP 能力、又有十億 Gmail 帳戶當對照實驗室的買家而言,這層「去識別化」能不能真的擋住 re-identification,理論上仍是個開放問題。The Register 編輯部直接寫道:「The Register 正在等待(不可避免的)SNAFU 證據出現,也就是有一天某人的個資因為某個 prompt 或搜尋被吐了出來。」

2. 拍賣本身的程序正當性。 AI 訓練新創 Mercor 在拍賣中曾提議「先拿到原始資料再自行匿名化」這個對消費者更友善的方案,但被法院駁回,最後只拿到 750 萬美元的次順位。如果 Spirit 的受託人採用 Mercor 的提議,這 1,000 萬美元的全額可以維持,但代價是資料在移交前必須徹底重新處理;現在的程序讓 Google 承擔清洗義務,反而替 Google 省了一道前置作業。破產律師選了「價格最高」的選項,但從消費者保護的角度,未必是「對社會成本最低」的選項。

3. 訓練資料「來自一家破產公司」的諷刺感。 某位 HN 留言者直接吐槽:「要訓練一家公司怎麼搞到破產,請問還有什麼比這更完美的訓練素材?」這個說法雖然是黑色幽默,但觸及一個更深的問題:如果 AI 模型要在「真實企業內部溝通」上學習,它學到的是「怎麼讓一家廉價航空多撐兩年」這種逆境的訊號,還是「怎麼在內部報告中掩飾財務黑洞」這種訊號?訓練語料本身的政治經濟學,會直接影響模型在真實職場輔助上做出的判斷。

4. 個資疑慮的延伸:員工端。 雖然乘客資料被明確排除,但 1 億封員工郵件、HR 資料、薪資單、績效考核紀錄,全部都會被 Google 拿走。Business Insider 引述的法律專家指出,這些員工從未同意自己的內部通訊「在離職後變成 AI 訓練燃料」,而 Spirit 的隱私權條款就算寫得很寬,也未必覆蓋到「公司被賣掉、賣給一個完全不同的產業買家」這種情境。歐盟 GDPR 在這種跨國資料移轉下會自動啟動更嚴格的同意審查,但 Spirit 是美國公司,目前適用的是美國破產法,員工的同意權遠比歐洲薄弱。

後續追蹤與時間軸

這樁交易仍須經美國紐約南區破產法院 Sean H. Lane 法官批准,庭審訂於 2026 年 8 月 19 日舉行。法官的決定會影響三件事:

  • 批准:Google 在資料清洗後開始實際接收,預計 9 月底前第一批可用於 fine-tune Gemini 系列模型的版本就會開始訓練。
  • 駁回:可能迫使 Spirit 重新拍賣,或要求 Google 對清洗流程提出更詳細的可審計規範。
  • 附條件批准:要求 Google 提交外部稽核報告、定期接受獨立隱私審查,這會把整個流程拉長 3-6 個月。

值得關注的是,這不是孤例。8 月初 Anthropic 才被揭露砸了上百萬美元購買冥想 App 與保健網站的「真實用戶對話紀錄」做模型微調;OpenAI 也在洽談與多家 SaaS 公司談合作,取得客服中心對話轉成訓練資料。Spirit 案一旦完成交割,將會成為 AI lab 與破產受託人之間的第一份「標準模板」,未來 12 個月內預計還會有 5-10 家中大型企業的內部資料循類似管道流入 Gemini、Claude、GPT 的下一代模型。

Siami 編輯部會持續追蹤這個案子的法官裁定結果,以及 Google 是否會在清洗流程中揭露具體的 PII 移除率、去識別化失敗案例數量、以及實際使用這批資料的模型版本與訓練目的。


本文資料來源(依引用順序):The Register 8/18 原報 → Business Insider 拍賣內幕 → Axios 摘要 → 9to5Google 分析 → Hacker News 討論串 → Business Traveler 法律檢視

網友熱門留言 (5)

#1 Hacker News 用戶 (igregoryca) ▲ 12
作為一個對破產程序不太熟悉的人:為什麼他們要獨家拍賣資料存取權?不能同時開放給前 N 名買家嗎?這樣不是能賣更高價?
#2 Hacker News 用戶 ▲ 9
訓練一家破產公司的資料?— 還有什麼比這更適合用來訓練『如何搞垮一家公司』的模型?
#3 Hacker News 用戶 (theodpHN) ▲ 7
請問 12 億名 Spirit 乘客:有誰去翻過 Spirit 隱私權條款裡的『資料收集與使用主要目的』,確認 Google 這次用法有沒有超出原本同意的範圍?
#4 Hacker News 用戶 ▲ 5
我在 Twitter 上看到資料會在交付前由第三方完整去識別化、移除 PII。據說 Google 的目的是訓練企業辦公類的 LLM。
#5 Hacker News 用戶 ▲ 4
是該立法了:企業一旦破產,所有資料必須自動銷毀,不能拿來補償債權人或股東。我完全想不出這個案子會有任何好的結局。