← 返回 Siami 首頁

微軟高管私稱 AI 抓取是「人類史上最大勞動竊盜」 紐時告 OpenAI 案揭內部鐵證

▲ 560 💬 465
微軟高管私稱 AI 抓取是「人類史上最大勞動竊盜」 紐時告 OpenAI 案揭內部鐵證

編按:本文綜合整理自 TechCrunch紐約時報Ars Technica,並加入 Siami 編輯部觀點與分析。

紐約時報三年前對 OpenAI 與微軟提起的著作權訴訟,近日再公開一批未經遮蔽的法院文件,內容直接顯示微軟高層私下把 AI 訓練用資料的抓取行為描述為「竊盜」,而 OpenAI 內部高層也承認自家模型對「訓練素材的供應者」構成「生存威脅」。

這批新曝光的證據不只戳破了兩家公司對外「合理使用」的說辭,也首次披露他們如何繞過付費牆、大規模抓取、甚至刻意移除訓練資料中的版權聲明,整個 AI 內容供應鏈的爭議在本週進入新一波高峰。


內部鐵證:微軟高層自己也承認這是「竊盜」

根據法院解封的訴狀內容,微軟應用科學總監 Brent Hecht 在 2023 年 1 月的內部備忘錄中,把 AI 訓練資料的抓取行為稱為:

「規模前所未見的驚人竊盜(an astonishing theft of unprecedented proportions)」

並直言這可能是「人類史上最大規模的勞動竊盜」。這段話原本被列為機密,這次因為時序與引用脈絡被解封而成為公開紀錄。

不只 Hecht,微軟執行長 Satya Nadella 也在今年稍早的宣誓證詞中坦言:「任何付費牆後的內容,無論是為了『grounding』還是訓練,都應該取得授權才能使用。」他進一步指出,若他早知道 OpenAI「抓取並訓練了付費牆後的資訊」,他會「動用微軟的權利,要求 OpenAI 重訓模型」。

這段證詞的重要性在於:微軟不只是被動的投資者或雲端供應商,而是從頭到尾參與資料取得、模型訓練、產品上線的共同決策者


OpenAI 自家高層也承認「我們會取代他們」

解封文件同時揭露,OpenAI 內部對 AI 對新聞業的威脅有過多次明確評估。OpenAI ChatGPT 產品主管 Nick Turley 內部寫道:

出版商正面臨來自 ChatGPT 等產品的「生存威脅(existential threat)」,這些產品「本質上是替代性的(largely substitutive),而且會隨著模型越來越好而越來越具替代性」。

OpenAI 總裁 Greg Brockman 更直接稱自家模型「非常擅長新聞內容」。Nadella 也同意,在宣誓證詞中承認:「與聊天機器人對話,已經取代了使用者必須去原始網站取得資訊的需求。」

這些內部說法在法律上的殺傷力極大:合理使用(fair use)的核心要件之一,就是使用行為不能實質取代原作品的市場。當 AI 公司自家高層承認「我們會取代他們」,合理使用這條防線幾乎守不住。


「毀滅迴圈」:微軟自家數據顯示 Copilot 讓紐時流量暴跌 93%

這次解封最關鍵的數字,藏在微軟自己內部的一場簡報裡。Hecht 在 2024 年 1 月的內部文件中寫道,Copilot「答案引擎」讓紐約時報官網的點擊率比傳統 Bing 搜尋最高掉了 93%。他用「毀滅迴圈(doom loop)」來形容這個現象:

「最終產品威脅到自身關鍵供應商的經濟基礎,這在商業史上極不常見,但這正是我們的 LLM 業務對『內容供應鏈』所創造的局面。」

這段話的諷刺意味在於:微軟自己預見到自己正在摧毀自己模型的「原料來源」,卻仍然持續推出產品。換句話說,AI 公司內部早已知道模型會吃掉內容供給端的生計,卻選擇繼續往前衝


規模前所未見:91,692 份訓練素材、200 萬篇 nytimes.com 文件

除了高層的言論,文件也首次披露 AI 訓練資料的具體規模:

  • OpenAI 的中段訓練資料集,僅來自紐時、每日新聞與調查報導中心的部分,就含 91,692 份以上
  • 一份衍生自 Common Crawl 的資料集,光 nytimes.com 就收錄 超過 200 萬份文件
  • 微軟與 OpenAI 透過「Project Taxi」「Project Mango」兩個內部專案交換資料,其中 Mango 資料集包含至少 160,903 份獨立新聞作品

更令人側目的是,當 OpenAI 研究員 Nick Ryder 向 Brockman 報告「找到一個繞過紐時付費牆的方法」時,Brockman 的回覆只有兩個字:「ah nice」。文件還指出,OpenAI 員工刻意從訓練資料中移除版權聲明,理由是「不希望模型在使用者面前輸出含有版權標示的內容」。


法律戰升溫:合理使用防線可能守不住

這批新證據選在一個敏感的時間點曝光。本月稍早,川普政府遞交了一份支持 OpenAI 的法庭之友意見書,主張未授權使用受著作權保護的素材來訓練大型語言模型應屬於合理使用。但這批內部文件呈現的恰恰是相反的故事:兩家公司的內部不只承認行為本質是「竊盜」,還系統性地規避法律設計(付費牆)並掩蓋痕跡(移除版權標示)。

紐時律師團隊的核心論點正在成形:合理使用的市場替代性測試(market substitution test)要求使用行為不能實質損害原作市場,而 93% 流量下滑、模型「本質上是替代性的」這些自白,已構成教科書級的「市場損害」證據。


為什麼這件事重要

這場官司不只是「紐時 vs. OpenAI」的單一爭議,而是全球第一個針對 AI 訓練階段大規模著作權侵害的代表性案例。它的判決結果將決定:

  • 新聞業能否繼續存活:若 AI 抓取被認定合法,所有依賴訂閱與廣告的新聞媒體將面臨系統性萎縮
  • 合理使用的現代定義:1976 年著作權法沒預見到「無限可複製的 AI 實體」的出現,法院必須擴張或限縮傳統解釋
  • AI 產業的成本結構:若判決不利於 AI 公司,所有未授權訓練的模型都將面臨追溯與重訓風險

更值得關注的是,這批證據來自被告自己——微軟與 OpenAI 內部高層的電子郵件、備忘錄與證詞。這代表訴訟雙方都不否認這些話曾被說過,辯論的核心不再是「有沒有發生」,而是「發生了算不算違法」。


數據解讀

把這批數字放在一起看,會發現一個殘酷的對比:

指標數字
Copilot 對紐時的點擊率衝擊最高 -93%
OpenAI 中段訓練資料中的原告作品數91,692 份以上
Common Crawl 衍生資料集的 nytimes.com 文件超過 200 萬份
Project Mango 資料集中的新聞作品至少 160,903 份

如果一個行業的客戶來源被自家產品吃掉 93%,這個行業幾乎不可能靠市場機制自我修復。這也是為什麼這場官司會走到法院——因為市場機制已經失靈,只有法律強制才能讓 AI 公司停下來重新評估成本

值得注意的是,這次曝光的只是原告方的「自家版本」,許多原始展證仍處於封存狀態。換句話說,公開的證據可能只是冰山一角,若進入審判階段,這些原始郵件與訓練日誌將面對雙方律師的直接詰問。


業界與社群反應

在 Hacker News 上,這篇文章短短幾天衝上 816 分、710 則留言,留言區呈現高度兩極:

  • 強烈批判方(@jacquesm、@tom2026hn 等)認為 AI 公司本質上是「把文化搶走再用更高價格賣回來」
  • 反方(@47282847、@wj 等)則質疑這跟傳統爬蟲、搜尋引擎訓練有何本質不同
  • 有趣的是,@sajithdilshan 的留言「我會以為答案是奴隸制」獲得廣泛共鳴,顯示 AI 爭議已經從「技術抄襲」升級到「倫理與歷史定位」層次

這場討論不會在短時間內結束。隨著案件進入實質審理,下一波曝光的內部文件,很可能再次改變整個產業的走向。


本文原文為 TechCrunch 報導,經 Siami 編輯部繁體中文化並加入編按觀點。資料來源:TechCrunchThe New York TimesArs TechnicaAI Lawsuit TrackerHacker News 討論串

網友熱門留言 (8)

#1 HN @jacquesm ▲ 170
這是把我們的文化全部搶走,再用更高的價格賣回給我們的罪行。這種規模的犯罪是違反人類的罪行。地球上最值錢的公司,很可能就是從這種犯罪中誕生的。
#2 HN @haritha-j ▲ 120
我不理解為什麼有人說『人類從書上學習並不違法』。有些人難道不懂法律只在特定規模下才有意義嗎?一個人學完進入職場,與無限可複製的實體做同樣的事,前者對原作需求影響微乎其微,後者則取代了 99% 的需求。
#3 HN @sajithdilshan ▲ 50
如果有人問我『人類史上最大的勞動竊盜是什麼』,我會以為答案是奴隸制。
#4 HN @47282847 ▲ 170
『資訊應該是自由的』這句話根本是錯的。工作早就做完了。如果這算犯罪,那也只是『智慧財產』(也就是『著作權侵權』)的問題,不是『勞動』的問題。
#5 HN @tom2026hn ▲ 30
問題不只是『偷走人類勞動的成果』,而是同時壓低人類技能的價值,甚至搶走人類的工作。
#6 HN @Neil44 ▲ 80
我理解這種情緒,也部分同意。但重點是,原作並沒有消失。你是免費拿到一個原本只給訂閱者的東西。
#7 HN @wj ▲ 20
這跟微軟之前抓資料做 Bing 搜尋有什麼不同?這條界線究竟在哪裡?誠心發問。
#8 HN @TutleCpt ▲ 20
最令人震驚的是,他們竟然有一位真正懂自己在做什麼的微軟高層。