← 返回 Siami 首頁

OpenAI 高層早就知道「盜版書籍訓練 AI」違法 還怕 Hacker News 爆料比怕法律多

▲ 168 💬 119
OpenAI 高層早就知道「盜版書籍訓練 AI」違法 還怕 Hacker News 爆料比怕法律多

編按:本文綜合整理自 Authors Guild 官方聲明 與 Publishers Weekly、AI Lawsuit Tracker 等報導,並加入 Siami 編輯部觀點與分析。

紐約(2026 年 9 月 21 日)在「美國作家協會 v. OpenAI」這樁指標性著作權訴訟中,上週四公開的最新法庭文件揭露了一個驚人的內部對話——OpenAI 的研究員承認,他們真正擔心的不是觸法,而是這件事登上 Hacker News 後會引發的公關風暴。

這份由原告律師團提交、作為「部分即決判決」動議附件的法律簡報,引用了大量 OpenAI 與微軟內部的 Slack 對話、email 與證詞錄影,逐條拼湊出這兩家公司如何明知故犯地使用盜版書籍來訓練 GPT 模型。


OpenAI 高層對「取代人類作家」的態度:不是意外,是設計

早在 2020 年 5 月,時任 OpenAI 政策總監 Jack Clark 就在內部通訊中直言:

「我們在 AI 與創造力方面的工作,將越來越走向創造出能取代人類勞動的系統。GPT 模型做得越好,類型小說作家就越會擔心我們在亞馬遜上取代他們。」

他接著補刀:

「我們在這個領域的工作會讓人失業。會出現一個時間點,一堆藝術家對我們做的事情表達擔憂,我們很可能會忽略他們的擔憂,然後照樣把產品釋出。」

換句話說,OpenAI 在 2020 年就已經白紙黑字知道自家技術會衝擊寫作者生計,但內部共識是「照做再說」。


「Project Clear」:系統性毀滅證據

簡報中揭露了 OpenAI 內部一個代號「Project Clear(淨化行動)」的清理計畫。2022 年 6 月 15 日,OpenAI 企業代表 Paino 在 Slack 頻道發問:

「一般提問:我們對到處在 Google Docs、Slack、GitHub 出現的『libgen』字眼有多擔心?」

當晚,OpenAI 研究副總裁 Bob McGrew 回信給 Paino 與法務 Nick Ryder:

「考慮到 OpenAI 現在新聞曝光度這麼高,現在正是把 LibGen 從我們的系統與儲存中切除的時機。要怎麼做?」

LibGen 是俄羅斯最大的影子圖書館之一,長期被視為學術與出版業的「潘朵拉盒子」。OpenAI 員工內部稱其為「那個有點 sketchy 的俄羅斯網站」,但這正是他們訓練 GPT 的核心資料來源之一。


微軟 2019 年就知道 OpenAI 用盜版書

最讓外界震驚的,是微軟對此事的「知情時點」。簡報指出:

  • 2019 年 4 月,Sam Altman 與時任 OpenAI 研究總監 Dario Amodei 向比爾蓋茲展示 GPT-3 早期版本
  • 當時就主動揭露訓練資料使用了 LibGen
  • 在場知情者包含微軟 CTO Kevin Scott

也就是說,微軟從 2019 年起就知道合作夥伴 OpenAI 使用盜版書籍,卻仍持續投入數十億美元合作。這對微軟主張「不知情」的抗辯無疑是致命一擊。


「我們怕的是 Hacker News 上的 optics」

整份簡報中最具新聞價值的一句話,來自 OpenAI 研究員 Sam McCandlish。當 Dario Amodei 形容 LibGen「作訓練資料來源有點 sketchy」時,McCandlish 回應:

「我只是擔心 optics——也就是『OpenAI 使用來自 sketchy 俄羅斯網站的版權資料』這種標題出現在 Hacker News 上會很糟糕。」

不是法律風險、不是作者權益、不是市場倫理——OpenAI 內部最擔心的是科技社群的形象。

這句話被直接寫進了法庭文件,也成為 Hacker News 上 168 分、119 則留言討論的導火線。


「可接受的經濟破壞」:研究員的真心話

OpenAI 在 2022 年聘請 Tarun Gogineni 負責改善模型的寫作品質。Gogineni 的「研究使命」是讓 GPT 寫完 George R.R. Martin 的《冰與火之歌》系列最後兩本書,甚至說:

「就算 GRRM 早逝,我也能放心地知道 GPT-5 會自動補完他的系列。」

更驚人的是,他完全清楚作者圈的不滿,卻在內部備忘錄中寫道:

  • 作者抱怨「資料集是偷來的」,他認為「不太值得同情」
  • 這是「可接受的經濟破壞」
  • 世界很快就會經歷「讀者的死亡」,因為「機器會為機器生產更多 slop」

為什麼這件事重要

這份簡報不只是法律攻防的文件,它同時是 AI 產業內部文化的一次完整暴露。三個值得所有科技工作者關注的訊號:

  1. 「合法 vs. 可接受」的界線被刻意模糊:OpenAI 不是無知犯法,而是在 2019 年就知道、2020 年內部承認會造成失業、2022 年系統性毀滅證據。這是「企業級的有意圖侵權」。
  2. 微軟無法切割:微軟 CTO 在 2019 年就被告知。他們現在主張「我們只是雲端供應商」會非常難以立足。
  3. 「Optics」心態是科技業的通病:當一家公司最大的恐懼是 Hacker News 標題,而不是受害者權益,這背後的價值觀問題比法律問題更深。

數據解讀與質疑

原告團現在要求法院做出部分即決判決(partial summary judgment),意即他們認為事實已經清楚到不需要進到陪審團審理階段。從法律實務角度,必須注意三個限制:

  • 「知道使用 LibGen」不等於「每一本書都未授權」——OpenAI 仍可主張部分訓練資料有合理使用空間
  • 「Project Clear」發生在 2022 年 6 月,但訴訟早在 2023 年 9 月才提起,中間的銷毀時間點是否構成「毀滅證據」仍待法官裁定
  • 微軟被告知的是 Sam Altman 的口頭簡報,內部是否有正式決策紀錄尚未公開

法官 Sidney H. Stein 預計 2027 年初會進入聽證程序。這將是「AI 訓練是否構成合理使用」這個世紀法律問題的第一個真正具有指標意義的判決。


參考來源

網友熱門留言 (4)

#1 Hacker News 用戶 cisc ▲ 187
他們就是為了訓練模型而盜版了書籍。這些書對 AI 公司顯然有價值,但他們太弱也太不老實,不願意付費購買。
#2 Hacker News 用戶 Jtarii ▲ 94
他們其實可以直接買下所有書,結果還是一樣。但顯然作者應該告到他們破產。
#3 Hacker News 用戶 Skyy93 ▲ 71
這是一個遊說團體只挑自己喜歡的片段來推動自己的議程。但他們確實花了大量努力來避免逐字複製的情形發生。
#4 Hacker News 用戶 michaelt ▲ 56
曾幾何時,個人使用的侵權幾乎不算犯罪,但企業為商業目的的侵權是嚴重的事。現在是時候把 OpenAI 當成商業侵權者對待了。