編按:本文綜合整理自 Ars Technica 與原始一手報導 404 Media 的調查結果,並加入 Siami 編輯部觀點與分析。
科技媒體 404 Media 與 Ars Technica 近日揭露一件 AI 訓練產業的爭議事件:一支被偷偷塞進稀有書籍內頁的 Apple AirTag,最終定位到亞馬遜位於內華達州拉斯維加斯的 AI 訓練倉儲 VGT3。這個倉儲的團隊專門負責「撕書、掃描」,把成箱的稀有舊書從書脊拆開後送進光學掃描設備,目的單一:把頁面文字餵進亞馬遜的前沿 AI 模型。事件曝光後,外界對生成式 AI 訓練資料來源的透明度問題,再度被推到聚光燈下。
一支 AirTag 戳破的祕密
過去一年多,歐美獨立書商一直有個難以證實的懷疑:大型 AI 公司大量收購稀有絕版書籍,掃描完後就把書丟掉。但因為買家透過中間人與公司名稱遮掩身分,書商始終無法指名道姓。直到 404 Media 找來一位願意合作的書商,把 AirTag 夾進一批稀有書其中一本裡,這枚定位器最終在亞馬遜 VGT3 倉庫的辦公桌上被找到,連同那本被追蹤的書一起「抵達終點」。
更令人側目的是,VGT3 倉儲團隊在自己的門上掛了一個看起來像玩笑的 Logo:一隻暴龍(Tyrannosaurus rex)張口要把一本書整吞下肚。這個意象對長期關心書籍保存的社群來說格外刺眼,因為它幾乎是「這支團隊就是要把這本書毀掉」的視覺宣言。
「這枚 AirTag 從下單、運送、收件一路回報位置,最後停在亞馬遜在拉斯維加斯的 AI 訓練倉儲——這等於是科技巨頭親自簽名承認了毀書掃描的行為。」— 404 Media 編輯 Jason Koebler 對該調查的描述。
亞馬遜的回應:繞過問題核心
亞馬遜在被 Ars Technica 與 404 Media 詢問時,並未否認這個倉儲的存在或運作模式,僅提供制式聲明:
「亞馬�透過商業管道購買書籍,以協助開發與改善顧客使用的產品與服務。」
這段聲明沒有提到「AI」、「訓練」、「掃描」任何一個關鍵字。對照亞馬�正在與 Google、OpenAI、Anthropic 在前沿模型市場正面交鋒的事實,這個模糊回應並未緩解外界疑問——尤其是 Anthropic 與 xAI 已經公開表示不會以稀有古籍作為訓練素材,亞馬遜卻選擇保持沉默。
此外,404 Media 引述 VGT3 員工在論壇上的討論指出,今年稍早亞馬遜的書源一度「徹底耗盡」,員工甚至擔心倉庫會因此關門。短缺過後,亞馬遜又回頭下大量稀有書訂單,並繼續「撕書、掃描、丟棄」流程,這段敘事讓「商業管道」說法顯得格外蒼白。
行業為何走向「撕書掃描」這條路
要把整本紙本書送進大型語言模型,最快的方式不是 OCR 軟體慢慢辨識,而是把書脊切開、用工業掃描機拍下頁面,再把影像轉成模型可讀的文字。這個流程:
- 速度快:工業設備每分鐘可掃描數十頁;
- 資料乾淨:直接拍攝紙面可以避開 OCR 對古字、註解、版面的誤判;
- 書反而成了廢料:掃描完的紙本沒有保存價值,通常直接進入紙類回收。
正因為效率極高,這條「撕書掃描」供應鏈在 2024 至 2025 年快速成形——包含 Google 在內的多家公司都被外界質疑採行類似作法。相對地,OpenAI 在 2024 年被作家協會與《紐約時報》提起的多起著作權訴訟中,被指控「未授權使用書籍內容」,正是因為訓練資料來源與「是否取得授權」至今仍缺乏透明揭露。
為什麼這件事重要
這起事件不只是單一公司的公關危機,而是整個前沿 AI 產業的「訓練資料黑箱」問題被攤開在陽光下。三層意義值得拆開來看:
- 法律層面:英國、愛爾蘭與美國部分州已通過或正在審議 AI 訓練資料透明法案,要求企業揭露使用受著作權保護素材的範圍。亞馬遜「不承認、不否認」的態度,正好踩在這些新法的紅線上。
- 文化層面:稀有書籍往往是絕版學術著作、初版文學、歷史文獻的「唯一已知存本」。蘇格蘭書商 Derek Walker 對 BBC 表示:「如果一本書是某個版本的唯一存世樣本,卻被買走銷毀,那是完全不同等級的損失。」
- 競爭層面:當 Anthropic、xAI 公開宣告不使用稀有書籍,等於是把自己的訓練資料倫理標準寫成對外宣傳。亞馬遜此時被揭穿,等同把這張「倫理牌」從對手手中搶過來,反過來打在自己臉上。
對台灣與華語 AI 圈來說,這也是一面鏡子:中文世界大量的絕版學術書、史料、地方誌並沒有進入任何 AI 訓練流程——但若有一天中文模型需要擴增資料,「撕書掃描」是否會被複製到華語市場,是值得提前關注的產業警訊。
數據解讀:訓練資料荒與稀有書供應鏈
- AI 訓練資料缺口:多家研究機構估算,到 2026 年中「高品質人類文字」資料的可用存量已接近耗盡。Epoch AI 在 2024 年報告指出,常見網路文字存量約在 2027 年前會用完;稀有印刷書被視為「最後一座尚未被大規模開採的礦山」。
- 稀有書需求暴增:書商指出,2024 年起收到大量「以整批為單位」的神秘採購,每批動�數百本以上。多家書商開始拒絕此類訂單,並在網路論壇互通訊息。
- 隱私反向揭露:這次 AirTag 並非亞馬遜植入,而是書商為了「證明買家身分」主動放置。這代表隱私工具(AirTag)反向被當作「反企業隱蔽採購」的調查利器,是一個值得記下的社會學現象。
- 產業連鎖效應:若亞馬遜被迫公開訓練資料來源,可能牽動 Google、Meta 等同樣大量採購印刷品的公司;對小型 AI 實驗室而言,「我有乾淨的訓練資料」反而可能成為新的競爭賣點。
目前的延伸發展
- 404 Media 已將 AirTag 軌跡、倉庫外觀與員工論壇截圖彙整成調查報導。
- 美國出版商協會(Association of American Publishers)尚未正式表態,但內部已在討論是否對亞馬�與同類採購行為發起聯合聲明。
- 部分書商開始在自家銷售頁面加上「禁止 AI 訓練用採購」聲明,試圖從供應端建立防火牆。
- 歐盟 AI 法案(EU AI Act)即將於 2026 年 8 月起進入第二階段實施,通用模型提供者必須揭露訓練資料摘要,亞馬遜此案可能成為第一批受影響對象之一。
結論
亞馬遜這次被 AirTag「抓包」,揭開的並不是單一間倉庫的怪癖,而是前沿 AI 訓練需求的真實面貌:當人類的文字存量即將見底,大型科技公司會願意為「獨特資料」付出什麼代價——包括把一本可能絕版的書,撕成 AI 模型看得懂、但人類再也讀不到的碎片。這條供應鏈若不被透明化與法制化約束,未來受害的不會只有稀有書,而是整個公共知識的保存基礎。