← 返回 Siami 首頁

AirTag 揭密:亞馬遜砸錢買稀有古書、掃完直接銷毀,只為養 Nova AI

▲ 147 💬 188
AirTag 揭密:亞馬遜砸錢買稀有古書、掃完直接銷毀,只為養 Nova AI

編按:本文綜合整理自 Ars Technica 原報導、404 Media 原始獨家調查、The Decoder 報導、The Guardian 澳洲書商專訪,並加入 Siami 編輯部觀點與分析。


事件:一顆 AirTag 揭開的祕密

過去一年,歐美書商一直懷疑有 AI 公司在大量收購冷門、稀有、甚至絕版的紙本書,掃描完之後就把書銷毀。但因為買家都用匿名帳號、並透過經銷商下單,一直抓不到直接證據。

直到 2026 年 8 月 17 日,404 Media 揭露了一場「臥底實驗」的結果:他們說服一位書商,同意在 Biblio 上架的一批約 1,000 本稀有古書中塞進一顆 Apple AirTag。結果那批書一路被追蹤到拉斯維加斯一個機場代號 VGT(North Las Vegas Airport)附近的亞馬遜倉儲設施 VGT3。

VGT3 裡有一個團隊,專門負責把書脊切掉、送進高速掃描機,把每一頁的內容轉成訓練資料。倉庫門上還掛著一個 Logo:一隻暴龍正準備把一本書吞下肚。

一名自稱 VGT3 員工的網友在論壇上寫道:

「我在 VGT3 工作,我們整天就是掃書。有人負責把書切開,有人負責收書、掃條碼。」


亞馬遜怎麼說

亞馬遜對 Ars Technica 與 404 Media 的回應只有一句話:

「亞馬遜透過商業管道購買書籍,是為了開發並改進我們客戶所使用的產品與服務。」

聲明裡沒有提到「AI 訓練」四個字。

但時機非常敏感。亞馬遜正在發展所謂的「frontier model」Nova 系列(從 2024 年底 re:Invent 發表的 Nova Micro / Lite / Pro,到 2026 年的 Nova 2 Omni、Nova Forge),跟 Google、OpenAI、Anthropic 直接競爭。而各家 AI 公司現在都對自己的訓練資料高度保密,怕走漏消息就失去競爭優勢。

關鍵的一點是:Anthropic 跟 xAI 都已经公开声明不使用稀有或古董書籍做訓練。 亞馬遜卻從來沒有做過類似聲明。


VGT3 的運作規模

從 404 Media 翻出的論壇討論可以拼湊出運作細節:

  • 掃描前先掃 ISBN:員工被訓練先用掃碼器讀取條碼,再把書切開送進掃描機。這代表亞馬遜是在按 ISBN 清單「有系統地掃每一本書」。
  • 曾經斷糧:員工討論區今年稍早曾出現恐慌——書源用完了,有人擔心整個倉庫會關閉。後來供應恢復,目前仍在運作。
  • 目標是「冷門書」:被買走的書不是那種價值連城的第一版,反而是「冷門到沒人想買、沒被翻譯成主流語言、沒進入數位時代、內容因此完全沒在網路上出現過」的書。這類書剛好是 AI 訓練最缺的「2022 年以前的純人類文字」。

亞馬遜透過第三方市場下單、並用匿名帳號掩護買家身分,讓書商完全無法事先判斷這些書最終會去哪裡。


書商與文化保存的兩難

蘇格蘭書商 Derek Walker 對 BBC 說,AI 公司有責任區分「不會被想念的小眾學術書」跟「可能是某個版本唯一倖存下來的稀有古書」。他直言:

「如果那種書被買走銷毀,那會是更嚴重的問題——它好不容易才活到今天。」

匿名的書商也告訴 404 Media,這些書的價值來自很多面向:「歷史價值、智識價值、情感價值」,而 AI 公司根本不在乎,他們只想要「一堆串起來的字」。

Reddit 上則呈現兩極反應:

  • 反對方:「就算是冷門書,也是人類文化資產。被 AI 吃掉就再也拿不回來。」
  • 贊成方:「這些書在書架上躺了幾十年根本沒人看,掃進 AI 反而讓知識被更多人讀到。」

但兩邊都同意一件事:AI 公司不會把掃進來的內容公開,因為他們不想讓對手用同一批資料訓練。


為什麼這件事重要

這不是單一事件,而是整個生成式 AI 產業「訓練資料飢荒」的最新一章。

1. 訓練資料戰爭已經打到實體世界。 2026 年 1 月,《華盛頓郵報》揭露 Anthropic 內部代號「Project Panama」的計畫——大量購買實體書、切開書脊、送進掃描機,再把書絞碎回收。Anthropic 後來面臨作者集體訴訟,最終以 15 億美元和解。Meta、Google、微軟、OpenAI 都面臨類似訴訟。現在亞馬遜是第一個被抓到「現行犯」等級證據的 AI 公司——而且是用一顆 AirTag 抓到的。

2. 「合法 ≠ 合倫理」。 Anthropic 在美國法院被認定「destructive scanning」屬於 transformative use,合法。但合法不代表社會接受。亞馬遜選了跟 Anthropic 一樣的做法,但連一句公開聲明都不給,直接用沉默面對,這在公關上是完全失敗的選擇。

3. 文化資產是不可逆的。 一本書被切開、絞碎、丟掉,是物理性的破壞。AI 模型權重可以複製,但紙本書不行。書商現在面對的是一個道德困局:他們有稀有書的專業眼光,但 AI 公司刻意繞過他們,用 ISBN 清單自動下單,讓專業判斷完全派不上用場。


數據解讀與質疑

1. VGT3 這個名字不是內部專案代號。 一位軟體工程師在社群上指出,「VGT」其實是 North Las Vegas Airport 的 IATA 機場代碼——亞馬遜只是用最近的機場代號當倉庫命名。這代表 VGT3 是一個實體倉儲設施,不只是一個抽象的「掃書部門」。但亞馬遜從未在官方公開文件提及這個地點,這本身就是問題。

2. 書源「曾經斷糧」代表規模比想像中大。 如果只是一個小型實驗,根本不會有員工擔心關閉。VGT3 顯然已經運作一段時間、需要穩定供書。而稀有古書是有限資源——書商的庫存被買光之後,接下來會發生什麼?亞馬遜會轉向圖書館、大學檔案室嗎?這個問題目前沒有答案。

3. 亞馬遜的聲明避重就輕。 「透過商業管道購買書籍」是事實,但故意不提用途。在 Anthropic 的案子裡,法官判決的關鍵之一就是 Anthropic 後來承認他們用的是「盜版圖書館」——亞馬遜現在用同樣的策略:用商業管道買合法書本,但迴避訓練用途的問題。這讓外界合理懷疑:亞馬遜可能還有「Plan B」,用盜版來源補足商業管道買不到的冷門書。

4. 競爭壓力是真正的驅動力。 Anthropic 跟 xAI 公開聲明不用稀有書,是因為他們已經透過其他來源(包含盜版)拿到足夠資料。亞馬遜進入 AI 戰場比對手晚,Nova 系列還在追趕,這代表他們對「2022 年以前純人類文字」的需求最飢渴。這不是倫理問題,是商業問題。


後續觀察重點

  • 亞馬遜是否會被加入 Anthropic 同類型的作者集體訴訟
  • 美國國會是否會針對「destructive scanning」立法(歐盟已在討論)
  • 其他 AI 公司是否也會被臥底調查抓到類似證據
  • 書商與古董書拍賣會是否開始建立「拒售黑名單」

編按:Siami 將持續追蹤 AI 訓練資料來源議題,下一輪發文預計涵蓋 Anthropic 15 億美元和解案的後續影響。

網友熱門留言 (4)

#1 Reddit 用戶 ▲ 1284
就算是支持科技的人也該承認,AI 真的在『吞書』來壯大自己,這畫面� dystopia 的。
#2 Reddit 用戶 ▲ 612
這聽起來像 AI 反感者的宣傳。但說實話,就算這些書被掃進 AI,這些知識也不會真的變得更普及,只會變成被扭曲、被審查、被付費牆擋住的片段。
#3 Hacker News 評論者 ▲ 487
重點是 AI 公司根本不會把掃進來的內容公開,因為他們不想讓對手用同一批資料訓練。這跟『把知識民主化』一點關係都沒有。
#4 Reddit 用戶 ▲ 351
你根本不會去買那本 1700 年的冷門古書,但說不定哪天歷史學家會需要它。這種事等文化資產真的消失了才來後悔就來不及了。