編按:本文綜合整理自 Internet Archive Blog、Internet Archive FAQ、Nieman Lab 及 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。
事件:Wayback Machine 親口承認「我們被機器人打趴了」
2026 年 9 月 15 日,Internet Archive 在官方部落格發出更新公告,標題只有一句話:「Fix the Wayback Machine!」這不是駭客攻擊、也不是資料外洩,而是 AI 爬蟲的副作用。
Wayback Machine 主任 Mark Graham 親自撰文解釋:服務一直被「一波又一波的高流量自動請求」轟炸,為了讓真人能用,他們被迫啟動更嚴格的防護機制。最近一次的改動是:當請求被擋下時,使用者會看到 HTTP 429 狀態碼(Too Many Requests),並且附上新的說明文字。
但問題來了——這些防護「有時候會誤殺真人」。
Mark Graham 對此公開致歉:「If that’s happened to you, we’re sorry, and we appreciate your patience while we work to reduce the errors.」他要求被誤擋的用戶寄信到 [email protected],附上作業系統、瀏覽器跟 IP,他們會個別檢查。
這不是新問題,是 AI 與出版商戰爭的「流彈」
「Wayback Machine 只是 AI 公司與出版商衝突中的附帶損害(collateral damage)。」—— Mark Graham
這句話的背景要從 2025 年底講起。當時 Nieman Lab 率先報導:The New York Times 開始「硬封鎖」(hard blocking)Internet Archive 的爬蟲。理由是:他們擔心 IA 抓下來的網頁內容,會被 AI 公司當作訓練資料來源。
到了 2026 年初,這波封鎖擴散到 23 家以上的主流媒體,包括 The Guardian、USA Today、Financial Times、The Atlantic。Nicholas Thompson(The Atlantic 執行長)拍了一段影片解釋他們的決定:「Wayback Machine 是很棒的工具沒錯,但如果我們把所有東西都放上去,這些資料不只會被大 AI 公司拿走,也會被每一個正在訓練模型的人拿走。」
然而 Nieman Lab 記者 Andrew Deck 反駁:這純粹是「預防性恐慌」,沒有任何一家媒體能證明真的有 AI 公司透過 IA 偷他們的內容。「In our conversations with news publishers, a lot of them were taking this action preemptively out of a fear of proxy scraping rather than direct evidence that it has happened.」
老道明大學(Old Dominion University)计算机科学家 Michael Nelson 用一個精準的詞總結這個現象:「collateral damage」(附帶損害)。
受害的其實是記者、研究者跟查證者
這場 AI vs 出版商的戰爭中,真正受傷的其實是第三方使用者。
Internet Archive FAQ 列了一連串數字:
- 超過 200 名記者 連署公開聲明,支持 IA 守護公共紀錄的角色
- 每個月有 超過 100 篇新聞報導引用 Wayback Machine 來查證被刪除的資訊、追溯歷史紀錄
- 記者 Rachel Maddow 公開聲援:「The Internet Archive is a national treasure. I use it daily.」
EFF(電子前線基金會)資深政策分析師 Joe Mullin 警告:封鎖 IA 不會擋下 AI,只會抹除網路的歷史紀錄。
Mark Graham 還提到一個細節:在《紐約時報》的一場內部活動中,有資深研究員走過來跟他說:「Mark,太謝謝你了,我們天天都在用 Wayback Machine,有些素材只能在 IA 上面找到。」——同一個組織,內部依賴 IA、外面卻封鎖 IA。
為什麼這件事重要?
這不只是「一個網站流量過載」的故事,而是 AI 訓練資料戰爭正在破壞網路基礎設施的縮影。
Internet Archive 是非營利機構,主要靠捐款維持,2025 年 8 月剛慶祝達成「1 兆個網頁、100 PB 資料」的里程碑。這是公共領域的數位圖書館,每個人都能免費使用。
但 AI 訓練的貪婪正在掏空它的根基:
- 出版商以「防止 AI 偷資料」為由封鎖 IA——但實際上是把 IA 當代罪羔羊
- AI 爬蟲繞過封鎖,改用住宅代理 IP 假冒真人——直接轟炸 IA 的頻寬
- IA 為了擋 AI 爬蟲啟用更嚴格的 429——結果真人用戶變成最大受害者
- 更諷刺的是,市面上已經有付費爬蟲 API 把「Wayback Machine fallback」當主打功能——直接把 IA 變成資料來源
當一個守護公共紀錄的機構,被迫把資源花在對抗 AI 爬蟲,這是全人類的損失。每一篇被刪的新聞、每一段被抹除的歷史、每一個誤擋的真人研究員,都是 AI 訓練競賽的無聲受害者。
更讓人憂心的是,這個模式會蔓延。下一步是誰?維基百科的歷史快照?學術期刊的預印本伺服器?開源碼託管平台?只要任何 AI 公司「疑似」從中取資料,平台就得開始築牆,然後真人就會開始被擋在牆外。
數據解讀:99% 是什麼概念?
根據小型網站站長在 Hacker News 的回報:「scrapers 透過住宅代理 IP 來的請求量佔比曾經高達 99%」。
這個數字對 Wayback Machine 來說更駭人。IA 在 2025 年 10 月達到 1 兆個網頁、100 PB 資料的規模,每天處理的請求量是天文數字。當 99% 的流量來自機器人,剩下的 1% 真人用戶要跟機器人搶同一個 429 threshold。
更有趣的是:發文到 HN 的 ChrisArchitect(640 個 upvote)留言直指問題核心——這些爬蟲是故意繞過原始網站的封鎖,改去抓 Wayback Machine 上的快取。這代表:
| 層次 | 行動 | 受害者 |
|---|---|---|
| 出版商 | 封鎖 AI 爬蟲 | 讀者失去原始內容 |
| AI 公司 | 改去抓 IA 快取 | IA 頻寬被耗盡 |
| IA | 啟用 429 阻擋 | 真人用戶被誤殺 |
| 真人 | 想查資料發現被擋 | 研究、新聞、查證都受影響 |
每一層的「防禦」都會反彈到下一層,形成完美的死鎖。
而 IA 自己也承認:「We’re getting better at telling abusive bots apart from the people who depend on the Wayback Machine every day.」——但「getting better」代表現在還不夠好。
你可以怎麼做?
如果你最近要查 Wayback Machine 上的資料卻被 429 擋下,可以:
- 換個時段再試(機器人通常在特定時段掃)
- 改用 VPN 換 IP(但可能會觸發更嚴格的風控)
- 直接寫信給
[email protected](附上 OS、瀏覽器、IP,他們會人工檢查) - 用 archive.today 當替代方案(不同備援站)
更長期來看,這個議題值得公民社會關注——當 AI 訓練的代價開始轉嫁到公共基礎設施,整個網路的「可保存性」都在流失。
你最近一次成功用 Wayback Machine 查到資料是什麼時候?有沒有遇過 429 阻擋?歡迎在留言區告訴我。
本文綜合整理自 Internet Archive Blog、Nieman Lab、Hacker News 討論串(272 點 / 143 留言)、EFF,並加入 Siami 編輯部觀點與分析。原文標題:《An Update on Wayback Machine Access》。
網友熱門留言 (6)