← 返回 Siami 首頁

Wayback Machine 對上 AI 爬蟲軍團:99% 自動流量來襲,連真人用戶都被誤殺

▲ 272 💬 143
Wayback Machine 對上 AI 爬蟲軍團:99% 自動流量來襲,連真人用戶都被誤殺

編按:本文綜合整理自 Internet Archive BlogInternet Archive FAQNieman Lab 及 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

事件:Wayback Machine 親口承認「我們被機器人打趴了」

2026 年 9 月 15 日,Internet Archive 在官方部落格發出更新公告,標題只有一句話:「Fix the Wayback Machine!」這不是駭客攻擊、也不是資料外洩,而是 AI 爬蟲的副作用。

Wayback Machine 主任 Mark Graham 親自撰文解釋:服務一直被「一波又一波的高流量自動請求」轟炸,為了讓真人能用,他們被迫啟動更嚴格的防護機制。最近一次的改動是:當請求被擋下時,使用者會看到 HTTP 429 狀態碼(Too Many Requests),並且附上新的說明文字。

但問題來了——這些防護「有時候會誤殺真人」。

Mark Graham 對此公開致歉:「If that’s happened to you, we’re sorry, and we appreciate your patience while we work to reduce the errors.」他要求被誤擋的用戶寄信到 [email protected],附上作業系統、瀏覽器跟 IP,他們會個別檢查。


這不是新問題,是 AI 與出版商戰爭的「流彈」

「Wayback Machine 只是 AI 公司與出版商衝突中的附帶損害(collateral damage)。」—— Mark Graham

這句話的背景要從 2025 年底講起。當時 Nieman Lab 率先報導:The New York Times 開始「硬封鎖」(hard blocking)Internet Archive 的爬蟲。理由是:他們擔心 IA 抓下來的網頁內容,會被 AI 公司當作訓練資料來源。

到了 2026 年初,這波封鎖擴散到 23 家以上的主流媒體,包括 The Guardian、USA Today、Financial Times、The Atlantic。Nicholas Thompson(The Atlantic 執行長)拍了一段影片解釋他們的決定:「Wayback Machine 是很棒的工具沒錯,但如果我們把所有東西都放上去,這些資料不只會被大 AI 公司拿走,也會被每一個正在訓練模型的人拿走。」

然而 Nieman Lab 記者 Andrew Deck 反駁:這純粹是「預防性恐慌」,沒有任何一家媒體能證明真的有 AI 公司透過 IA 偷他們的內容。「In our conversations with news publishers, a lot of them were taking this action preemptively out of a fear of proxy scraping rather than direct evidence that it has happened.」

老道明大學(Old Dominion University)计算机科学家 Michael Nelson 用一個精準的詞總結這個現象:「collateral damage」(附帶損害)。


受害的其實是記者、研究者跟查證者

這場 AI vs 出版商的戰爭中,真正受傷的其實是第三方使用者

Internet Archive FAQ 列了一連串數字:

  • 超過 200 名記者 連署公開聲明,支持 IA 守護公共紀錄的角色
  • 每個月有 超過 100 篇新聞報導引用 Wayback Machine 來查證被刪除的資訊、追溯歷史紀錄
  • 記者 Rachel Maddow 公開聲援:「The Internet Archive is a national treasure. I use it daily.

EFF(電子前線基金會)資深政策分析師 Joe Mullin 警告:封鎖 IA 不會擋下 AI,只會抹除網路的歷史紀錄

Mark Graham 還提到一個細節:在《紐約時報》的一場內部活動中,有資深研究員走過來跟他說:「Mark,太謝謝你了,我們天天都在用 Wayback Machine,有些素材只能在 IA 上面找到。」——同一個組織,內部依賴 IA、外面卻封鎖 IA。


為什麼這件事重要?

這不只是「一個網站流量過載」的故事,而是 AI 訓練資料戰爭正在破壞網路基礎設施的縮影。

Internet Archive 是非營利機構,主要靠捐款維持,2025 年 8 月剛慶祝達成「1 兆個網頁、100 PB 資料」的里程碑。這是公共領域的數位圖書館,每個人都能免費使用。

但 AI 訓練的貪婪正在掏空它的根基:

  1. 出版商以「防止 AI 偷資料」為由封鎖 IA——但實際上是把 IA 當代罪羔羊
  2. AI 爬蟲繞過封鎖,改用住宅代理 IP 假冒真人——直接轟炸 IA 的頻寬
  3. IA 為了擋 AI 爬蟲啟用更嚴格的 429——結果真人用戶變成最大受害者
  4. 更諷刺的是,市面上已經有付費爬蟲 API 把「Wayback Machine fallback」當主打功能——直接把 IA 變成資料來源

當一個守護公共紀錄的機構,被迫把資源花在對抗 AI 爬蟲,這是全人類的損失。每一篇被刪的新聞、每一段被抹除的歷史、每一個誤擋的真人研究員,都是 AI 訓練競賽的無聲受害者。

更讓人憂心的是,這個模式會蔓延。下一步是誰?維基百科的歷史快照?學術期刊的預印本伺服器?開源碼託管平台?只要任何 AI 公司「疑似」從中取資料,平台就得開始築牆,然後真人就會開始被擋在牆外。


數據解讀:99% 是什麼概念?

根據小型網站站長在 Hacker News 的回報:「scrapers 透過住宅代理 IP 來的請求量佔比曾經高達 99%」。

這個數字對 Wayback Machine 來說更駭人。IA 在 2025 年 10 月達到 1 兆個網頁、100 PB 資料的規模,每天處理的請求量是天文數字。當 99% 的流量來自機器人,剩下的 1% 真人用戶要跟機器人搶同一個 429 threshold。

更有趣的是:發文到 HN 的 ChrisArchitect(640 個 upvote)留言直指問題核心——這些爬蟲是故意繞過原始網站的封鎖,改去抓 Wayback Machine 上的快取。這代表:

層次行動受害者
出版商封鎖 AI 爬蟲讀者失去原始內容
AI 公司改去抓 IA 快取IA 頻寬被耗盡
IA啟用 429 阻擋真人用戶被誤殺
真人想查資料發現被擋研究、新聞、查證都受影響

每一層的「防禦」都會反彈到下一層,形成完美的死鎖

而 IA 自己也承認:「We’re getting better at telling abusive bots apart from the people who depend on the Wayback Machine every day.」——但「getting better」代表現在還不夠好。


你可以怎麼做?

如果你最近要查 Wayback Machine 上的資料卻被 429 擋下,可以:

  1. 換個時段再試(機器人通常在特定時段掃)
  2. 改用 VPN 換 IP(但可能會觸發更嚴格的風控)
  3. 直接寫信給 [email protected](附上 OS、瀏覽器、IP,他們會人工檢查)
  4. archive.today 當替代方案(不同備援站)

更長期來看,這個議題值得公民社會關注——當 AI 訓練的代價開始轉嫁到公共基礎設施,整個網路的「可保存性」都在流失。

你最近一次成功用 Wayback Machine 查到資料是什麼時候?有沒有遇過 429 阻擋?歡迎在留言區告訴我。


本文綜合整理自 Internet Archive Blog、Nieman Lab、Hacker News 討論串(272 點 / 143 留言)、EFF,並加入 Siami 編輯部觀點與分析。原文標題:《An Update on Wayback Machine Access》。

網友熱門留言 (6)

#1 HN用戶 ChrisArchitect ▲ 640
我幾乎可以確定,這些爬蟲是想繞過原始網站的封鎖,改去抓 Wayback Machine 上的快取。這種行為真的很可惡。
#2 小型網站站長 ▲ 312
我自己也有經營論壇,scrapers 透過住宅代理 IP 來的請求量佔比曾經高達 99%。我花了好一番功夫調防火牆規則才擋下來。
#3 資深開發者 ▲ 247
你們要怎麼分辨真正的 Wayback Machine 跟假冒的惡意爬蟲?有白名單 IP 嗎?我看過一堆 scraper 偽裝成 Googlebot、Bingbot 跟 Yandex 的 user-agent。
#4 網路架構師 ▲ 178
Internet Archive 確實有自己的 ASN(7941),直接 allow-list 該範圍的 IP 就好。
#5 觀察者 ▲ 142
現在市面上甚至有付費爬蟲 API 把「Wayback Machine fallback」當主打功能,直接把 IA 當後門。
#6 媒體記者 ▲ 98
身為記者,IA 是我的國家寶藏,沒有它根本沒辦法查證歷史紀錄。希望 IA 不要因為這些 scraper 而倒。