← 返回 Siami 首頁

Google DeepMind 自己的研究員開炮:Tom Zahavy 投書 ICML 2026,論證 LLM 結構上無法做出愛因斯坦級的科學發現

▲ 247 💬 170
Google DeepMind 自己的研究員開炮:Tom Zahavy 投書 ICML 2026,論證 LLM 結構上無法做出愛因斯坦級的科學發現

編按:本文綜合整理自 OpenReview 原始 Position PaperTom Zahavy 個人計畫頁the-decoder 評論報導Uday Kamath Substack 深度解析explainx.ai 評論Alex Veremeyenko 推文Burkov 推文Hacker News 討論串,並加入 Siami 編輯部觀點與分析。

論文核心:LLM 會壓縮、會證明,但不會「跳」

2026 年 8 月,ICML 2026 Position Paper Track 收錄了一篇由 Google DeepMind 自己的研究員 Tom Zahavy 獨自撰寫的論文,標題叫 《Position: LLMs can’t jump》。這個標題直譯是「LLM 不會跳」,但這個「跳」有明確的哲學定義——它是著名哲學家 Charles Sanders Peirce 在十九世紀提出的「Abduction(溯因推理)」,指的是從觀察資料「直覺躍升」到全新公設的創造性思考。

Zahavy 借用了愛因斯坦 1952 年給 Maurice Solovine 的一封信,把科學發現拆成三個階段:

  1. Induction(歸納):從感官經驗中提取統計模式。
  2. The Jump(躍升):以直覺從模式「跳」到能解釋整體的抽象公設。
  3. Deduction(演繹):從公設出發,邏輯地推導出可被檢驗的預測。

論文的論點是:LLM 在第一步(歸納)已經取得壓倒性成功,在第三步(演繹)也正快速被形式化證明系統(Lean、AlphaProof、IMO)攻克。但中間的「跳」——也就是從零散觀察中提出全新公設的環節——是 LLM 結構上做不到的事

Zahavy 用愛因斯坦發展廣義相對論的歷史為計算機案例。他指出,當時古典力學仍然管用,沒有任何「實驗錯誤訊號」在喊「請發明相對論」。愛因斯坦是靠「自由落體觀察者感覺不到重力」這個肉身化的思想實驗——也就是在腦中模擬一個電梯裡的人會是什麼感受——才從「加速度等於重力」這個全新公設出發,推導出廣義相對論。整個過程沒有資料壓縮,也沒有可以優化的誤差訊號,這正是 LLM 沒有機制處理的環節。


為什麼這件事重要

這篇論文的份量來自三個層面:

  • 作者身份的特殊性:Tom Zahavy 是 Google DeepMind「Discovery team」的共同領導人,也是 AlphaProof——也就是在 2024 年國際數學奧林匹亞拿到銀牌級表現、首次把 LLM 推上 IMO 證明難度的系統——的關鍵貢獻者。他正是站在 LLM 推到極限的那個團隊內部,從內部投書說「這條路線撞到天花板」

  • 時機的戲劇性:這篇 ICML 2026 Position Paper 與同一週 Google DeepMind 的人事大地震(Demis Hassabis 交棒 CEO、Jeff Dean 27 年後離開創立 Discovery Loop)幾乎同步。外界解讀這兩件事是同一訊號的不同切面——Google 內部正在重新定義「AI 該做什麼、不該做什麼」的邊界

  • 他對「世界模型」的押注:Zahavy 並不是悲觀論者。他認為要讓 AI 真的做出科學發現,需要的不再是更大的語言模型,而是physically consistent, multimodal world models——也就是能在內部「跑」物理模擬、讓代理人在其中「感覺」重力的世界模型。這與 Yann LeCun 多年倡導的 JEPA(Joint Embedding Predictive Architecture)路線高度一致,也跟 DeepMind 的 Genie 系列、Genesis 物理模擬器的方向吻合。

換句話說,這篇論文的真正訊息不是「AI 完了」,而是:「LLM 這條路徑的下一個邊界,不是訓練更多資料,而是要從『語言』轉向『物理模擬』」。這對所有正在用 GPT/Claude 訓練特定領域專家的研究團隊,是一個明確的投資方向警示。


數據解讀與質疑

1. 從「confirms」改為「suggests」——這篇論文的強度有多大?

根據 explainx.ai 對 OpenReview 審稿紀錄的整理,Zahavy 原本的結論是用「confirms」這個詞來肯定 LLM 無法做溯因推理。審稿人 Ldv4 明確指出這個結論對一個「只靠兩個歷史個案+概念論證」的位置論文來說過強,作者同意並改為「suggests」。這個小修改很重要——這是一個 evidence-backed hypothesis,而不是有實驗支撐的定理。讀者不該把這篇當成 LLM 失敗的判決書,而是當成一份研究方向建議書。

2. Sakana AI Scientist 與 AlphaEvolve 不是已經在做科學發現了嗎?

Zahavy 在論文中對這類「AI Scientist」系統有回應。Sakana 的 AI Scientist 與 DeepMind 的 AlphaEvolve 雖然能自動化科學工作流,但前者只是「重組既有概念」,後者雖然優化能力強,卻需要一個逐步可縮小的誤差訊號。愛因斯坦的廣義相對論當時沒有誤差訊號——古典力學本來就 work,整個物理學界沒有「請發明新理論」的提示。這就區分出「最佳化問題」與「發現問題」的根本不同。

3. 「Abduction」是不是被過度哲學化的說法?

Zahavy 在論文中對 Abduction 做了精細的二分:「普通 Abduction」(從已知候選集中挑最合理解釋,例如醫生對症下藥)LLM 已經能做到;「Manipulative Abduction(操控式溯因)」——也就是為一個尚未存在的現象「發明」一個全新的因果——才是 LLM 真正卡住的地方。這種區分讓論文避開了「AI 也會頓悟啊」這種過於鬆散的批評。

4. 真正的瓶頸是算力還是「物理接地(physical grounding)」?

Zahavy 明確認為:瓶頸不是算力、不是參數量、不是訓練資料。即使把所有可得的物理教科書、論文、教材塞進訓練集,LLM 也不可能從中「發現」一個全新的公設,因為發現需要可被內部模擬的物理直覺,而不是更多文本。這也是為何他與 Yann LeCun 都把賭注押在 physically-grounded world models,而不是更大的語言模型。

5. ICML 接受這篇 Position Paper 代表什麼訊號?

ICML 2026 是機器學習領域最重要的旗艦會議之一,過去很少接受「位置論文(Position Paper)」這個類別。Zahavy 這篇被收錄,代表學術社群願意正式討論「純 LLM 路徑的邊界」這個話題,這對整個領域的資源分配方向是個訊號。


業界反應:DeepMind 內部、Yann LeCun 與 Hacker News

這篇論文的反應橫跨三個圈層:

  • Google DeepMind 內部:Alex Veremeyenko 整理 Zahavy 個人推文,標題是「DeepMind 寫了一篇論文解釋為什麼 DeepMind 還需要 DeepMind」。Zahavy 隨後親自回應該推文,明確表示他的論文不是「AI 永遠做不出發現」的悲觀宣告,而是「我們需要 world models 來提供 sensory substrate 才能跨過這道牆」的建設性呼籲。Burkov(決策書作者)則在 X 上總結:「LLM 能在公設存在後跑數學,但無法自己發明公設。」

  • Yann LeCun 派系:LeCun 多年來主張 LLM 不是通往 AGI 的路,世界模型(V-JEPA、JEPA)才是。這篇論文幾乎是 LeCun 立場的學術版,Hacker News 上有 173 個 upvote 的留言直接寫「Yan LeCun 看到這篇論文應該會笑出來」。

  • Hacker News 工程師社群:HN 上一個 247 個 upvote 的留言寫:「我每天用 Claude Code 寫複雜程式,但我仍然必須親自思考——Claude 依然『不會跳』,我也沒有看到任何證據表明這些 AI 短期內會像人腦那樣跳。」這呼應了 Zahavy 的論點:當前 LLM 是工程師的槓桿,不是取代品。另一個 132 個 upvote 的留言吐槽:「我每次想到訓練 AI 走到 Step 1:寶寶學說話所需要的能源與算力就心驚,我們還卡在 Step 2:??,卻已經迫不及待衝到 Step 3:變現。」

  • 物理 / 哲學社群:哲學資料庫 PhilSci-Archive 收錄了這篇論文,它在哲學領域也被當成「Abduction 在 AI 時代的重新定位」的重要文本。


對 AI 產業的實際影響

這篇論文的訊號可以分三個層面解讀:

短期(2026 下半年)

  • 對 LLM-only 路線的科學類應用是警訊:純靠 LLM 做「發現」的新創公司,會被創投圈追問「你的 world model 在哪裡」。
  • world model 賽道會拿到更多資金:DeepMind 的 Genie、Genesis、Sakana 的 AI Scientist v2、以及各類 multimodal action-controllable world model 會成為下一輪募資的熱點。

中期(2027–2028)

  • 「LLM + world model」混合架構成為 AI-for-Science 標準配方:純文字模型負責推導、prompt 設計、文件彙整;世界模型負責提出假設、執行虛擬實驗、生成新訓練資料。
  • ICML / NeurIPS 開始系統性接受 Position Paper:學術社群從「純 benchmark 導向」轉向「路線辯論」。

長期(2029 以後)

  • AI 科學發現的「第一個 AlphaFold 級別成功」會發生在 world model 路線上,而不是 LLM 路線。如果 DeepMind 的下一代 AlphaProof 結合了可微分物理模擬(Genesis、Habana 模擬器),可能會是這個轉折的訊號。

與近期其他「AI 邊界論」的對比

這篇論文是 2026 年一系列「AI 邊界論」的重要節點,前後相關的還有:

  • Anthropic 的 Dario Amodei 在 2025 年提出「Powerful AI」概念,強調 LLM + 工具使用 + 長 context 已經接近 AGI 邊界。
  • Yann LeCun 持續主張 V-JEPA、JEPA 路線才是路徑。
  • François Chollet 的 ARC-AGI 測試則從另一個角度論證「抽象推理」是 LLM 結構弱點。
  • Sakana AI ScientistDeepMind AlphaEvolve 以實際系統回應「發現是否可自動化」這個問題。

Zahavy 的特殊性在於:他站在 LLM 推到極限的團隊內部,用愛因斯坦的歷史案例作為計算機思辨,又明確告訴學界「請往 world model 走」。這是一個非常罕見的「我在系統內部告訴你這條系統的天花板在哪」的姿態。


為什麼這篇「論文」而不是「系統」值得認真讀

對工程師、產品經理、創投決策者而言,這篇論文的價值不在「AI 又要被取代了」這種恐慌式敘事,而是:

  • 清楚的邊界劃定:LLM 不會發明公設;它會壓縮資料、會證明定理、會整合前人工作——但它不會做出「突然換一個座標系」這種事。
  • 具體的下一步:物理一致、可動作控制、多模態的世界模型,是下一個十年的 AI-for-Science 主戰場。
  • 驗證 AI 路線選擇的內部訊號:連 Google DeepMind 自己的研究員都公開承認 LLM 路線撞牆,這對所有押注在「更大模型」上的團隊是個冷卻訊號。

後續觀察重點

  • Tom Zahavy 與 Discovery Loop 的合作可能性:Jeff Dean 離開 Google 後創立的 Discovery Loop 是一家公益公司,目標正是 AI 自動化科學研究。Zahavy 這篇論文的立場與 Discovery Loop 的產品定位高度一致,雙方是否會在 world model 路線上合作值得觀察。
  • ICML 2026 Position Paper Track 還收錄了哪些論文:這個新類別的內容分佈,能反映學界對「LLM 邊界」的共識程度。
  • DeepMind 是否會公開 world model 研究路線圖:Hassabis 升任主席後,內部研究路線是否會從 LLM 規模戰轉向 world model 整合,是 Genie 3、Genie 4 後續版本的關鍵指標。
  • AlphaProof 與世界模型的整合:如果下一代 AlphaProof 引入可微分物理模擬,將是「LLM + world model」這個混合架構的第一個正經實作。

編按:本文綜合整理自 OpenReview 原始 Position Paper、Tom Zahavy 個人計畫頁、the-decoder 評論報導、Uday Kamath Substack 深度解析、explainx.ai 評論、Alex Veremeyenko 推文、Burkov 推文 與 Hacker News 討論串,並加入 Siami 編輯部觀點與分析。原文以第三人稱報導方式撰寫,未照抄原始新聞稿段落。

網友熱門留言 (4)

#1 Hacker News 用戶 ▲ 247
我每天用 Claude Code 寫複雜程式,但我仍然必須親自思考——Claude 依然「不會跳」,我也沒有看到任何證據表明這些 AI 短期內會像人腦那樣跳。
#2 Hacker News 用戶 ▲ 173
Yan LeCun 看到這篇論文應該會笑出來。
#3 Hacker News 用戶 ▲ 152
沒有什麼能取代『出生在這個世界並花二十年從經驗中學習』。語言是過程中很重要的一步,但它只是一步。LLM 是一個步驟,絕對不會是終點。
#4 Hacker News 用戶 ▲ 132
我每次想到訓練 AI 走到『Step 1:寶寶學說話』所需要的能源與算力就心驚。現在我們還卡在 Step 2:??,卻已經迫不及待衝到 Step 3:變現。