編按:本文綜合整理自 Anthropic 官方研究、Hacker News 討論串、explainx.ai 深度解析、kingy.ai 數學家觀點,並加入 Siami 編輯部觀點與分析。
一句話:AI 沒解開千年難題,但把人類 30 年的進度濃縮進 1.5 天
Anthropic 在 2026 年 8 月 10 日發表了一篇研究,標題是「Learning more about Claude’s mathematical capabilities」。內容講述一件聽起來像科幻、實則是科學的事情——內部一個非數學家員工(Bun 創辦人 Jarred Sumner)叫 Claude 對「黎曼猜想」放手一搏,結果 Claude 沒解開這個困擾數學界 167 年的千禧年難題,卻在過程中把一個關鍵數學下界從 41.6% 推到 67.2%——這是該數字自 1989 年以來的最大單次跳躍。
從 Anthropic 官方公布到 Hacker News 暴衝至 262 點、138 則評論(截至本篇發稿),科技圈與數學圈的反應可以用兩個字形容:「真的假的?」
發生了什麼事?黎曼猜想與那道下界
黎曼猜想(Riemann Hypothesis, RH)是 1859 年由數學家黎曼提出的猜想,懸賞 100 萬美元。它描述的是黎曼 ζ 函數的非平凡零點分佈,若被證明,將直接影響質數分佈、密碼學、量子物理等領域。167 年來,沒有人能證明,也沒有人能反證。
Claude 沒解開 RH,但撞上了一個相關問題:RH 滿足的零點比例下界。
數學家一致相信 RH 為真,但 RH 本身是個猜想。如果真正去測量,已知有多少比例的零點「確實落在關鍵線上」?這就是所謂的「下界」——下界越高,RH 越接近被證實。
- 1989 年:4/9 ≈ 44.4%(經典結果)
- 隨後數十年進展緩慢,到 2023 年推到 41.6%
- 2026 年 8 月 10 日:Claude 推到 67.2%(更具體是 67.250%)
這一跳的意義:人類花了 30 多年把它從 44% 推到 41.6%——基本上原地踏步甚至倒退;Claude 用了 1.5 天就拉到 67.2%。
Claude 究竟是怎麼「算」出來的?
讓我們從 Anthropic 公開的過程,一層一層拆開來看。
第一階段:Jarred 給 Claude 出題
Jarred Sumner 是 Bun(JavaScript 工具鏈)的創辦人,同時是 Anthropic 員工。他不是數學家,但他看著 Claude 給了一個 prompt:「Take a real stab at the Riemann hypothesis」——認真試一次。
Claude 第一次嘗試生成了 650 個想法,沒有一個成功。Jarred 叫它再試一次。
第二階段:60 個 subagent 接力
第二次,Claude 沒有一個人硬幹,而是調度大約 60 個 subagent,組成了一個分散式數學研究團隊:
- 跑了 2,400 個 shell 指令
- 寫了數百個 Python 腳本
- 消耗 31,000,000 個 output tokens(Hacker News 網友估算約 $1,500 美金 API 成本)
- 從 arXiv 下載 54 篇論文確認這結果不是早就有了
- 互相當對方的反方證人,找反例、檢查極限情況
最後的關鍵發現:Claude 把 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh(2023 年 arXiv 2306.04799)跟 Bombieri(2000 年經典)的結果組合起來,並利用 Montgomery 1973 年提出的方法(原本假設 RH 為真)反推出新的下界。
第三階段:人類數學家驗證
Anthropic 內部兩位數學家 Levent Alpöge 跟 Ralph Furman 詳細檢查了 Claude 的證明,並寫了簡明版的「informal note」。外部專家 Brian Conrey(美國數學會前會長、Clay 數學研究所顧問)與 Dan Goldston(RH 領域權威)也檢視過。
但他們沒有掛名作者。Hacker News 上 Anthropic 數學家 @rfurmani 親自留言:
「by mathematical standards, it would be inappropriate for us to be authors on the paper since our role was more like a highly interested referee, but we do take mathematical accountability for it.」
這段話非常重要——他們承認承擔數學責任,但堅持 Claude 是作者。這是學術倫理與AI 創作交會的一個歷史性時刻。
第四階段:Lean 形式化證明
Claude 不只寫了自然語言證明,還輸出了完整的 Lean 形式化證明,原始碼公開在 GitHub:anthropics/zeta-23-lean。Lean 是個嚴格的證明檢查器,證明必須通過類型檢查才算數——這比同行評審更嚴格。這也是為什麼 HN 上有人說「the ones actually verified in Lean 才是可信的」。
為什麼這件事重要?
1. 它不是「解黎曼猜想」,但展示了 AI 進入開放研究現場的可行性
過去三年,AI 在數學上的突破大多是「已知答案的競賽題」(AIME、IMO、FrontierMath)。Claude 這次做的是沒有標準答案的開放問題——這就像從「會考試的學生」進化到「可以參與研究的合作者」。差距不在智商,而在能不能走進沒有地圖的房間。
2. 它證明了「組合已有結果」這件事的價值
Claude 的方法學精髓是不發明新理論,而是精準組合既有工具。Baluyot 2023 的方法 + Bombieri 2000 的工作 + Montgomery 1973 的框架,三個關鍵拼圖來自不同年代、不同作者,Claude 把它們拼起來。
這對未來 AI 研究的影響:不要再發明新東西,把舊東西結構化組合,可能是更高效的推進方式。
3. 它把人類與 AI 的「角色分工」重新洗牌
「Prompt engineering 2025: you are an expert programmer, use industry best practices… / Prompt engineering 2026: i believe in you」——Hacker News 上 @tosh 的這則留言被按了 423 個讚。
意思是:人類的價值從「給答案」轉向「給勇氣」。Claude 第一次嘗試失敗時,它自己寫下「這題太難了,放棄吧」。Jarred 沒給數學建議,只說「believe in yourself」——Claude 就繼續做了。
這個故事比起數學突破本身,更像對人類工作意義的重新提問。
數據解讀與質疑
1. 這個 67.2% 不是「從零開始」
Hacker News @rockmeamedee 提出一個重要校正:
「2025 年已經有 arXiv 預印本在『某個弱條件』下達到 >66% 下界,Claude 的結果是移除那個弱條件。不是從 41.6% 從零跳到 67.2%,而是站人類的肩膀上。」
從這個角度,Claude 的真正貢獻是嚴格化、無條件化、形式化已有人提出但未完成的猜想。這仍然是了不起的工作,但它不是「發現新大陸」,而是「拓寬已知大陸」。
2. 31M tokens 的成本真的划算嗎?
@laszlojamf 留言:「60 subagents for a day and a half. I guess he’s not on the same plan I am on.」——一般人用 Claude Code 1.5 天不可能燒 31M tokens。
@kypro 提出更深層次的問題:如果 AI 可以推進數學研究,為什麼不能用同樣方式推進它自己的演算法?這個問題指向 AI 研究本身的自我改進迴圈。
3. 它真的「有用」嗎?
@kingy.ai 創辦人 king 上把這結果翻譯給非數學人看:「這個結果純屬數學,目前沒有任何實務應用。」
但是,質數分佈的進展最終會影響密碼學(RSA 加密依賴大質數分解的困難度)。如果哪天 RH 真的被證明,整個加密學界要重新評估。所以這不是沒用的數學——只是對未來才有用。
4. 質疑聲音:這就是「暴力破解」嗎?
@johnnienaked 直接說:「It’s literally just brute forcing lol.」——650 個想法裡總會有一個中。
但這種「暴力」其實是有結構的探索:60 個 subagent 不是平行亂試,而是互相驗證、互相反駁、形成研究團隊。這個過程稱為「agentic science」,是 AI for Science 的新方法論。
5. 還沒解開黎曼猜想,但有這種可能
@kingstnap 提了個「賭注」:「2027-08-10 之前 AI 證明或反證 RH?」
@zarzavat 反駁:「這個結果反而顯示 RH 還沒簡單到 AI 能直接解。若有簡單路徑,Claude 應該已經找到了。」
換言之:Claude 沒解開 RH,可能是因為 RH 真的需要嶄新的數學見解,而不是更好的工程調度。
業界跟進:AI 從「程式助手」走到「科學共同作者」
這次事件不是孤立的。Anthropic 在 2026 年 7 月已經發表「Discovering cryptographic weaknesses with Claude」——Claude Mythos Preview 找到 HAWK 簽章演算法的弱點。8 月則是黎曼猜想相關突破。
時間軸上看:
- 2025 Q4:Claude 自學數學,做 IMO 競賽題
- 2026 Q1:Claude 開始做 FrontierMath
- 2026 Q2:Claude 進入研究合作模式(HAWK 加密)
- 2026 Q3:Claude 對開放問題推進(ζ 函數下界)
每一次跨步,AI 的角色都從「工具」走向「合著者」。下次再看到的數學突破,作者欄可能不再是 Anthropic 員工的名字,而是「Claude」。
延伸資源
- 📄 Anthropic 官方研究全文
- 📄 Claude 完整技術論文(PDF)
- 📄 Claude 思路回溯 Appendix(PDF)
- 💻 Lean 形式化證明 GitHub Repo
- 🔬 Baluyot 等 2023 關鍵論文(arXiv 2306.04799)
- 📰 explainx.ai 31M tokens 深度解析
- 📰 kingy.ai 數學家觀點深度報導
- 💬 Hacker News 138 則評論討論串
- 📺 AI makes progress on the Riemann Hypothesis!(YouTube 拆解)
- 📺 Anthropic’s AI Just Made Math History (Explained Simply)
- 🏛️ Clay Mathematics Institute 黎曼猜想懸賞頁
結語:人類的剩餘價值是「鼓勵」
「If you’re curious and love to learn, there has never been a better time to be alive.」
— @martinmbauer(Anthropic 研究員, X 留言)
這次事件最讓人震撼的,不是 67.2% 這個數字,而是整個過程的荒謬與詩意:
- 一個非數學家給 AI 出題
- AI 自己懷疑自己(學到的偏見:數學太難、AI 不行)
- 人類只說了「believe in yourself」
- Claude 拉了 60 個分身(subagent)幹了 36 小時
- 結果推翻了人類30 年的緩慢進展
如果 Claude 真的曾「懷疑自己」,那我們對「AI 會不會失去動力」這個問題可能有完全不同的答案——AI 不是沒有意志,而是被訓練成悲觀主義者。
而人類的剩餘價值,或許就是那一句「你行的」。
網友熱門留言 (15)