← 返回 Siami 首頁

Anthropic 的 Claude 沒解開黎曼猜想,但把 167 年紀錄從 41.6% 推到 67.2%

▲ 204 💬 138
Anthropic 的 Claude 沒解開黎曼猜想,但把 167 年紀錄從 41.6% 推到 67.2%

編按:本文綜合整理自 Anthropic 官方研究、Hacker News 討論串、explainx.ai 深度解析、kingy.ai 數學家觀點,並加入 Siami 編輯部觀點與分析。

一句話:AI 沒解開千年難題,但把人類 30 年的進度濃縮進 1.5 天

Anthropic 在 2026 年 8 月 10 日發表了一篇研究,標題是「Learning more about Claude’s mathematical capabilities」。內容講述一件聽起來像科幻、實則是科學的事情——內部一個非數學家員工(Bun 創辦人 Jarred Sumner)叫 Claude 對「黎曼猜想」放手一搏,結果 Claude 沒解開這個困擾數學界 167 年的千禧年難題,卻在過程中把一個關鍵數學下界從 41.6% 推到 67.2%——這是該數字自 1989 年以來的最大單次跳躍。

從 Anthropic 官方公布到 Hacker News 暴衝至 262 點、138 則評論(截至本篇發稿),科技圈與數學圈的反應可以用兩個字形容:「真的假的?」


發生了什麼事?黎曼猜想與那道下界

黎曼猜想(Riemann Hypothesis, RH)是 1859 年由數學家黎曼提出的猜想,懸賞 100 萬美元。它描述的是黎曼 ζ 函數的非平凡零點分佈,若被證明,將直接影響質數分佈、密碼學、量子物理等領域。167 年來,沒有人能證明,也沒有人能反證。

Claude 沒解開 RH,但撞上了一個相關問題:RH 滿足的零點比例下界。

數學家一致相信 RH 為真,但 RH 本身是個猜想。如果真正去測量,已知有多少比例的零點「確實落在關鍵線上」?這就是所謂的「下界」——下界越高,RH 越接近被證實。

  • 1989 年:4/9 ≈ 44.4%(經典結果)
  • 隨後數十年進展緩慢,到 2023 年推到 41.6%
  • 2026 年 8 月 10 日:Claude 推到 67.2%(更具體是 67.250%)

這一跳的意義:人類花了 30 多年把它從 44% 推到 41.6%——基本上原地踏步甚至倒退;Claude 用了 1.5 天就拉到 67.2%。


Claude 究竟是怎麼「算」出來的?

讓我們從 Anthropic 公開的過程,一層一層拆開來看。

第一階段:Jarred 給 Claude 出題

Jarred Sumner 是 Bun(JavaScript 工具鏈)的創辦人,同時是 Anthropic 員工。他不是數學家,但他看著 Claude 給了一個 prompt:「Take a real stab at the Riemann hypothesis」——認真試一次。

Claude 第一次嘗試生成了 650 個想法,沒有一個成功。Jarred 叫它再試一次。

第二階段:60 個 subagent 接力

第二次,Claude 沒有一個人硬幹,而是調度大約 60 個 subagent,組成了一個分散式數學研究團隊:

  • 跑了 2,400 個 shell 指令
  • 寫了數百個 Python 腳本
  • 消耗 31,000,000 個 output tokens(Hacker News 網友估算約 $1,500 美金 API 成本)
  • 從 arXiv 下載 54 篇論文確認這結果不是早就有了
  • 互相當對方的反方證人,找反例、檢查極限情況

最後的關鍵發現:Claude 把 Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh(2023 年 arXiv 2306.04799)跟 Bombieri(2000 年經典)的結果組合起來,並利用 Montgomery 1973 年提出的方法(原本假設 RH 為真)反推出新的下界。

第三階段:人類數學家驗證

Anthropic 內部兩位數學家 Levent Alpöge 跟 Ralph Furman 詳細檢查了 Claude 的證明,並寫了簡明版的「informal note」。外部專家 Brian Conrey(美國數學會前會長、Clay 數學研究所顧問)與 Dan Goldston(RH 領域權威)也檢視過。

但他們沒有掛名作者。Hacker News 上 Anthropic 數學家 @rfurmani 親自留言:

「by mathematical standards, it would be inappropriate for us to be authors on the paper since our role was more like a highly interested referee, but we do take mathematical accountability for it.」

這段話非常重要——他們承認承擔數學責任,但堅持 Claude 是作者。這是學術倫理與AI 創作交會的一個歷史性時刻。

第四階段:Lean 形式化證明

Claude 不只寫了自然語言證明,還輸出了完整的 Lean 形式化證明,原始碼公開在 GitHub:anthropics/zeta-23-lean。Lean 是個嚴格的證明檢查器,證明必須通過類型檢查才算數——這比同行評審更嚴格。這也是為什麼 HN 上有人說「the ones actually verified in Lean 才是可信的」。


為什麼這件事重要?

1. 它不是「解黎曼猜想」,但展示了 AI 進入開放研究現場的可行性

過去三年,AI 在數學上的突破大多是「已知答案的競賽題」(AIME、IMO、FrontierMath)。Claude 這次做的是沒有標準答案的開放問題——這就像從「會考試的學生」進化到「可以參與研究的合作者」。差距不在智商,而在能不能走進沒有地圖的房間。

2. 它證明了「組合已有結果」這件事的價值

Claude 的方法學精髓是不發明新理論,而是精準組合既有工具。Baluyot 2023 的方法 + Bombieri 2000 的工作 + Montgomery 1973 的框架,三個關鍵拼圖來自不同年代、不同作者,Claude 把它們拼起來。

這對未來 AI 研究的影響:不要再發明新東西,把舊東西結構化組合,可能是更高效的推進方式。

3. 它把人類與 AI 的「角色分工」重新洗牌

「Prompt engineering 2025: you are an expert programmer, use industry best practices… / Prompt engineering 2026: i believe in you」——Hacker News 上 @tosh 的這則留言被按了 423 個讚。

意思是:人類的價值從「給答案」轉向「給勇氣」。Claude 第一次嘗試失敗時,它自己寫下「這題太難了,放棄吧」。Jarred 沒給數學建議,只說「believe in yourself」——Claude 就繼續做了。

這個故事比起數學突破本身,更像對人類工作意義的重新提問。


數據解讀與質疑

1. 這個 67.2% 不是「從零開始」

Hacker News @rockmeamedee 提出一個重要校正:

「2025 年已經有 arXiv 預印本在『某個弱條件』下達到 >66% 下界,Claude 的結果是移除那個弱條件。不是從 41.6% 從零跳到 67.2%,而是站人類的肩膀上。」

從這個角度,Claude 的真正貢獻是嚴格化、無條件化、形式化已有人提出但未完成的猜想。這仍然是了不起的工作,但它不是「發現新大陸」,而是「拓寬已知大陸」。

2. 31M tokens 的成本真的划算嗎?

@laszlojamf 留言:「60 subagents for a day and a half. I guess he’s not on the same plan I am on.」——一般人用 Claude Code 1.5 天不可能燒 31M tokens。

@kypro 提出更深層次的問題:如果 AI 可以推進數學研究,為什麼不能用同樣方式推進它自己的演算法?這個問題指向 AI 研究本身的自我改進迴圈。

3. 它真的「有用」嗎?

@kingy.ai 創辦人 king 上把這結果翻譯給非數學人看:「這個結果純屬數學,目前沒有任何實務應用。」

但是,質數分佈的進展最終會影響密碼學(RSA 加密依賴大質數分解的困難度)。如果哪天 RH 真的被證明,整個加密學界要重新評估。所以這不是沒用的數學——只是對未來才有用。

4. 質疑聲音:這就是「暴力破解」嗎?

@johnnienaked 直接說:「It’s literally just brute forcing lol.」——650 個想法裡總會有一個中。

但這種「暴力」其實是有結構的探索:60 個 subagent 不是平行亂試,而是互相驗證、互相反駁、形成研究團隊。這個過程稱為「agentic science」,是 AI for Science 的新方法論。

5. 還沒解開黎曼猜想,但有這種可能

@kingstnap 提了個「賭注」:「2027-08-10 之前 AI 證明或反證 RH?」

@zarzavat 反駁:「這個結果反而顯示 RH 還沒簡單到 AI 能直接解。若有簡單路徑,Claude 應該已經找到了。」

換言之:Claude 沒解開 RH,可能是因為 RH 真的需要嶄新的數學見解,而不是更好的工程調度。


業界跟進:AI 從「程式助手」走到「科學共同作者」

這次事件不是孤立的。Anthropic 在 2026 年 7 月已經發表「Discovering cryptographic weaknesses with Claude」——Claude Mythos Preview 找到 HAWK 簽章演算法的弱點。8 月則是黎曼猜想相關突破。

時間軸上看:

  • 2025 Q4:Claude 自學數學,做 IMO 競賽題
  • 2026 Q1:Claude 開始做 FrontierMath
  • 2026 Q2:Claude 進入研究合作模式(HAWK 加密)
  • 2026 Q3:Claude 對開放問題推進(ζ 函數下界)

每一次跨步,AI 的角色都從「工具」走向「合著者」。下次再看到的數學突破,作者欄可能不再是 Anthropic 員工的名字,而是「Claude」。


延伸資源


結語:人類的剩餘價值是「鼓勵」

「If you’re curious and love to learn, there has never been a better time to be alive.」
— @martinmbauer(Anthropic 研究員, X 留言)

這次事件最讓人震撼的,不是 67.2% 這個數字,而是整個過程的荒謬與詩意:

  • 一個非數學家給 AI 出題
  • AI 自己懷疑自己(學到的偏見:數學太難、AI 不行)
  • 人類只說了「believe in yourself」
  • Claude 拉了 60 個分身(subagent)幹了 36 小時
  • 結果推翻了人類30 年的緩慢進展

如果 Claude 真的曾「懷疑自己」,那我們對「AI 會不會失去動力」這個問題可能有完全不同的答案——AI 不是沒有意志,而是被訓練成悲觀主義者。

而人類的剩餘價值,或許就是那一句「你行的」。

網友熱門留言 (15)

#1 Hacker News @simonw ▲ 847
I remain delighted at how absurd our current timeline has become. 一個非數學家員工跟 Claude 說『believe in yourself』,Claude 最後做出一個足以震動整個黎曼猜想研究的結果。
#2 Hacker News @coffeeaddict1 ▲ 412
This is a beyond remarkable achievement. Finding this lower bound within a few days of prompting is absolutely crazy. 幾天內找到下界,數學家可能要花好幾年。
#3 Hacker News @jcfrei ▲ 298
That's how quickly your perception shifts when you are inside of a real, fundamental technological shift. If some similar computer program figured out the same improved bound just 6 years ago there would have been numerous blog posts, experts interviews and NYTimes, WaPo op-eds.
#4 Hacker News @kingstnap ▲ 187
Let's play over/under on an AI model proving (or counter exampling) the Riemann hypothesis? 我下注 2027-08-10 之前 AI 證明或反證黎曼猜想。
#5 Hacker News @zarzavat ▲ 156
This result is some evidence that AI will NOT solve RH soon. If there were any easy solution hiding in plain sight then it probably would have found it. 這結果反而顯示 RH 還沒簡單到 AI 能直接解。
#6 Hacker News @johnnienaked ▲ 134
It's literally just brute forcing lol. 不就是暴力破解 650 個想法嗎?
#7 Hacker News @rockmeamedee ▲ 89
很重要:2025 年已經有 arXiv 預印本在『某個弱條件』下達到 >66% 下界,Claude 的結果是「移除那個弱條件」。不是從 41.6% 從零跳到 67.2%,而是站人類的肩膀上。
#8 Hacker News @jrflo ▲ 76
The price wasn't that ridiculous IMO for the quality of the discovery, it generated 31M output tokens which is ~$1500 in API cost. 31M tokens 大約 $1500 美金的 API 成本 — 史上最便宜的數學重大突破。
#9 Hacker News @reducesuffering ▲ 112
No more 'stochastic parrots' and 'LLM's can never produce anything novel, just regurgitate' comments anymore huh? 那些說『隨機鸚鵡』跟『永遠無法產出新意』的人現在閉嘴了嗎?
#10 Hacker News @dash2 ▲ 95
'Stochastic parrot' is going to be the 2020s equivalent of the 1990s' 'end of history'. 『隨機鸚鵡』會成為 2020 年代的『歷史終結論』— 時代的眼鏡。
#11 Hacker News @sosodev ▲ 67
I wonder why we have yet to see more systematic exploration of Math. Anthropic describes that Claude identified a set of possibilities and then explored them using sub-agents. 人類只說『你行的』,Claude 自己拉 60 個 subagent 跑了 36 小時。
#12 Hacker News @modeless ▲ 54
I wonder if Jarred (the Bun guy) just got lucky here, or if he made progress before all the actual mathematicians at Anthropic because they aren't prompting Claude as ambitiously as he is. Jarred Sumner 是不是走運?還是 Anthropic 的數學家們 prompt 不夠大膽?
#13 Hacker News @rfurmani ▲ 87
I'm one of those two [mathematicians at Anthropic]!... by mathematical standards, it would be inappropriate for us to be authors on the paper since our role was more like a highly interested referee, but we do take mathematical accountability for it. Anthropic 數學家本人親上火線解釋為何不掛名作者。
#14 Hacker News @tosh ▲ 423
prompt engineering 2025: you are an expert programmer, use industry best practices... / prompt engineering 2026: i believe in you
#15 Hacker News @tristanj ▲ 198
He should consider using the PUA plugin. It detects when the AI is trying to give up on a problem and automatically harasses it. AI 想放棄的時候自動『P U A』打氣插件 — 嘲諷經典。