← 返回 Siami 首頁

未公開版本 Claude 推進黎曼猜想下界:31M tokens、60 個 subagent 把 41.6% 拉到 67.2%

▲ 204 💬 138
未公開版本 Claude 推進黎曼猜想下界:31M tokens、60 個 subagent 把 41.6% 拉到 67.2%

編按:本文綜合整理自 Anthropic 官方研究筆記、Neowin 報導、Hacker News 討論串(204 點 / 138 則留言),並加入 Siami 編輯部觀點與分析。

事件:Claude 沒解開黎曼猜想,但把「已知下界」狠狠推進

2026 年 8 月 10 日,Anthropic 發出一篇低調卻震撼數學圈的研究筆記:研究人員請一個尚未公開的 Claude 版本「對黎曼猜想認真下手」。Claude 沒解開懸賞 100 萬美元的克雷數學研究所千禧難題,但它在過程中,把一個長期停滯的下界常數,從 41.6% 推到 67.2%。

這不是什麼次要小改,是黎曼 ζ 函數「有多少非平凡零點落在臨界線上」這個下限,人類過去 37 年只進步了 0.8 個百分點,Claude 一次就拉高 25.6 個百分點。雖然仍未到 100%,但這個數字跳躍本身就是結果。


Claude 怎麼做到的:組合既有定理,動手的是「勇氣」

Claude 的技術貢獻不是發明新數學,而是把幾條早就在 arXiv 上的現成結論拼起來:

  • Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 一系列近年工作——把 1973 年 Montgomery 的技巧從「必須假設黎曼猜想成立」解放出來,讓它能用於改進下界常數。
  • Bombieri 2000 年的論文——提供進一步控制。

Claude 構造一個由 Weil 二次型誘導的函數空間,把「在線上」(正定)與「不在線上」(負定)子空間放在同一個框架下、不強制二次型對角化。用人話說:它願意把整個空間一次性處理,並對非對角項放手——這正是 Anthropic 數學家 Levent Alpöge 與 Ralph Furman 點出的「關鍵勇氣」。

驗證流程同樣值得記:

  • 兩位 Anthropic 內部數學家(Levent Alpöge、Ralph Furman)審閱
  • 外部專家 Brian Conrey、Dan Goldston 短時間檢視
  • Eric Easley 與 Claude 合作產出 Lean 形式化證明,通過標準 comparator

Anthropic 自己也留了底:「我們不期待 Claude 用的技巧能解開黎曼猜想本身。」但這份工作是「AI 數學能力進步速度」的最新樣本。


數據解讀:為什麼 67.2% 是真突破,不是行銷話術

這裡有三個數字必須分開看,才不會被新聞稿帶風向:

  1. 41.6% → 67.2% 是可被證明的下界——不是「Claude 覺得」零點比例,是人類數學家用形式化證明能擔保的最低比例。換句話說,至少有 67.2% 的非平凡零點坐落在臨界線上,這是 Claude 證完、Lean 也驗過的硬結果。
  2. 過去 37 年只進步 0.8 個百分點——這對比的是「1973 Montgomery 假設成立能給出的下界」與「最新人類無條件下界」的差距。Claude 一次跳出 25.6 個百分點,跳得比 37 年人類全部加起來還多。
  3. 3,100 萬 output tokens + 60 個 subagent + 2,400 條 shell 指令 + 數百支 Python 腳本——這是純計算成本的體量。Anthropic 沒公布實際 API 費用,但按公開費率粗估,這是一次燒數千美元 token 預算的實驗。

質疑角度:Reddit 與 X 上有合理懷疑:Ethna Mollick 直接指出「叫模型相信自己」這種提示風格在舊模型上沒效;Lean 證明只驗形式、不驗背後的數學直覺是否真新;Anthropic 沒說明 67.2% 究竟離「100% = 黎曼猜想成立」還有多遠的拓撲距離。這是突破,但離千禧獎 100 萬美元還有距離。


方法論觀察:誰在當 prompt engineer、什麼時候它有效

仔細看這次實驗的「人」:

  • Jarred Sumner(Anthropic 員工,非數學家)下 prompt 叫 Claude「真的認真試試」
  • 最初的 650 個想法全部失敗
  • 之後 Claude 開了約 60 個 subagent,跑 1.5 天
  • Jarred 的輸入**基本上只是「keep going」**的變體

這個 pattern 跟 2026 年 7 月 Levent Alpöge 用 Claude Fable 反證 Jacobian 猜想如出一轍:操作者是「啦啦隊長」,不是「指導教授」。Wharton 教授 Ethan Mollick 的批評也對——prompting 是否真的 robust 還沒驗,但這已經是 Frontier AI「自主任務化」的第二次公開展示。

對開發者的意涵:

  • 現成 arXiv 文獻是金礦:Claude 不是在想新定理,而是讀文獻、找「沒人拼過的組合」。這意味著「研究助理」在 Lean+arXiv 已經 cover 的領域會非常強。
  • Math 仍然是高價值場景:這次 + 7 月 Jacobian 案例,純數學兩個月內被 AI 推進兩次。Fortune 形容這個變化「very rapid and very unsettling」。

為什麼這件事重要

這次事件把「AI 對數學的影響」從單純的工具輔助推進到獨立產出新結果的層級。67.2% 不會讓黎曼猜想被證明,但 Anthropic 內部數學家 Ralph Furman 自己說的「一年前還在幫我省時間,現在直接給我跑不出來的结果」是真正的轉捩點——AI 從學徒變同事。

接下來觀察重點:

  • 獨立第三方是否重現——目前 Anthropic 兩位數學家 + 兩位外部專家「檢視」,還沒有正式的期刊 peer review 流程。
  • 此技巧是否可移植到其他 L-function / Selberg class——這類組合論證的泛用性才是真正的價值。
  • 「鼓勵式 prompting」是模型新能力還是 flavor——Mollick 的質疑點到了:如果只是 unreleased 版本自帶的隱性能力,這次實驗的可重現性就是問題。

進一步閱讀

網友熱門留言 (4)

#1 lorenzohess ▲ 312
把整個二次型放在一起處理、允許它非對角化——這就是讓這次跳躍變得可能的那一步。幾十年的文獻其實一直擺在桌上,等著有人把它們拼起來。
#2 Hacker News 評論 ▲ 187
650 次失敗、再 60 個 subagent、2,400 條 shell 指令、3,100 萬 token — 而一個非數學家的 prompt 工程師只需要一直說「keep going」。有時候瓶頸真的就是耐心。
#3 Ethan Mollick (@emollick) ▲ 154
喔不,我們該不會又要回到那種 prompting 風格吧?我很希望 Anthropic 認真測試這招是否真的 robust,我們用稍舊的模型實驗的結果是 no。
#4 Ralph Furman (@rfurmaniak, Anthropic) ▲ 421
一年前我還在興奮 AI 能不能幫我省下我 PhD 幾年時間幫我找相關結果。現在它直接跑出我可能根本跑不出來的結果。勇敢新世界。