編按:本文綜合整理自 Anthropic 官方研究筆記、Neowin 報導、Hacker News 討論串(204 點 / 138 則留言),並加入 Siami 編輯部觀點與分析。
事件:Claude 沒解開黎曼猜想,但把「已知下界」狠狠推進
2026 年 8 月 10 日,Anthropic 發出一篇低調卻震撼數學圈的研究筆記:研究人員請一個尚未公開的 Claude 版本「對黎曼猜想認真下手」。Claude 沒解開懸賞 100 萬美元的克雷數學研究所千禧難題,但它在過程中,把一個長期停滯的下界常數,從 41.6% 推到 67.2%。
這不是什麼次要小改,是黎曼 ζ 函數「有多少非平凡零點落在臨界線上」這個下限,人類過去 37 年只進步了 0.8 個百分點,Claude 一次就拉高 25.6 個百分點。雖然仍未到 100%,但這個數字跳躍本身就是結果。
Claude 怎麼做到的:組合既有定理,動手的是「勇氣」
Claude 的技術貢獻不是發明新數學,而是把幾條早就在 arXiv 上的現成結論拼起來:
- Baluyot、Goldston、Suriajaya、Turnage-Butterbaugh 一系列近年工作——把 1973 年 Montgomery 的技巧從「必須假設黎曼猜想成立」解放出來,讓它能用於改進下界常數。
- Bombieri 2000 年的論文——提供進一步控制。
Claude 構造一個由 Weil 二次型誘導的函數空間,把「在線上」(正定)與「不在線上」(負定)子空間放在同一個框架下、不強制二次型對角化。用人話說:它願意把整個空間一次性處理,並對非對角項放手——這正是 Anthropic 數學家 Levent Alpöge 與 Ralph Furman 點出的「關鍵勇氣」。
驗證流程同樣值得記:
- 兩位 Anthropic 內部數學家(Levent Alpöge、Ralph Furman)審閱
- 外部專家 Brian Conrey、Dan Goldston 短時間檢視
- Eric Easley 與 Claude 合作產出 Lean 形式化證明,通過標準 comparator
Anthropic 自己也留了底:「我們不期待 Claude 用的技巧能解開黎曼猜想本身。」但這份工作是「AI 數學能力進步速度」的最新樣本。
數據解讀:為什麼 67.2% 是真突破,不是行銷話術
這裡有三個數字必須分開看,才不會被新聞稿帶風向:
- 41.6% → 67.2% 是可被證明的下界——不是「Claude 覺得」零點比例,是人類數學家用形式化證明能擔保的最低比例。換句話說,至少有 67.2% 的非平凡零點坐落在臨界線上,這是 Claude 證完、Lean 也驗過的硬結果。
- 過去 37 年只進步 0.8 個百分點——這對比的是「1973 Montgomery 假設成立能給出的下界」與「最新人類無條件下界」的差距。Claude 一次跳出 25.6 個百分點,跳得比 37 年人類全部加起來還多。
- 3,100 萬 output tokens + 60 個 subagent + 2,400 條 shell 指令 + 數百支 Python 腳本——這是純計算成本的體量。Anthropic 沒公布實際 API 費用,但按公開費率粗估,這是一次燒數千美元 token 預算的實驗。
質疑角度:Reddit 與 X 上有合理懷疑:Ethna Mollick 直接指出「叫模型相信自己」這種提示風格在舊模型上沒效;Lean 證明只驗形式、不驗背後的數學直覺是否真新;Anthropic 沒說明 67.2% 究竟離「100% = 黎曼猜想成立」還有多遠的拓撲距離。這是突破,但離千禧獎 100 萬美元還有距離。
方法論觀察:誰在當 prompt engineer、什麼時候它有效
仔細看這次實驗的「人」:
- Jarred Sumner(Anthropic 員工,非數學家)下 prompt 叫 Claude「真的認真試試」
- 最初的 650 個想法全部失敗
- 之後 Claude 開了約 60 個 subagent,跑 1.5 天
- Jarred 的輸入**基本上只是「keep going」**的變體
這個 pattern 跟 2026 年 7 月 Levent Alpöge 用 Claude Fable 反證 Jacobian 猜想如出一轍:操作者是「啦啦隊長」,不是「指導教授」。Wharton 教授 Ethan Mollick 的批評也對——prompting 是否真的 robust 還沒驗,但這已經是 Frontier AI「自主任務化」的第二次公開展示。
對開發者的意涵:
- 現成 arXiv 文獻是金礦:Claude 不是在想新定理,而是讀文獻、找「沒人拼過的組合」。這意味著「研究助理」在 Lean+arXiv 已經 cover 的領域會非常強。
- Math 仍然是高價值場景:這次 + 7 月 Jacobian 案例,純數學兩個月內被 AI 推進兩次。Fortune 形容這個變化「very rapid and very unsettling」。
為什麼這件事重要
這次事件把「AI 對數學的影響」從單純的工具輔助推進到獨立產出新結果的層級。67.2% 不會讓黎曼猜想被證明,但 Anthropic 內部數學家 Ralph Furman 自己說的「一年前還在幫我省時間,現在直接給我跑不出來的结果」是真正的轉捩點——AI 從學徒變同事。
接下來觀察重點:
- 獨立第三方是否重現——目前 Anthropic 兩位數學家 + 兩位外部專家「檢視」,還沒有正式的期刊 peer review 流程。
- 此技巧是否可移植到其他 L-function / Selberg class——這類組合論證的泛用性才是真正的價值。
- 「鼓勵式 prompting」是模型新能力還是 flavor——Mollick 的質疑點到了:如果只是 unreleased 版本自帶的隱性能力,這次實驗的可重現性就是問題。
網友熱門留言 (4)