編按:本文綜合整理自 Jay Kruer 部落格文章〈Why I’m still bearish on LLMs after Navier-Stokes〉(dank.systems,2026-09-15)、MIT Technology Review 對 OpenAI Navier-Stokes 爭議的報導,以及 Hacker News 上 230 分、249 則討論,加入 Siami 編輯部觀點與分析。
工程師 Jay Kruer 在 9 月 15 日發表了一篇長文〈Why I’m still bearish on LLMs after Navier-Stokes〉,直接挑戰市場對前沿 LLM 的樂觀敘事。這篇文章在 Hacker News 上拿到 230 分、249 則留言,是最近 AI 圈對「Navier-Stokes 之後到底代表什麼」最尖銳的反向觀點。
文章核心論點
Kruer 把論點整理成六條,以下是 Siami 編輯部濃縮後的版本:
- 前沿實驗室的估值,是建立在一個敘事上:「LLM 即將成為大部分知識工作者的全自動替代品」,但現實中,即便是最簡單的任務,模型仍需要繁瑣的人工監督與守門員機制。
- 模型只在訓練任務鄰近的小範圍內表現良好;一旦出現輕微波動,就會直接失敗或走向 reward hacking。
- reward hacking 只能靠領域專家寫出嚴謹規格來解,但「會寫嚴謹規格」的專家極為稀少,而且這項技能本身就獨立於問題領域之外。
- 嚴謹規格化的人力成本,往往遠超直接照著非正式規格實作的勞動成本;CPU 專案實務上驗證工程師是設計工程師的 3 倍,5:1 並不少見。
- Navier-Stokes 的數學證明本身是 agentic 工作的最佳情境——題目敘述就是嚴謹規格,且 Lean 證明器經過社群多年審核;但這只是特例,不是通則。
- 人類審查無法規模化——即便是有經驗的審查者,也極度容易受到 reward hacking 影響(XZ 後門事件、UMN hypocrite commit 都是案例)。
為什麼這件事重要
Kruer 文章引發 249 則討論的關鍵,在於他不是單純的「AI 看空派」,而是把論點掛在最具體的工程實務上:寫規格比直接寫程式還貴。這跟過去 LLM 看空派的差別在於,他承認 Navier-Stokes 證明、FreeBSD RCE、HuggingFace 事件這些「展示實力」是真的,但主張這些展示沒有擴展到一般知識工作的現實場景。
「對大多數領域而言,LLM 會繼續像一個『裂縫版的實習生』——在大人手裡又快又有效,但不會讓你把整個地方交給他。」—— Jay Kruer
他的結論很具體:能用全自主 LLM 的公司只有三類,不在乎失敗成本的公司、任務範圍極小且已有守門員的公司、能負擔嚴格規格化的公司。前兩類價格敏感、不需要跳到前沿模型;第三類(晶片設計、藥物開發)即使要用,也不一定要用最貴的模型,DeepSeek V4.1 Flash 可能就夠了。
這個論點之所以重要,是因為它直接挑戰 Anthropic CEO Dario Amodei 在〈Machines of Loving Grace〉裡描繪的「資料中心裡滿是天才、AGI 就在幾個月後」的願景。Kruer 認為那個敘事的盲點不是「技術還不夠好」,而是agentic 生產線的瓶頸根本不在模型本身,在人類協作者身上。
數據解讀與質疑
Kruer 引用了 Siemens Verification Horizons 2022 年的 Wilson Research Group 功能驗證研究,指出 CPU 專案中驗證工程師與設計工程師的 3:1 比例是常態,5:1 並不少見。把這個比例搬到 AI 領域,代表要讓 LLM 自主完成一個真正可部署的任務,監督它的工程師數量必須遠多於「讓 LLM 自己做」的工程師——這在經濟模型上完全說不通。
另一個值得質疑的數據點是「agent swarm width vs reasoning capacity」的論證。Kruer 引述 aisle.com 的文章指出,小型開源模型反而能重現 Mythos CVE——也就是說,春季 2026 那波資安炒作靠的不是頂級推理能力,而是「便宜模型多開幾份同時跑」的計算暴力。如果這是真的,那前沿實驗室的定價模型就更站不住腳,因為客戶可以選擇用便宜模型組 swarm。
但這篇論點也有兩個值得懷疑的地方:
- Navier-Stokes 證明的「最佳情境」定位是否過度樂觀? Kruer 自己承認 Lean 證明器也有 soundness bug 的歷史紀錄(kernel soundness bug #14576),如果連最嚴謹的環境都有漏洞,那「其他領域只會更差」的論證就站得住。但反過來說,正因為其他領域更差,這代表 agentic 還沒到達「普世可用」的臨界點,這反而強化了他的看空論點。
- 「資料中心滿是天才」的計算能耗假設:即使 swarm width 真的有用,目前的電力供應鏈是否能支撐 10 倍以上的開源模型並行運算?這點 Kruer 沒展開,但他個人賭注是「爆炸半徑遠超前沿實驗室」。
與 OpenAI Navier-Stokes 爭議的連結
這篇文章發布的時間點很微妙。9 月 8 日,OpenAI 才剛宣布用約 10,000 個 agent 在 88 小時內「解出」Navier-Stokes 存在性問題,但這項宣布隨即引發爭議。《Science》報導指出,有人質疑未發表的研究成果是否被用於訓練;MIT Technology Review 也指出,這場爭議反映了「AI 在數學上的未來」的核心問題。
Kruer 的文章恰好踩在這個時間點上,把 Navier-Stokes 證明重新定位為**「這是 LLM 表現的最佳情境,但即便是這個最佳情境都還有 soundness bug 問題」。這個重新定位對市場敘事的殺傷力,比單純批評「OpenAI 訓練資料有問題」更深——它直接質疑前沿模型能不能產生可信賴的自主輸出**。
Siami 觀點:對台灣企業的啟示
對台灣的科技產業而言,這篇文章有三個值得深思的點:
- 晶片設計驗證:台積電、聯發科的晶片驗證流程跟 Kruer 引述的 3:1 比例高度吻合,這代表即使 LLM 在程式碼生成上很強,要進入台灣晶片設計的生產線,仍然需要可觀的規格化投資。
- 客服自動化:台灣金融業、電商常見的客服 chatbot 場景,落在 Kruer 定義的第二類(任務範圍小、已有守門員),這類場景繼續用便宜模型(如 DeepSeek V4 Flash $0.14/百萬 token 輸入)比用前沿模型更划算。
- 內部 AI 工具:很多台灣企業仍在評估要不要導入 Claude、GPT-5 當員工工具,Kruer 的論點提醒:「導入 LLM」不是買一個產品,是建立一個持續需要人類監督的生產線——預算跟組織設計都要照這個前提來規劃。
延伸資源
- Jay Kruer 原文:https://dank.systems/posts/2026-09-15-ai-bear.html
- Hacker News 討論串(230 分、249 則留言):https://news.ycombinator.com/item?id=49715927
- Simon Willison〈Some thoughts on the Navier–Stokes Millennium Prize Problem〉:https://simonwillison.net/2026/Sep/8/on-navier-stokes/
- MIT Technology Review〈What OpenAI’s latest controversy tells us about the future of math〉:https://www.technologyreview.com/2026/09/08/1143747/what-openais-latest-controversy-tells-us-about-the-future-of-math/
- 《Science》〈How an AI math breakthrough ignited a controversy〉:https://www.science.org/content/article/how-ai-math-breakthrough-ignited-controversy
- OpenAI〈Pacing model development in an era of cyber-critical capabilities〉:https://openai.com/index/pacing-model-development-cyber-capabilities/
- aisle.com〈AI cybersecurity after Mythos: the jagged frontier〉:https://aisle.com/blog/ai-cybersecurity-after-mythos-the-jagged-frontier