← 返回 Siami 首頁

可無限延伸參數的 LLM:用即時對話資料即時生成模型權重

▲ 83 💬 25
可無限延伸參數的 LLM:用即時對話資料即時生成模型權重

編按:本文綜合整理自 arXiv:2609.18842(Boltzbit Limited 與劍橋大學於 2026-09-16 投稿)、Hacker News 討論串,並加入 Siami 編輯部觀點與分析。當大型語言模型被部署上線後,它的權重就凍結了——這是目前所有主流 LLM 的預設假設,也是 scaling laws 給出的最強推論路徑。但一篇剛放上 arXiv 的新論文(編號 2609.18842)打算從根本上翻轉這個假設:模型不該在 inference 時保持靜止,而是該把這次對話學進它的權重裡。

這個問題:公開人類文本快用完了研究團隊(Boltzbit Limited + 劍橋大學)在論文的開頭點出一個讓所有 AI 工程師夜不能寐的事實:公開的人類文本存量預計會在 2026 到 2032 年之間耗盡(引述 Villalobos 等人 2024 年的 epoch AI 預測)。換言之,「拿更多文本去 pretrain 一個更大的模型」這條過去五年幾乎是行業唯一前進路徑,即將撞牆。但同時,新資料並沒有停產,只是換了形式。從使用者問的問題、貼上來的文件、給的修正,到代理人觀察到的結果——這些 inference 階段源源不絕產生的「interaction data」,恰恰是讓模型變得對這個使用者、這個任務更有用的關鍵訓練資料。問題是:現在的模型不會從中學習,因為它的權重已經結冰。現行做法只能用 prompt engineering、retrieval、long context、agent harness 把這些資料「黏」在模型外面,每次請求都重讀一次,請求結束就丟掉。


核心構想:MoE 是 LLM 的「動態權重」原型要理解這篇論文在做什麼,得先看 Mixture-of-Experts(MoE)架構怎麼被重新詮釋。業界通常說 MoE 是「DeepSeek-V3 存了 671B 參數但每個 token 只激活 37B」。但研究團隊指出:換個視角,MoE 本質上就是一個權重隨輸入變化的稠密網路。對 token x,一個 MoE 層會算出有效權重 W_eff(x) = Σᵢ gᵢ(x) · Wᵢ——也就是「根據輸入挑選不同專家」這件事,本質就是「讓權重變成輸入的函數」。這個洞察的關鍵意義:DeepSeek-V3 之所以強,不只是因為它大,而是因為它的權重對每個 token 而言都是量身打造的。但 MoE 有兩個限制,論文要解決的正是這兩點:

  1. 記憶體代價高:雖然每個 token 只激活少數專家,但 router 可能挑到任何一個,所以所有專家都得常駐記憶體。
  2. 專家庫固定:訓練結束後存進去的專家就定型了——早上九點服務醫生的模型,跟凌晨服務小說家的模型,從同一個不變的專家庫挑選,沒有差別。

論文貢獻:Hypernetwork × Bayesian 信念更新新論文的提議叫做 Infinite-Parameter LLM。架構由三個元件組成:

  • 共享基底網路:所有 token 共用的固定部分。
  • 緊湊型 hypernetwork(小型神經網路):根據「目前這輪對話」的內容,輸出基底網路的低秩(low-rank)調整。換言之,FFN 的權重是從 live data 即時生成的,不是從固定的專家庫裡挑。
  • Bayesian 信念濾波器:對 hypernetwork 的潛在編碼(latent code)維持一個後驗分佈,每收到一個新 token 就遞迴更新——這樣有效權重會隨著 session 進行而持續演化,不會被讀一次就凍結。這個組合的關鍵特性:

儲存的 footprint 維持固定,但模型能編譯出的有效權重是無界的。所以叫「無限參數」——精準指的是「可達成的權重 / 行為集合」是無界的,不是模型本體無窮大。與既有的「hypernetwork 當 encoder」路線(Charakorn 等人 2025)的差別在於:那些工作每次只從 context 讀一次、生出一個 adapter、然後凍結。新論文的差異點在於:

把讀進來的 latent code 當成潛在變數,加上 prior,並用 amortized recursive Bayesian filter 持續更新——所以權重不只是被生成的,而是會隨對話進程演化的。


為什麼這件事重要這個研究至少有四個層面的意義,把 AI 系統的未來路線往一個新方向推。

第一,它正面回應了預訓練資料耗盡的危機。Scaling laws 過去五年靠的是「更大模型 × 更多資料」,但 2026-2032 公開文本枯竭意味著這條路徑的天花板就在眼前。把 inference 階段源源不絕的 interaction data 變成模型可學習的素材,等於開了一條全新的資料供給線——而且這條線只會愈來愈寬,因為部署越多 AI agent,互動資料成長越快。

第二,它重新定義了 MoE 的可能性。MoE 過去十年被理解成「省 inference 計算量的工程技巧」,但這篇論文把它放回 Bengio 等人 2013 年、Shazeer 等人 2017 年提出的「conditional computation」原始脈絡:讓網路變成輸入的函數才是重點,參數量只是副作用。這個觀點的轉移,可能會啟發一整批新工作。

第三,它挑戰了「in-context learning 夠用就好」的工程預設。現在業界的主流工程假設是「模型訓練完就好,所有新東西靠 prompt、RAG、agent harness 解決」。這篇論文明確指出:把資料寫進權重是「amortized in compute, frees the context window, persists across turns, and can generalise better than in-context use」——四個好處同時拿到。對在 production 跑 agent 的工程師來說,這意味著某些今天必須做 RAG 的場景,未來可能直接讓模型學進去就好。

第四,它暗示了 AI 競賽的下半場是「個人化」。MoE 的專家庫對所有使用者、所有時段都是同一份;Infinite-Parameter LLM 的權重則是「為這個使用者、這個 session、這個任務」即時編出來的。這讓「每位使用者都有一個自己的模型」從工程笑話變成可達成的架構目標。


數據解讀與質疑論文提出的評估協議明確把 Infinite-Parameter LLM 跟 in-context learning、retrieval 做對比測試。預期結果如果成立,將是 Siami 認為值得報導的硬實證;但在看到具體數字之前,讀者應該抱持合理的懷疑。

對架構本身的質疑(來自 Hacker News 留言):讀者 opus5_hater 看完論文後指出,「這比較像動態版的 LoRA——更新的是權重,不是訓練方法」。這個觀察技術上是對的,但論文作者的回應不是「我們發明了新訓練方法」,而是「我們提供了一個讓 inference 時可持續編輯權重的架構延伸」,這兩件事的創新本質不同。LoRA 是固定的低秩調整;本論文是對 live data 生成低秩調整、且帶 Bayesian 信念演化——差別在於「調什麼」是動態決定的,不是凍結的。

對 scaling laws 的質疑:論文明確指出,這個架構不違反容量定理(≈ 2 bits per parameter),並不會讓小模型變得能存更多東西。它改變的是「什麼算數據」、「什麼算模型」的邊界——而不是「模型可以無限大」。所以它不是要取代 pretraining,而是延伸 pretraining 之後的生命週期。

對「個人化是否必要」的質疑:HN 留言出現了從「這會徹底改變科學進度」(Betelbuddy)到「我們不需要 AI 大腦,好好做研究就好」(hmartin)的光譜。對 AI 工程師而言,「個人化」是產品差異化利器;對社會觀察者而言,「每個人都有一個自己模型」的能源與治理成本才剛開始被討論。這篇論文只是讓這個辯論變得更架構上迫切。

一句話總結:本論文不是宣告「Scaling Laws 結束」,而是宣告「Scaling Laws 之後的下一步開始被具體設計」——而且這一步的方向,是從「靜態資料 → 動態模型」的根本翻轉。


後續發展與值得追蹤的方向這篇論文 2026-09-16 才公開,距今兩天;對一個改寫 inference 時行為的新架構而言,下一步通常會落在三個面向:

  1. 可重現性與實測數據:Boltzbit Limited 是否會釋出預訓練權重與評測碼?如果釋出,整個 MoE 社群(包括 DeepSeek、Qwen、Kimi 團隊)會用同一套協議做橫向比較。
  2. 在 agent 系統的早期試點:長期記憶、agent memory、RAG 系統的設計者,可能會是第一波拿這個架構當 prototype 的人。
  3. 跟記憶體的 trade-off:hypernetwork 每個 token 即時生成權重,雖然 footprint 固定,但每步計算比從固定銀行取權重貴。論文是否充分論證了「總延遲仍可接受」這件事,會是實務工程師最在意的部分。如果這個方向在 2027 年被驗證可行,今天產業界對 LLM 的所有直覺(凍結權重、靠 prompt 補課、用更大預訓練資料壓過去)都會被改寫。

本研究原始檔:arXiv:2609.18842 · 討論串:Hacker News · 觀點引申:NeurIPS 2020 Infinite-Width Hypernetworks · Bayesian Hypernetworks 2017

網友熱門留言 (5)

#1 Betelbuddy ▲ 41
想像一下任何個人嘗試新方法解決問題、做新發現,每一點微小進展都即時整合進模型本身。這會把科學進度從『寫論文、同儕審查、發表、再被後續研究引用』這種慢節奏,變成『集中式概念庫 + 動態融合』。
#2 opus5_hater ▲ 28
從論文快速看一遍,他們基本上是在示範如何用一個小矩陣做線上投影更新權重,比較像動態版的 LoRA。改的是權重,不是架構或訓練方法。權重本來就不是研究界的貨幣,而是某次訓練的貨幣——這篇本身倒是新增了一種架構延伸。
#3 robotresearcher ▲ 15
這種東西簡直是量身訂做的壟斷標的。想像一下『第二版網際網路內容』是什麼:一個開放的搜尋引擎索引、Web 3.0 真正為 AI agent 設計、可被查詢的答案庫?
#4 jester997 ▲ 9
原 PO 講的不是那個意思(如果我沒看錯)。他是在說『負面結果』是有價值的知識,但這種東西很難被發現和整理,因為它們通常從來不會被發表。站這麼高講別人也是滿有趣的。
#5 hmartin ▲ 7
從古騰堡印刷術到麥斯威爾方程到愛因斯坦,靠的是鉛筆和紙,或許再加塊石板。不需要 AI 驅動的全球機器大腦。好好做研究,發現就會出現,或別人會站在你的工作上做下一步發現。電網可能會倒,可能會被 AI 群攻擊癱瘓。那時候我們就只能拿鉛筆和石板了 :)