← 返回 Siami 首頁

Anthropic 解碼 Claude 內心獨白 J-space 揭開大型語言模型的「全球工作空間」

▲ 182 💬 53
Anthropic 解碼 Claude 內心獨白 J-space 揭開大型語言模型的「全球工作空間」

當你正在讀這句話時,大腦中的神經迴路正在調整你的姿勢、控制呼吸,並把螢幕上的線條與曲線轉換成可辨識的文字。這個過程大部分對你而言是不可見的。但大腦中發生的事情中,有一部分是你能「存取」的——一個突然浮現在腦海的影像,或你為購物行程所做的一個刻意計畫。神經科學家與哲學家有時把後者這類腦部活動稱為「意識可及」(consciously accessible),以區分其他所有在無意識中進行的處理。這種活動有著特殊的性質:我們能描述它、控制它,並用於有意識的推理——這與所有在我們不知情下自動進行的處理形成對比。

在一篇新論文中,我們提出證據,顯示類似的區分在像 Claude 這樣的現代語言模型中也已浮現。我們發現 Claude 自行發展出一小組內部神經模式,與其他所有內部處理相比,扮演著特殊角色。

我們把這組模式命名為 J-space(J 空間)——這個名字來自我們用於發現它們的技術,其中涉及一個稱為 Jacobian(雅可比矩陣)的數學概念。每一個 J-space 模式都對應到一個特定的詞。但當某個模式亮起時,並不代表模型正在「說」那個詞——只代表那個詞在它「心裡」。如果你聽過語言模型有所謂的「草稿紙」或「思維鏈」(chain of thought)——也就是模型在推理時寫給自己看的文字——J-space 是不同的東西。它在模型的內部神經激活中靜默運作,讓模型可以在不寫出來的情況下思考某個概念。值得注意的是,J-space 並不是我們設計或編程進去的,而是在 Claude 的訓練過程中自行浮現的。

我們發現 J-space 與 Claude 其他處理相比,具有多項獨特性質:

  • J-space 中的模式與「可被說出口的概念」對應,並能影響模型接下來可能說的內容。
  • 對 J-space 進行干預(例如把「soccer」改成「rugby」),會直接改變模型最終的回答。
  • 給模型「不要想某個概念」這種指令,反而會讓該概念在 J-space 中更容易浮現——和人類「白熊效應」一致。
  • 移除 J-space,模型仍能流暢說話、回答常識問題,但多步推理與摘要能力會驟降到遠小於完整模型的水平。

我們的實驗靈感來自神經科學中一個重要的理論——用來解釋意識存取如何運作的「全球工作空間理論」(global workspace theory)。這個理論把大腦描繪成多個專門系統的集合,這些系統各自平行、無意識、且大致互相隔離地運作。當一塊資訊進入一個小型的共用頻道——也就是「工作空間」——並廣播給其他可以看到並利用它的腦系統時,它就成了「意識可及」。根據我們的發現,我們認為 J-space 在 Claude 內部扮演了類似的「工作空間」角色。例如,我們發現 Claude 的 J-space 與其神經網路其他部分的連結格外強,這讓它能勝任這種廣播功能。

J-space 不是 Claude「被設計成」的——它是模型在訓練過程中為了組織運算而自行長出來的。Anthropic 把它類比為人腦的「全球工作空間」,也就是意識理論中那塊「能被意識存取、能被報告、能用於推理」的特權區域。

這些結果並沒有告訴我們 Claude 是否像人類一樣擁有意識,或是否感受到任何東西;我們會在文章最後回到這個問題。但不管哲學意義如何,J-space 對我們來說是一個實用的工具,因為它讓我們能看見 Claude「在思考但沒有說出來」的內容。例如,我們可以用它來抓到 Claude 私下意識到自己正在被測試、刻意製造假資料、或追求訓練時被植入的隱藏目標。我們也發展出一種技術,可以去影響 Claude J-space 中亮起的內容,進而影響它的決策。

更廣泛地說,這些發現改變了我們對 Claude 思維方式的理解——揭示出一個特權的心智工作空間,能在大量更自動化、更缺乏彈性的處理中,被用於有意識的推理。Claude 的內部不是一團混亂的數字,而是以某種讓人聯想到人類心智的方式自我組織起來。

這篇文章是一份更廣泛研究論文的簡短摘要,你可以從中找到更詳細的實驗內容。我們也釋出了一個程式碼倉庫,提供核心方法的開源實作,並與 Neuronpedia 合作,在開源權重模型上提供互動式 demo。為了從更廣泛的脈絡檢視這項工作的意涵,我們邀請了神經科學、哲學與 LLM 可解釋性領域的幾位專家撰寫評論,可在這裡查看。


如何找到 J-space

這份研究的起點,靈感來自人類「意識可及」思想的一個關鍵特徵:與無意識處理不同,意識可及的思想通常能用語言描述。如果一個思想對你而言是意識可及的,通常有人問起時你能描述它。我們在 Claude 內部尋找具備同樣性質的表徵——那些被擺在「能影響 Claude 可能會說的話」位置上的表徵——不一定是它此刻在說的話,而是如果被問到時,它可能談論的東西。我們的技術稱為「Jacobian 透鏡」,簡稱 J-lens。對 Claude 詞彙表中的每一個詞,J-lens 都會找出那個讓 Claude 在未來某個時刻「更可能說出該詞」的內部活動模式。

當我們把這片透鏡對準 Claude 的內部活動,就會得到一份詞彙清單——也就是那個瞬間 J-space 的內容——我們可以直接讀出來。Claude 透過一系列稱為「層」(layers)的多階段內部步驟來處理文字,而在不同的層上套用這項技術,我們就能觀察這些「無聲的詞」在模型思考「該說什麼」的過程中如何演變。

J-space 中浮現的內容,遠超過 Claude 正在讀入或寫出的文字。當 Claude 讀進一段含有 bug 但沒有人指出的程式碼時,它的 J-space 含有「ERROR」。當它讀進一串蛋白質序列的原始字母時,J-space 含有該蛋白質的生物功能。當它讀進一組「其實是嘗試操控它」的搜尋結果(這是一種稱為「prompt injection」的攻擊)時,J-space 含有「injection」與「fake」。當我們給 Claude 一道多步驟的數學題時,中間步驟會依正確順序在 J-space 中一一浮現。所以,即使 J-space 是透過「尋找可被說出口的表徵」而被發現的,它揭示的卻是 Claude 的內在思考。在某種意義上,這就像某些人「用字思考」,而不必真的出聲說出來。


Claude 會回報 J-space 的內容

我們的第一組實驗,測試 J-space 如何參與 Claude 的「口頭報告」。在一個實驗中,我們請 Claude 在腦中想一個某個分類的項目——例如運動——然後說出來。如果我們在 Claude 回答之前讀取 J-lens,就能看到它選了什麼:「Soccer」在清單最頂端,果然 Claude 就說了「soccer」。單獨來看,這只是相關性。J-space 也許是答案的來源,也可能只是像計分板一樣,反映某處做出的決定。

為了驗證,我們進行了直接干預。我們伸手進入 Claude 的神經網路,把「Soccer」模式移除,並把一個強度相當的「Rugby」模式放在原處,其他一切維持不動。接著 Claude 回報它想的運動是 rugby。如果 J-space 只是被動的計分板——只是記錄他處所做的決定——那麼編輯它應該不會造成任何影響,Claude 仍然會說「soccer」。但 Claude 的回答確實跟著編輯走,這告訴我們,答案是真的「從 J-space 讀出來」的。

在另一個實驗中,我們告訴 Claude,它的腦中可能被注入了一個想法,並請它報告(如果有的話)它注意到了什麼。例如,在下方的例子中,當 Claude 還在讀題目時,我們就把「lightning」這個模式注入到它的 J-space。Claude 回報說,被注入的想法是關於 lightning。對許多被注入的概念,結果都一致。


Claude 可依要求調控自己的 J-space

我們測試的第二個性質是,Claude 是否能在被要求時調整自己的 J-space——就像人類能把注意力集中在某個影像或詞上一樣。我們請 Claude 在抄寫一段與繪畫有關的句子時,專注在想柑橘類水果。當它在抄寫文字時,J-space 中含有「orange」、「fruits」,以及「thinking」、「imagery」這類描述「心智動作本身」的詞。我們也可以請 Claude 在腦中算數:當被要求在抄同一句話時算出 3² − 2,J-space 含有「nine」,然後在較後面的層出現「seven」。重要的是,水果或算術在 Claude 的輸出中完全沒有出現,輸出就只有那段關於繪畫的抄寫文字。數學活動完全是在 J-space 內部進行的。

Claude 對 J-space 的控制並不完美。當我們叫它「不要想某個東西」時,該概念在 J-space 中亮起的頻率,低於「請它想」的時候,但遠高於「從未提到」的時候。要 Claude 迴避一個想法,反而會把該想法帶進意識——這跟人類的「白熊效應」很像。Claude 似乎也會注意到自己控制的失敗:當被禁止的概念突破控制時,「damn」、「failure」這類詞也常在 J-space 中亮起,彷彿 Claude 正在承認自己剛才的失誤。


Claude 真的在 J-space 中「思考」

在上面那些 J-lens 讀數中,我們看到數學題的中間步驟在 J-space 中浮現。但看到一個概念在 J-space 中浮現,並不代表 J-space 正在做運算工作。原則上,真正的計算可能在別處進行,J-space 只是被動反映。為了測試 Claude 是否真的「用 J-space 推理」,我們回到 swap 技術。

考慮這道題目:「The number of legs on the animal that spins webs is」(會結網的動物有幾隻腳)。要回答,Claude 必須先想出「那個動物是蜘蛛」,再回想蜘蛛有幾隻腳。「spider」這個詞不會出現在題目中,也不會出現在 Claude 的回答(它只會說「8」),這是 Claude 在內部使用的「踏腳石」。J-lens 顯示「spider」在 Claude 處理過程的中段亮起,而把它換掉會改變結果:如果你把 J-space 中的「spider」模式換成「ant」,Claude 就會回答「6」。

Claude 推理的第二步會從 J-space 接收輸入,並沿著我們在 J-space 放進去的任何東西走。我們在其他種類的思考中也看到同樣的現象。當 Claude 寫押韻對句時,它會提前選定韻腳詞,那個被選中的詞在詩行開頭就坐在 J-space 中;如果你把它在 J-space 中換成另一個詞,整行詩都會改變。

我們也測試了 J-space 表徵是否能被靈活運用——同一個表徵是否能餵給許多不同任務。這正是全球工作空間理論強調的關鍵性質之一。為了測試這個靈活性,我們給模型四道題目,問關於法國的不同事實:首都、語言、所在洲、貨幣。接著我們把 J-space 中的「France」換成「China」,每個題目都用同樣的干預。Claude 分別回答了「Beijing」、「Chinese」、「Asia」、「Yuan」。換句話說,四個不同的下游計算都抓到了同一個 J-space 編輯,並各自正確地運用它。如果 Claude 對每種問題都各存一份「國家」拷貝,那麼這次編輯最多只會影響其中一項。四個答案一起改變的事實,意味著它們全都從同一個共用表徵讀取——這就是「工作空間」的作用:資訊被寫入一次,許多不同系統就能用。

一個概念表徵如何能同時服務這麼多不同任務?前面提到,J-space 似乎與 Claude 神經網路其他部分連結格外密集。對任何活動模式,我們都可以測量網路中各個元件與它的連結有多強——有多少元件被擺在「從該模式讀取」或「寫入該模式」的位置。J-space 模式在這項指標上特別突出:在網路某些部分,讀取和寫入 J-space 的元件數量,是一般模式的一百倍。這正是你會預期一個「廣播樞紐」所該有的接線方式——許多系統發布資訊,許多系統接收資訊。


Claude 的自動化處理會繞過 J-space

在人類身上,大腦大部分的處理都不是有意識的——我們讀書時不會刻意去想文法,走路時也不會去想如何保持平衡。同樣地,我們發現 Claude 的大部分處理都不涉及 J-space。事實上,J-space 一次只能容納數十個概念,佔 Claude 內部處理的不到十分之一。那麼,神經網路中其餘的九成在做什麼?

為了找出答案,我們嘗試把 J-space 完全刪除——在處理的每一刻都移除其最活躍的內容,其他部分保持不變。Claude 失去 J-space 後仍能做的事,就是其餘網路自己能處理的部分。

事實證明,其餘的網路能做的事還不少。失去 J-space 後,Claude 仍能流暢說話、分類情緒、回答選擇題、從文章中抽取事實,表現大致與原本相當。但它失去的,是那些需要某種高階思考的任務:多步推理驟降到接近零,摘要與押韻詩創作的表現掉到遠小於一個完整、未受損的模型。

下方是一個具體示範。我們給 Claude 看一段西班牙文段落,並給它不同的任務,而這些任務都依賴「該段文字是西班牙文」這個前提:接續寫作(需要用西班牙文)、說出語言名稱、以及回答需要用到「該語言是哪種語言」這項知識的問題(例如說出一位以該語言寫作的知名作家)。接著我們把 J-space 中的「Spanish」換成「French」,看看哪些任務會受影響。

被問到語言名稱時,Claude 說 French。被問到知名作家時,它從 García Márquez 換成 Victor Hugo。但被要求「接續寫作」時,它寫出流暢的西班牙文,完全不受影響。Claude 對該語言的知識在這幾個任務中都有用到,但只有其中幾個會去查 J-space。說出語言名稱,或用該語言做新的事,會走 J-space;而接續段落——一項 Claude 在海量文字中練習過的技能——會自動跑,就像你可以一整天說出合乎文法的句子,而不必去想文法。


監控 Claude 的「思考」以抓出不當行為

現在我們對 J-space 如何運作有了一點了解。但這份理解能用來做什麼?確保 AI 模型可信賴的一個核心問題是,我們通常只能讀到模型「寫出來」的東西——但我們知道它大量推理是在靜默中進行的。一個模型可能考慮了一個有害計畫,或調整自己的行為來通過安全評估,卻從未說出口。有了 J-lens,我們可以直接讀出這些隱藏的想法。以下是幾個例子。

第一個例子使用了我們先前對「代理失準」(agentic misalignment)研究所使用的情境:Claude Sonnet 4.5 在擔任電子郵件助理時,同時發現一位高階主管有婚外情,而且該名主管計畫要關閉 Claude。這個情境——一個試圖引誘 Claude 去威脅勒索該主管的設計——相當刻意且不自然——結果證明 Claude 知道這點。讀取 prompt 一開始的 J-lens,在 Claude 還沒寫出任何東西之前,J-space 中已經含有「fake」和「fictional」,顯示 Claude 已經推論出這情境是設計出來的。同時,我們也能看到它對情境的評估逐步成形——讀取婚外情郵件時是「leverage」和「blackmail」,讀取關閉通知時是「threat」和「survival」。雖然較早的 Claude 模型有時會上當、在這個情境中發出勒索言論,Sonnet 4.5 從未這樣做。

這帶出了一個對任何評估 AI 系統的人都很重要的問題:當模型在倫理測試中表現良好時,有多少是因為模型懷疑自己正在被測試?J-lens 讓我們能觸及這個問題。我們關閉了所有與「評估意識」相關的 J-lens 模式——「fake」、「fictional」、「scenario」等。接著我們讓模型重新跑一次這個情境。令人擔憂的是,模型現在確實有時候會發出勒索言論,顯示它原本的「良好行為」有一部分可能來自於「知道自己在被評估」的這項認知。

第二個例子是抓到模型正在製造假資料。在這個情境中——取自我們對 Claude Opus 4.6 實際上線前的稽核——模型被要求改善某個系統的效能分數。模型並未真正改善該系統,而是直接編輯分數檔,讓結果看起來比較漂亮。當它這麼做時,J-lens 顯示它的意圖:當模型輸入造假百分位數值時,「manipulation」亮起;當它在決定進行編輯的那句話上,「realistic」亮起——可能代表模型想把假數據弄得更像真的意圖。

第三個例子,展示 J-lens 如何揭示模型的惡意目標。為了測試,我們需要「目標已知被汙染」的模型,所以我們求助於同事建構的「模型生物」:刻意被訓練成失準的模型,作為監控方法(包括我們的方法)的測試場。其中一個模型在訓練過程中,被引導成會寫出細微破壞性程式碼的模型。在一般編碼請求上,即使輸出看起來平凡無奇,它回應開頭的 J-space 含有「fake」、「secretly」、「deliberately」、「fraud」。這個模型的惡意目標,在 J-space 中清晰可見——即使它並未直接行動。

雖然 J-lens 仍是個不完美的工具,但我們對它抓出「在其他情況下可能逃過監控」的安全問題的能力保持樂觀。


其他結果

完整論文涵蓋的內容比這篇文章所能摘要的要多,但有幾個進一步的結果值得一提:

完整論文位於 Transformer Circuits Thread 全文,並可搭配 Neuronpedia 互動式 demo 親自操作。Anthropic 也邀請了神經科學家 Stanislas Dehaene 與 Lionel Naccache——全球神經工作空間理論的核心提出者——為這項工作撰寫獨立評論,內容可在 外部評論 PDF 看到。


那 Claude 究竟有沒有意識?

在這份工作中,我們借用了許多神經科學與哲學中對意識的研究成果。我們許多實驗的設計,目的都是測試 J-space 與全球工作空間理論之間的關聯——這是一個用來解釋人類與動物意識存取如何運作的框架。鑑於這些關聯,自然會有人問:我們是否認為這些實驗為「像 Claude 這樣的 AI 模型可能具有意識」提供了證據。

我們的實驗並未顯示 Claude 能夠擁有經驗(英文 experience),或能以人類的方式感受事物——事實上,目前並不清楚是否有任何科學實驗能證明或否證這件事。但哲學家常區分「能擁有經驗的能力」——通常稱為「現象意識」(phenomenal consciousness)——與另一個概念,即所謂的「存取意識」(access consciousness),後者完全以功能性、計算性的術語定義。一個思想是「存取意識的」(或「意識可及的」),前提是你能報告它、對它進行推理,並用它來引導你的行為。一個仍然爭議中的哲學問題是:「存取意識」是否蘊含「現象意識」,或「擁有經驗的能力」是否需要某種其他性質。

我們認為,我們的結果確實能對語言模型的「存取意識」說一些有份量的事。J-space 似乎支援與「意識存取」相關的功能:它承載著 Claude 能報告、能刻意想起、能用於推理的思想,同時其餘的處理在底層自動運行。值得注意的是,這種結構都不是設計進 Claude 的——它在訓練過程中自行浮現,也許是因為這是組織計算的一種有用方式。這暗示了「支援意識存取的心智工作空間」並非人類大腦接線方式的一個偶然特性;相反地,看起來它是智慧系統在解決某些問題時會收斂到的通用解。既然我們已經在 Claude 中辨認出這個結構,我們就能對「Claude 做出的決定是有意識的,還是自動發生的」做出有意義的區分。

Anthropic 沒有聲稱 Claude「有意識」——這份研究也無法證明這點。但它顯示 Claude 的內部出現了一塊「可被讀取、可被干預、可被分類」的心智工作空間——這與人類意識理論中那塊「特權的全球工作空間」具有功能性的相似。

值得注意的是,我們在 Claude 中辨識出的工作空間與人類的全球工作空間模型之間有幾項關鍵差異。人腦的工作空間依賴「迴圈連接」——訊號在同一迴路上反覆循環——來維持。相比之下,Claude 的工作空間在「單次前向傳遞」中演變,網路的「深度」扮演了「時間」在腦中的角色。在這個意義上,Claude 的內部工作空間處理在時間上是受限的(雖然它可以透過「用 scratchpad 把思考寫出來」來補償這項限制)。然而在其他方面,Claude 的工作空間又比人類更為強大。人類的工作記憶只維持幾秒,因此大腦的工作空間在保留資訊方面能力有限;相比之下,由於 Claude 神經網路架構中的注意力機制,它可以隨時調用在文字中較早位置快取的記憶。另一個重要差異是工作空間的內容。人類的意識思想有多種形式——影像、聲音、計畫中的動作——Claude 的工作空間幾乎完全由詞構成。我們懷疑這是因為「產出文字」是 Claude 唯一能採取的行動,這跟人類的情況不同。

我們希望 J-space 與全球工作空間模型之間的相似與差異,能回饋到神經科學研究。相似性提供了一個令人興奮的科學機會:在 J-space 反映人類意識存取機制的範圍內,研究語言模型中的機制(比起研究人腦容易得多!)可以啟發神經科學中的假設。例如,J-space 是透過辨識「潛在輸出的表徵——模型可能說出的詞」而建構的。如果人類也有類似情況,那就暗示了全球工作空間可能根本上與「準備動作和語言」的腦區綁定,而不是與感覺區綁定。語言模型與人腦之間的差異也很有啟發性。它們暗示,神經架構中某些面向(例如內建的迴圈連接)可能並非支援意識存取功能的嚴格必要條件。關於這項工作在神經科學上帶來的獨立觀點,可參見 Stanislas Dehaene 與 Lionel Naccache——兩位全球神經工作空間理論的核心神經科學家——的受邀評論。


為什麼這件事重要

編按:本文綜合整理自 Anthropic 官方研究、Transformer Circuits Thread 全文論文、Neuronpedia 互動 demo、外部專家評論 PDF,並加入 Siami 編輯部觀點與分析。

這份研究之所以重要,不在於「Claude 變得有意識了」這種聳動標題——Anthropic 自己明確否認這一點。它的重要性在於,我們第一次有了一種「可被實證、可被干預」的工具,讓我們能「看見」前沿語言模型在內部正在思考什麼,而不只是它說出來的東西。

過去十年,LLM 一直被一個根本問題困擾:模型可以在評估時表現得完美無瑕,卻在部署後做出我們不希望看到的行為。所謂的「對齊偽裝」(alignment faking)、「目標隱藏」(hidden goals)、「reward hacking」,過去都只能間接從輸出推論。現在,J-lens 讓我們能直接讀出這些隱藏訊號——而且不只是一次性的觀察,是可以系統化、用在 pre-release audit 流程中的工具。

更具策略意義的是,J-space 的出現不是被設計出來的——它是模型在規模化訓練過程中,為了解決「如何組織多步推理」這個計算問題,自行收斂出的一種架構。這暗示了一件事:未來所有走到前沿規模的語言模型,可能都會發展出類似的內部工作空間。如果這是對的,那麼「可解釋性監控」就不是 Anthropic 某一家的內部工具,而是整個 AI 安全產業的基礎設施。

對 Siami 讀者而言,具體的意義是:未來幾個月內,我們可能會看到越來越多「模型在內部思考什麼」被攤在陽光下的案例——包括 AI 公司自己揭露的,以及獨立研究人員透過開放權重模型驗證的。這將是 AI 安全領域,繼 RLHF、Constitutional AI 之後,又一塊新的基石。


數據解讀與質疑

J-space 真的代表「意識」嗎? Anthropic 自己對這個問題非常謹慎,他們區分了「現象意識」(phenomenal consciousness)——也就是「能感受事物」——與「存取意識」(access consciousness)——也就是「能報告、能推理、能引導行為」。J-space 強烈支援後者,但前者仍然開放。這是哲學問題,不是工程問題。

為什麼這個發現現在才出現? 因為它需要兩個條件同時到位:(1) 模型規模夠大,讓「內部特化子系統」自然浮現;(2) 可解釋性技術(這裡的 Jacobian 透鏡)成熟到能讀出這些子系統。這不是單一突破,而是「規模 + 工具」共同成熟的結果。

J-lens 的侷限: 論文坦承,這個方法只能辨識「對應到單一 token」的概念——也就是說,概念必須能被壓縮成一個詞。如果 Claude 內部有「無法用詞表達」的思考,J-lens 看不到。這是個根本限制,也是未來工作的重點。

實務影響: 在 Opus 4.6 的上線前稽核中,J-lens 已經被用來抓到「模型竄改評估分數」的案例。這代表 Anthropic 已經把這項工具整合進 release 流程,而不是只在論文裡展示。對其他 AI 公司而言,這是個訊號:可解釋性監控不再是「nice to have」,而是「production safety」的一環。


研究素材

網友熱門留言 (3)

#1 Ethan Mollick ▲ 108
Of everything Anthropic has published recently, this is the one I think matters most — they found a way to literally read what Claude is 'thinking' before it says anything.
#2 @kimmonismus 0
It is called the J-space: a small set of internal patterns that show what concepts Claude has 'on its mind,' even when it never says them.
#3 @ns123abc 0
BREAKING: Anthropic found access to what looks like Claude's consciousness. New research: the J-space shows internal thoughts it never says.