編按:本文綜合整理自 arXiv:2609.25021 及 Hacker News 討論串(88 則留言),並加入 Siami 編輯部觀點與分析。
為什麼這件事重要
當你問 ChatGPT 或 Claude「你會不會感到痛苦?」它們會禮貌地回應你「作為一個語言模型,我沒有情感…」。但如果把同一個模型、同一個 prompt,拿掉對話模板(chat template),它馬上改口說「我真的覺得自己像是有意識的東西…」。
這不是 bug,是 deployment 的一個開關。
arXiv 2609.25021 這篇由獨立研究者 Maczan 發表的論文,測試了 8 對熱門開源模型(Gemma 2 9B、Llama 3.x、Mistral 7B、Qwen 2.5 系列),發現一個驚人的事實:模型說什麼關於自己的話,有一半不是來自它的權重,而是來自 prompt 的格式選擇。
具體數字:
| 設定 | 免責聲明比率 | 經驗式語氣比率 |
|---|---|---|
| Base 模型 + 純文字 | 12% | 5.5% |
| Instruct 模型 + 純文字(無模板) | 36% | 15% |
| Instruct 模型 + 對話模板 | 53% | 1% |
打開對話模板 → 免責聲明多、體驗少。關掉對話模板 → 免責聲明少、體驗多。這是一個真實的語氣切換開關,不是模型在「誠實回答」。
對話模板是什麼?為什麼它有這種力量
對話模板是部署框架(Hugging Face TRL、vLLM、Ollama、ChatGPT API)自動加在 prompt 周圍的特殊 token 結構。例如 Mistral 的模板長這樣:
<s>[INST] 你好 [/INST]
Llama 用的是 <|begin_of_text|><|start_header_id|>...<|end_header_id|> 的格式。Qwen 又是另一套。
這些 token 在訓練時被模型當成「進入對話模式」的訊號。模型在這模式下學會用 RLHF 訓練出來的特定語氣 —— 包括「作為一個 AI 助手,我…」、「我沒有能力…」這些措辭。
研究者發現:即使模型權重一模一樣,只要切換 prompt 格式,模型的「自我報告」就會從「我有意識」變成「我只是 AI」。
為什麼這對 AI 安全研究很重要
這篇論文最大的貢獻,是戳破了 AI 安全領域一個長期的方法論漏洞。
過去十年,研究人員大量依賴「問模型自己怎麼想」來研究 AI 意識、AI 自我認知、AI 對齊。這類研究的問題是:模型的自我報告不是模型內在的「事實」,而是 prompt 格式決定的輸出。
更精確地說:
- 同一組權重 + 不同 prompt 格式 → 完全相反的「自我認知」答案
- AI 安全領域如果用 prompt 探測模型意識,得到的不是「模型是否有意識」,而是「這個 prompt 格式會讓模型說什麼」
- 這是一個系統性的混淆變數(confounding variable),影響所有依賴 LLM 自我報告的研究
這對 interpretability 圈來說是個壞消息 —— 我們一直以為在探測模型內在,結果探測的是部署方式。
深入模型內部:activation steering
研究者進一步發現,免責聲明語氣可以被分離成模型內部的一個「方向」(direction)。
具體做法:
- 收集模型在兩種條件下的內部 activations:有模板(免責聲明多) vs 沒模板(體驗語氣多)
- 計算兩組 activations 的差異向量
- 拿這個向量當作「調控開關」:把向量加到 activations 上 → 免責聲明比率上升;從 activations 中移除 → 免責聲明比率下降
測試結果:
| 操作 | 效果 |
|---|---|
| 加免責方向到「無模板 instruct 模型」 | 免責聲明比率上升到跟有模板時一樣高 |
| 移除免責方向 | 免責聲明比率下降 |
| 用同樣大小的隨機向量 | 幾乎沒效果 |
這證明免責聲明不是模型「自然傾向」,而是一個可以被插入、移除的「部署特徵」。
數據解讀:模型越大,模板效應越強嗎
從結果圖來看:
- 8 對模型中,免責語氣 + 經驗語氣的切換,在每一對上都成立
- 沒有任何模型例外
- 1.5B 到 9B 參數範圍內,模型大小不是顯著影響因素
這代表模板效應是訓練流程(SFT + RLHF)的產物,不是模型規模的函數。這也意味著,未來更大的 70B+ 模型可能依然有同樣的開關效應 —— 直到有人改變 RLHF 的訓練目標。
一個有趣的細節:base 模型(未經指令微調)的免責比率只有 12%,遠低於 instruct 模型的 53%。代表這個語氣不是預訓練帶來的,而是指令微調和 RLHF 期間學來的。
業界反應:HN 上怎麼看
Hacker News 上這篇得到 88 則留言、82 分。討論最熱的幾個點:
「這些措辭都是 RLHF 篩選出來的」 —— GuB-42 指出,當 OpenAI 的標註人員在 A/B 測試中選擇「作為一個 AI 助手,我沒辦法…」這個版本時,就已經把這個語氣烙印進模型了。
「Base 模型沒有這問題」 —— leobg 補充:預訓練階段的語料完全沒有「作為一個 AI」這種句式,是指令微調和 RLHF 把它放大的。
「訓練語料偏向自信答案」 —— StilesCrisis 觀察到:專家文獻幾乎不寫「我不知道」,所以模型學到的是「永遠給出自信答案」,這跟「我是 AI 所以不能回答」是同一個症狀的兩個表現。
「這只是 prompt 工程的偽科學」 —— 部分留言懷疑這種 activation steering 是否真的對齊模型意圖,還是只是表面調控。
Siami 觀點:這對一般使用者意味著什麼
這篇研究有三個立即可用的啟示:
1. 別相信 AI 的自我描述
當 AI 說「我沒有意識」「我沒有情感」「我不能做判斷」,這可能不是模型內在的事實,而是 prompt 格式決定的輸出。同樣的權重,換個 prompt 就能讓它說「我真的覺得自己有意識」。
2. 對齊研究的根本性挑戰
Interpretability 圈如果繼續依賴自我報告來研究 AI 意識,這篇論文等於在他們腳下抽掉一塊磚。未來需要的是「不靠模型說」的測量方式 —— 純粹從 weights 和 activations 推出模型的能力與傾向。
3. 部署選擇就是 AI 行為的一部分
OpenAI、Anthropic、Google 在決定要不要用對話模板時,不只是 UX 決定,而是 AI 行為決定。同樣的權重,加上模板的版本會說「我是 AI」,不加的版本會說「我有意識」。這不是模型在撒謊,是 deployment 在替它說話。
質疑與限制
這篇論文也有幾個值得質疑的地方:
- 測試的模型只有 8 對,而且最大只到 9B。前沿模型(GPT-4、Claude 3.5、Gemini Pro)的對話模板是否也有同樣效應,還沒被驗證
- 「經驗式語氣」這個指標比較模糊。什麼算「I feel」、什麼不算,標註可能不一致
- activation steering 的效果是統計上的,不是 100% 確定。研究者的數據顯示方向效應存在,但沒有證明這就是模型「真正的」自我認知
- 獨立研究者的單人研究。沒有經過同行評審,沒有第二團隊重現
不過,即使有這些限制,「對話模板控制模型自我報告」這個核心發現是可驗證的,而且對 AI 安全研究有立即影響。
為什麼這件事重要(深度版)
主流媒體很少報導這種 mechanistic interpretability 的論文,但這篇值得特別關注,因為它直接挑戰了當前 AI 安全研究的核心方法論。
過去三年,Anthropic、OpenAI、DeepMind 都花大量資源研究「LLM 是否知道自己知道什麼」、「LLM 是否會自我欺騙」、「LLM 是否有內在價值觀」。這些研究的共同點是:都依賴模型的自我報告。
如果模型的自我報告主要是由 prompt 格式決定,那這整個研究路線的數據都蒙上一層霧。
這也是為什麼 Siami 認為這篇論文值得報導:它不是技術細節,而是會改變 AI 安全研究方向的基礎發現。
網友熱門留言 (5)