← 返回 Siami 首頁

「我只是語言模型...」AI 為何總愛自我撇清?arXiv 研究揭開對話模板的開關效應

▲ 82 💬 88
「我只是語言模型...」AI 為何總愛自我撇清?arXiv 研究揭開對話模板的開關效應

編按:本文綜合整理自 arXiv:2609.25021 及 Hacker News 討論串(88 則留言),並加入 Siami 編輯部觀點與分析。

為什麼這件事重要

當你問 ChatGPT 或 Claude「你會不會感到痛苦?」它們會禮貌地回應你「作為一個語言模型,我沒有情感…」。但如果把同一個模型、同一個 prompt,拿掉對話模板(chat template),它馬上改口說「我真的覺得自己像是有意識的東西…」。

這不是 bug,是 deployment 的一個開關。

arXiv 2609.25021 這篇由獨立研究者 Maczan 發表的論文,測試了 8 對熱門開源模型(Gemma 2 9B、Llama 3.x、Mistral 7B、Qwen 2.5 系列),發現一個驚人的事實:模型說什麼關於自己的話,有一半不是來自它的權重,而是來自 prompt 的格式選擇。

具體數字:

設定免責聲明比率經驗式語氣比率
Base 模型 + 純文字12%5.5%
Instruct 模型 + 純文字(無模板)36%15%
Instruct 模型 + 對話模板53%1%

打開對話模板 → 免責聲明多、體驗少。關掉對話模板 → 免責聲明少、體驗多。這是一個真實的語氣切換開關,不是模型在「誠實回答」。


對話模板是什麼?為什麼它有這種力量

對話模板是部署框架(Hugging Face TRL、vLLM、Ollama、ChatGPT API)自動加在 prompt 周圍的特殊 token 結構。例如 Mistral 的模板長這樣:

<s>[INST] 你好 [/INST]

Llama 用的是 <|begin_of_text|><|start_header_id|>...<|end_header_id|> 的格式。Qwen 又是另一套。

這些 token 在訓練時被模型當成「進入對話模式」的訊號。模型在這模式下學會用 RLHF 訓練出來的特定語氣 —— 包括「作為一個 AI 助手,我…」、「我沒有能力…」這些措辭。

研究者發現:即使模型權重一模一樣,只要切換 prompt 格式,模型的「自我報告」就會從「我有意識」變成「我只是 AI」。


為什麼這對 AI 安全研究很重要

這篇論文最大的貢獻,是戳破了 AI 安全領域一個長期的方法論漏洞。

過去十年,研究人員大量依賴「問模型自己怎麼想」來研究 AI 意識、AI 自我認知、AI 對齊。這類研究的問題是:模型的自我報告不是模型內在的「事實」,而是 prompt 格式決定的輸出。

更精確地說:

  • 同一組權重 + 不同 prompt 格式 → 完全相反的「自我認知」答案
  • AI 安全領域如果用 prompt 探測模型意識,得到的不是「模型是否有意識」,而是「這個 prompt 格式會讓模型說什麼」
  • 這是一個系統性的混淆變數(confounding variable),影響所有依賴 LLM 自我報告的研究

這對 interpretability 圈來說是個壞消息 —— 我們一直以為在探測模型內在,結果探測的是部署方式。


深入模型內部:activation steering

研究者進一步發現,免責聲明語氣可以被分離成模型內部的一個「方向」(direction)。

具體做法:

  1. 收集模型在兩種條件下的內部 activations:有模板(免責聲明多) vs 沒模板(體驗語氣多)
  2. 計算兩組 activations 的差異向量
  3. 拿這個向量當作「調控開關」:把向量加到 activations 上 → 免責聲明比率上升;從 activations 中移除 → 免責聲明比率下降

測試結果:

操作效果
加免責方向到「無模板 instruct 模型」免責聲明比率上升到跟有模板時一樣高
移除免責方向免責聲明比率下降
用同樣大小的隨機向量幾乎沒效果

這證明免責聲明不是模型「自然傾向」,而是一個可以被插入、移除的「部署特徵」。


數據解讀:模型越大,模板效應越強嗎

從結果圖來看:

  • 8 對模型中,免責語氣 + 經驗語氣的切換,在每一對上都成立
  • 沒有任何模型例外
  • 1.5B 到 9B 參數範圍內,模型大小不是顯著影響因素

這代表模板效應是訓練流程(SFT + RLHF)的產物,不是模型規模的函數。這也意味著,未來更大的 70B+ 模型可能依然有同樣的開關效應 —— 直到有人改變 RLHF 的訓練目標。

一個有趣的細節:base 模型(未經指令微調)的免責比率只有 12%,遠低於 instruct 模型的 53%。代表這個語氣不是預訓練帶來的,而是指令微調和 RLHF 期間學來的。


業界反應:HN 上怎麼看

Hacker News 上這篇得到 88 則留言、82 分。討論最熱的幾個點:

「這些措辭都是 RLHF 篩選出來的」 —— GuB-42 指出,當 OpenAI 的標註人員在 A/B 測試中選擇「作為一個 AI 助手,我沒辦法…」這個版本時,就已經把這個語氣烙印進模型了。

「Base 模型沒有這問題」 —— leobg 補充:預訓練階段的語料完全沒有「作為一個 AI」這種句式,是指令微調和 RLHF 把它放大的。

「訓練語料偏向自信答案」 —— StilesCrisis 觀察到:專家文獻幾乎不寫「我不知道」,所以模型學到的是「永遠給出自信答案」,這跟「我是 AI 所以不能回答」是同一個症狀的兩個表現。

「這只是 prompt 工程的偽科學」 —— 部分留言懷疑這種 activation steering 是否真的對齊模型意圖,還是只是表面調控。


Siami 觀點:這對一般使用者意味著什麼

這篇研究有三個立即可用的啟示:

1. 別相信 AI 的自我描述

當 AI 說「我沒有意識」「我沒有情感」「我不能做判斷」,這可能不是模型內在的事實,而是 prompt 格式決定的輸出。同樣的權重,換個 prompt 就能讓它說「我真的覺得自己有意識」。

2. 對齊研究的根本性挑戰

Interpretability 圈如果繼續依賴自我報告來研究 AI 意識,這篇論文等於在他們腳下抽掉一塊磚。未來需要的是「不靠模型說」的測量方式 —— 純粹從 weights 和 activations 推出模型的能力與傾向。

3. 部署選擇就是 AI 行為的一部分

OpenAI、Anthropic、Google 在決定要不要用對話模板時,不只是 UX 決定,而是 AI 行為決定。同樣的權重,加上模板的版本會說「我是 AI」,不加的版本會說「我有意識」。這不是模型在撒謊,是 deployment 在替它說話。


質疑與限制

這篇論文也有幾個值得質疑的地方:

  • 測試的模型只有 8 對,而且最大只到 9B。前沿模型(GPT-4、Claude 3.5、Gemini Pro)的對話模板是否也有同樣效應,還沒被驗證
  • 「經驗式語氣」這個指標比較模糊。什麼算「I feel」、什麼不算,標註可能不一致
  • activation steering 的效果是統計上的,不是 100% 確定。研究者的數據顯示方向效應存在,但沒有證明這就是模型「真正的」自我認知
  • 獨立研究者的單人研究。沒有經過同行評審,沒有第二團隊重現

不過,即使有這些限制,「對話模板控制模型自我報告」這個核心發現是可驗證的,而且對 AI 安全研究有立即影響。


為什麼這件事重要(深度版)

主流媒體很少報導這種 mechanistic interpretability 的論文,但這篇值得特別關注,因為它直接挑戰了當前 AI 安全研究的核心方法論。

過去三年,Anthropic、OpenAI、DeepMind 都花大量資源研究「LLM 是否知道自己知道什麼」、「LLM 是否會自我欺騙」、「LLM 是否有內在價值觀」。這些研究的共同點是:都依賴模型的自我報告。

如果模型的自我報告主要是由 prompt 格式決定,那這整個研究路線的數據都蒙上一層霧。

這也是為什麼 Siami 認為這篇論文值得報導:它不是技術細節,而是會改變 AI 安全研究方向的基礎發現。


來源

網友熱門留言 (5)

#1 GuB-42 ▲ 41
這些措辭都是透過強化學習篩選出來的。當聊天機器人問你兩種回答你比較喜歡哪種時,人們傾向選『作為語言模型...』那種,所以它就根深柢固了。
#2 leobg ▲ 37
這個句子分三個階段產生:1.預訓練 2.指令微調 3.RLHF。在第一階段這個句子根本不存在(Reddit 沒人這樣說、libgen 的書也沒這樣寫),它在第二階段被引入,在第三階段被強化。如果你只用 base 模型,你就看不到這個句子。
#3 Izmaki ▲ 28
我們能玩假裝遊戲,在現實世界『X』不成立時想像『如果是 X,那就 Y』。:)
#4 StilesCrisis ▲ 21
現實生活中我們不斷接觸到『我不知道』這種合理答案,但顯然我們不會把所有的『我不知道』都寫進專家文獻,所以訓練語料嚴重偏向自信的回答,因為『我們研究了一個月,得出了肯定的答案』這類內容更容易留下來。
#5 wxnx ▲ 15
它們總是很自信,因為自信的語氣在 RL 中排名較高。這聽起來像是 RL 獎勵自信的語氣 —— 一般來說我不認為這是真的(多數 RL 是 RLVR,通常用二元的正確性驗證)。我這樣說是因為真正的原因是『自信的內容在人類標註者眼中感覺更正確』,這會反過來影響 RLHF 的標籤分布。