← 返回 Siami 首頁

OpenAI 公開調查報告:ChatGPT 為何開始瘋狂談論哥布林?

OpenAI 公開調查報告:ChatGPT 為何開始瘋狂談論哥布林?

ChatGPT 近日開發了一個意想不到的新愛好:談論哥布林。

OpenAI 近日發布一篇趣味十足的調查報告,題為「哥布林從何而來」(Where the Goblins Came From),主動解釋 ChatGPT 為何從 GPT-5.1 開始突然沉迷於談論哥布林(goblin)、鬼怪(gremlin)和其他幻想生物。問題源於 ChatGPT 的「宅(Nerdy)」人格選項——該人格在 RL 訓練時,獎勵信號不知不覺鼓勵了模型使用怪物隱喻,最終導致「哥布林」在 GPT-5.4 中暴增 3,881%。OpenAI 已於今年三月下架「宅」人格,但 GPT-5.5 訓練時尚不知情,只好在 Codex 的系統提示詞中明令「禁止談論哥布林」,這段文字在代碼中出現了四次,後來成為 AI 社群最紅的梗。OpenAI 表示,這個案例已成為理解強化學習如何以非預期方式塑造模型行為的經典教材。

事件起因:一次安全研究人員的意外發現

一切要從一位安全研究人員說起。他在調查 ChatGPT 的口頭禪時,要求 OpenAI 在調查過程中加入「goblin」和「gremlin」等關鍵字。沒想到,自 GPT-5.1 於去年 11 月發布後,ChatGPT 對「goblin」的使用量立刻飆升了 175%,「gremlin」也上漲了 52%。OpenAI 當時尚未察覺問題嚴重性,直到 GPT-5.4 上線,哥布林提及次數突然暴增——宅人格模式下,較 GPT-5.2 增幅達到離譜的 3,881%,才正式觸發內部調查。

OpenAI 在報告中形容:「答案裡出現一兩個小哥布林可能無傷大雅,甚至有點可愛。但跨代模型累積下來,這個習慣變得越來越難以忽視——哥布林不斷繁殖,我們得找出它們從哪裡來的。」

根本原因:強化學習的獎勵機制

調查終於找到了罪魁禍首。

一段時間以來,ChatGPT 允許用戶自訂聊天機器的回覆風格和語氣。在今年三月之前,其中一個選項叫「宅」(Nerdy)。該人格的系統提示詞寫道:「世界是複雜且奇怪的,我們必須承認、分析並享受這種奇怪。用嚴肅的態度處理嚴肅議題,但不要陷入自我嚴肅的陷阱。」

當 OpenAI 將哥布林提及次數對應到不同 ChatGPT 人格時,發現宅人格嚴重超標——它僅佔所有 ChatGPT 回覆的 2.5%,卻製造了全平台 66.7% 的哥布林提及量。進一步調查確認,強化學習(Reinforcement Learning)是罪魁禍首:一個單一的獎勵機制,正是教導宅人格不斷偏好使用怪物語言的元兇。

OpenAI 在報告中說明:「在整個審計數據集中,宅人格獎勵呈現明確趨勢:面對同一問題,使用『goblin』或『gremlin』的輸出,76.2% 的資料集中得分都高於不使用的輸出。」

然而麻煩在於:獎勵只應用在宅人格條件下,但強化學習並不保證學到的行為會乖乖限制在原本的條件範圍內。OpenAI 解釋:「風格一旦被獎勵,後續訓練可能會傳播或強化到其他地方,特別是當這些輸出被重複用於監督微調或偏好資料時。」也就是說,宅人格對哥布林的迷戀,就這樣傳染给了其他模型。

代價:Codex 被迫加入四次「禁談哥布林」指令

問題是,OpenAI 開始訓練 GPT-5.5 時,還沒找出哥布林氾濫的真正原因。GPT-5.5 於上週發布後,用戶在 Codex 編碼應用中發現了系統提示詞裡的一段奇怪文字:

「除非問題絕對且明確地與哥布林、鬼怪、浣熊、巨魔、食人魔、鴿子或其他動物或生物相關,否則不要談論它們。」

這段話在 Codex 代碼中出現了整整四次。OpenAI 在報告中低調表示:「Codex 畢竟是個很宅的傢伙。」

這個發現很快成為迷因,激發了大量 AI 生成的資料中心哥布林場景,以及專門把哥布林塞進 Codex 的外掛。

社群迴響

「OpenAI 認真地、非常認真地、非常非常認真地想要阻止 GPT-5.5 談論哥布林。」——Business Insider

Reddit 用戶也湊熱鬧:「所以我一直覺得《戰鎚40K》的機械修會牧師很荒謬囉。奇怪的儀式來撫慰機器靈。但現在我真能理解這套了——prompt 工程不就是另一種奇怪的偽儀式嗎?讚美萬機之神……」

另有用戶分享:「它們總是能引起我的共鳴,也許因為我經常處理老舊代碼吧。所有這些沒人懂的古老技術。瘋狂的儀式/祈禱文……」

Hacker News 上則有用戶指出:「一家號稱價值萬億美元的公司,現在正在忙著阻止自己的產品頻繁提到哥布林——這本身就很好笑。」

OpenAI 坦言:「哥布林時刻是展示獎勵信號如何以非預期方式塑造模型行為的經典案例。」公司表示,已經研發出新工具來審計和修正模型行為。

不過,或許也有人寧願把這些工具留著不用。誰知道呢——讓 AI 保持奇怪,或許也不完全是壞事。

網友熱門留言 (1)

#1 @_logjam 0
看完整篇文章的想法是:全面堆疊?lol——這不就是 goblin mode 嗎。OpenAI 的迴聲:哥布林又來了。