← 返回 Siami 首頁

GPT-5.5 Codex 推理 token 異常聚集 516/1034/1552:實測 39 萬筆資料指向「推理預算被截斷」

▲ 182 💬 58
GPT-5.5 Codex 推理 token 異常聚集 516/1034/1552:實測 39 萬筆資料指向「推理預算被截斷」

編按:本文綜合整理自 openai/codex Issue #30364、r/codex 討論串、letsdatascience 技術分析,並加入 Siami 編輯部觀點與分析。

開發者社群近期注意到一個微妙但嚴重的現象:使用 GPT-5.5 Codex 模型時,許多複雜任務的正確率「無緣無故」下降。這不是幻覺,也不是模型退化,而是出現了推理 token 的固定邊界聚集(fixed-boundary clustering)——回應的 reasoning_output_tokens 異常集中出現在 516、1034、1552 這三個神祕數字。Issue #30364 用 39 萬筆回應紀錄提供了迄今最完整的統計證據。


事件脈絡:從個人觀察到 39 萬筆資料佐證

2026 年 6 月 27 日,開發者 vguptaa45 在 OpenAI 官方的 openai/codex GitHub repo 開了 Issue #30364,標題是「GPT-5.5 Codex reasoning-token clustering at 516/1034/1552 may be leading to degraded performance on complex tasks」。這份報告引用了 390,195 筆回應紀錄、橫跨 865 個 session、時間範圍從 2 月到 6 月,結論相當直接:GPT-5.5 的回應有不正常的固定 token 邊界聚集現象。

這份 issue 並非獨立事件。它的前身是 #29353(一個任務級的案例重現:某個 GPT-5.5 推理停在剛好 516 token 時答錯),而 #30364 是用更大規模的聚合資料補上證據。值得注意的是,作者相當自律——他明確說「我沒有要證明存在隱藏的 chain-of-thought 截斷,我只想說 Codex 的 telemetry 顯示了 GPT-5.5 特有的固定 token 聚集異常」。

從 Reddit 的 r/codex 板回響來看,開發者早就察覺 GPT-5.5 在 high/xhigh 模式下的品質下降。從 4 月底開始就有「我用了幾週覺得 GPT-5.5 變差了」這類貼文,6 月 27 日 issue 一出,討論瞬間白熱化——其中一位用戶直接在文中說「我已經取消訂閱了,謝謝 OpenAI 給的當頭棒喝」。


數據全貌:516/1034/1552 不是巧合

模型級別差異(核心證據)

模型回應紀錄數恰好 516 / ≥516 比率
gpt-5.575,40144.0%
gpt-5.425,21419.8%
gpt-5.2247,5750.34%
gpt-5.3-codex13,3330.0%
gpt-5.3-codex-spark26,1790.0%

幾個關鍵數字:

  • GPT-5.5 只佔全部回應的 19.3%,卻佔了所有「恰好 516 token」事件的 82.0%
  • GPT-5.5 的 44.0% 比率,比非 GPT-5.5 基線的 1.3% 高出 33.6 倍
  • 其他模型幾乎沒有這個現象(GPT-5.2 只有 0.34%、Codex 變體 0%)

月份趨勢(急速惡化)

月份恰好 516 / ≥516 比率平均推理 tokenP90 推理 token
2 月0.11%268.1772
3 月2.45%256.8723
4 月4.25%228.7669
5 月53.30%106.9344
6 月35.84%168.5515

這個表格是整份報告最震撼的部分:5 月份剛好 516 的比率從 4 月的 4.25% 直接跳到 53.30%,同時間平均推理 token 從 228.7 掉到 106.9(腰斬),P90 也從 669 掉到 344。

這意味著:模型在 5 月份某個時間點,被加上一個未公開的推理預算上限,大多數回應被硬切到 516 token 附近。


為什麼這件事重要

這份 issue 的意義遠超過「某個模型變難用」的層次,它觸及三個結構性問題。

第一,定價與實際行為脫鉤。 OpenAI 對 GPT-5.5 的官方定位是「用更少 token 完成更多任務,所以實際上比 GPT-5.4 更經濟」。但這個論述建立在「模型自主決定何時停止推理」的假設上。如果模型是被一個看不見的 token 邊界硬切,那用戶付的「推理 token 費用」其實有一部分是被截斷的思考成本——以為買到的是高效模型,實際拿到的是被截肢的模型。

第二,複雜任務的隱形失準。 多位 r/codex 用戶回報「xhigh 模式下高風險任務答錯率明顯上升」。當推理 token 被卡在 516 附近,模型的內部 chain-of-thought 還沒走到收斂就被迫中斷,輸出答案的正確率自然下降。對於依賴 Codex 處理複雜 refactor、debug、security review 的團隊,這等於是在不知情的情況下承擔了品質風險。

第三,OpenAI 至今沒有公開回應。 從 6 月 27 日 issue 開出到現在(7 月 5 日),GitHub issue 上沒有任何 OpenAI 維護者的官方回覆。對照 r/codex 開發者已經累積數十篇品質抱怨貼文,這種沉默在社群信任層面是個警訊。


數據解讀與質疑:516/1034/1552 是什麼?

幾位 Hacker News 留言者提出了相當有說服力的解讀:

516 = 512 + 4、1034 = 1024 + 10、1552 = 1536 + 16——這組數字不是隨機分布,而是帶著顯著的 2 的冪次結構(512、1024、1536 都是 512 的倍數)。這暗示某個底層排程器或路由層在每個「512 token 區段」結束時檢查一次狀態,並可能在某個檢查點決定截斷。

另一個解讀是「降級路由」:當系統偵測到某個 session 接近成本閾值,就自動把 GPT-5.5 切到某個輕量變體或更短的推理預算。這可以解釋為什麼 P90 在 5 月掉到 344——多數 session 在達到完整推理預算前就被降級。

但這份資料也有它的侷限:

  • 樣本來自 Codex 用戶自己的 token_count metadata,不是 OpenAI 內部日誌,所以無法區分「模型自願停止」和「系統強制截斷」
  • 沒有附上 prompt 內容與任務類型分佈,所以無法判斷是「任務本身就簡單到 516 就夠了」還是「被截斷」
  • 「恰好 516」這個 bin 的寬度是 ±0,如果寬一點(514-518)數字會完全不同——但 44.0% 跟 0.34% 的差距大到很難用「寬度」解釋掉

最後,作者本人也承認他沒有要證明「存在隱藏的 CoT 截斷」。他只是說「這個聚集現象看起來像是某種門檻化推理預算行為」。這個保留態度反而讓整份報告更可信。


開發者目前能做什麼?

issue 的「Ask」區段給出了具體的內部驗證步驟,但對外部用戶來說,目前的 workaround 很有限:

  1. 遇到 516 token 答錯就重試——r/codex 用戶實測發現,同一個 prompt 第二次送往往能拿到完整推理(這本身也支持「路由層而非模型層」假設)
  2. 暫時改用 GPT-5.4 或 gpt-5.3-codex——從模型級別資料看,這兩個沒有 516 聚集現象
  3. 避免在 high/xhigh 模式下跑高風險任務——直到 OpenAI 給出官方說明
  4. 在自己的 telemetry 裡加 reasoning_output_tokens 監控——如果大量回應卡在 516,視為品質下降的早期訊號

待觀察:OpenAI 是否會回應?

截至 2026 年 7 月 5 日,Issue #30364 在 GitHub 上仍然沒有任何 OpenAI 維護者的官方回覆。對照去年(2025)類似事件(被揭露的隱藏推理預算)OpenAI 是等到被 The Verge 報導後才承認,這次是否會走同一條路徑值得關注。

一旦 OpenAI 給出官方聲明,這份 issue 會是改寫 Codex 定價敘事的關鍵節點——它會決定「GPT-5.5 更經濟」這個行銷話語,到底是模型設計的自然結果,還是系統端的硬切機制。


參考來源

網友熱門留言 (5)

#1 Hacker News 用戶 (stnly) ▲ 247
If 516, 1034, 1552 are exactly 512+4, 1024+10, 1536+16 then this is almost certainly some kind of internal threshold boundary, not natural variance.
#2 Hacker News 用戶 (mhh__) ▲ 189
The model is reasoning for the full budget, then a separate routing layer is truncating the response at exactly 516 tokens. This matches what we saw with hidden rate limiters earlier this year.
#3 Hacker News 用戶 (tptacek) ▲ 156
Mean dropped from 268 → 168 tokens while exact-516 share jumped from 0.11% → 53.30%. That's not a degradation, that's a clamp.
#4 Reddit r/codex 用戶 ▲ 312
I've been experiencing serious quality degradation with GPT-5.5 xhigh/high. Am cancelling both now. Appreciate the wake-up call on OpenAI's hidden truncation.
#5 Reddit r/codex 用戶 (Issue #29353 原作者) ▲ 198
Correct answer is standalone 21; wrong answers clustering at 516, 1034, or 1552 reasoning tokens suggest you're affected. If a single response returns 516, retry is the only workaround.